작은대학교

대학원 브리핑

에이전트 스스로 연구 루프를 키워 토큰을 반으로 줄이다

무엇을 한 연구인가

코딩 에이전트가 사람의 감독 없이 장시간 스스로 돌아가는 상황을 전제로, 연구진은 에이전트를 감싸는 '하네스' 계층 자체를 자동 탐색 대상으로 삼았습니다. 여러 환경에서 자동 연구 루프를 재귀적으로 확장해 하네스 롤아웃을 대량 생성하고, 그중 살아남는 개선책을 골라 하나의 하네스로 묶는 방식입니다. 최종 산출물이 SoL-Pi이며, 평가는 51개 과제로 구성된 EdgeBench에서 이루어졌습니다. [출처: arXiv:2609.20519v1]

초록이 말하는 것 전부

이 연구가 출발한 문제는 코딩 에이전트의 역할 변화입니다. 예전처럼 사람이 옆에서 지켜보며 코드 완성을 도와주는 단계에서 벗어나, 감독 없이 24시간 탐색하고 도구를 쓰고 피드백을 받는 단계로 넘어가면 에이전트의 작업은 짧은 예측 하나가 아니라 추론·도구 사용·피드백이 길게 이어지는 궤적이 됩니다. 그렇게 되면 토큰을 얼마나 효율적으로 쓰는지가 재귀적 자기개선을 확장하는 데 결정적인 병목이 됩니다. 연구진은 이 병목을 모델 내부가 아니라 모델을 둘러싼 하네스 계층에서 풀어 보려 합니다. 재귀적 자기개선(RSI)에서 착안한 접근으로, 자동 연구 루프를 점점 더 많고 다양한 환경에 걸쳐 확장해 하네스 롤아웃을 만들어 냅니다. 이렇게 규모를 키우면 개선책이 개발 당시의 특정 환경에만 갇히지 않고 다른 설정으로도 옮겨 가는 재사용 가능한 형태로 나온다고 주장합니다. 즉 자동화된 하네스 발견이 연구실 수준을 넘어 실제 운영 수준의 결과로 나아간다는 것입니다. 이 과정에서 선택을 통과해 살아남은 기법은 네 가지이며, 각각 행동 실행, 문맥 압축, 관찰 처리, 위임 읽기라는 서로 다른 층위를 담당합니다. 이 네 가지가 모여 SoL-Pi라는 하나의 하네스를 이룹니다. [출처: arXiv:2609.20519v1]

결과

평가셋은 51개 과제로 구성된 EdgeBench입니다. 비교 대상은 Pi이며, GPT-5.6 Sol과 Opus 5 두 모델 위에서 SoL-Pi는 Pi와 비슷한 수준의 성능을 냈습니다. 이때 기록된 토큰 트래픽은 44.7~49.0% 줄었고, API 비용은 약 3분의 1로 감소했습니다. 비용 절감을 시간당 금액으로 환산하면 네이티브 Codex 및 Claude Code 하네스 대비 8.75~13.50달러, Pi 대비 4.36~5.71달러입니다. [출처: arXiv:2609.20519v1]

우리가 해석한다

이 논문의 진짜 무게는 성능이 아니라 '무엇을 최적화 대상으로 삼았는가'에 있습니다. 모델 가중치를 건드리지 않고, 모델을 감싸는 실행·압축·관찰·읽기 규칙만 손봐서 토큰을 절반 가까이 줄였다는 것은, 에이전트 운영비의 상당 부분이 모델 지능이 아니라 하네스 설계에서 새고 있다는 주장입니다. [연결] 실무적으로는 같은 모델을 쓰면서도 비용 구조를 바꿀 수 있는 여지가 생긴다는 뜻이고, 특히 상시 구동형 에이전트를 돌리는 팀에게는 모델 교체보다 하네스 교체가 먼저 검토할 카드가 됩니다. [연결] 또한 '네 가지 기법이 선택을 통과했다'는 서술은, 자동 탐색이 만들어 낸 후보 중 대부분이 버려졌음을 시사합니다. 즉 이 논문은 결과물만이 아니라 탐색 자체를 방법론으로 제시하는 셈이고, 하네스 설계를 사람의 직관이 아니라 반복 실험의 산물로 다루는 흐름에 속합니다. [연결] 다만 '재사용 가능하다'는 주장은 개발 환경을 벗어난 전이를 뜻하므로, 전이의 범위가 어디까지인지는 별도로 확인해야 할 지점입니다. [출처: arXiv:2609.20519v1]

이 논문으로 말할 수 없는 것

이 논문은 EdgeBench 51개 과제, 두 모델(GPT-5.6 Sol, Opus 5), 그리고 Pi·Codex·Claude Code라는 특정 비교군 위에서만 측정되었습니다. 따라서 다른 벤치마크나 다른 모델 계열에서도 같은 절감률이 나오는지는 이 논문으로 말할 수 없습니다. 벤치마크 점수가 비슷하다는 것은 실제 코딩 능력이 동등하다는 뜻이 아니며, 토큰 절감이 곧 사용자 만족이나 과제 성공률 향상을 의미하지도 않습니다. 비용 수치는 특정 시점의 API 단가 가정에 묶여 있어 단가가 바뀌면 환산 금액도 흔들립니다. 무엇보다 이 글은 arXiv 사전출판본으로 동료심사를 거쳤는지 밝히지 않았습니다. [출처: arXiv:2609.20519v1]

남는 물음

에이전트가 스스로 자기 하네스를 고쳐 나가는 루프에서, 그 개선이 '정말 더 나은 사고'인지 '평가셋에 맞춰진 절약 습관'인지는 누가 어떻게 구분할 수 있을까요?

260920_10

← 대학원으로