RRSI, AI 에이전트의 재귀적 자기개선에 정규화를 더하다
들어가며
대규모 언어 모델 기반 에이전트의 성능은 모델 자체만으로 결정되지 않는다. 프롬프트를 어떻게 구성하는지, 작업을 어떻게 나누는지, 어떤 시점에 도구를 호출하는지, 과거 정보를 어떻게 저장하는지, 긴 컨텍스트를 어떻게 관리하는지가 모두 결과에 영향을 준다. 이처럼 모델을 둘러싼 구성 요소를 에이전트 하니스라고 부른다. 최근에는 하니스의 구성 요소를 자동으로 제안하고 평가하는 방법이 등장하면서, 시스템 수준의 재귀적 자기개선이 연구되고 있다.
하지만 자동 진화에는 과적합 문제가 따른다. 진화에 사용한 작업의 형식이나 특정 벤치마크에서 유리한 도구 사용 패턴을 외우기만 해도 해당 분할의 점수는 오를 수 있다. 작업 분포가 바뀌면 이런 향상이 크게 줄거나 사라질 수 있다.
RRSI의 접근법
RRSI는 ‘Regularized Recursive Self-Improvement of Agent Harnesses’의 약자다. 이 방법은 고정된 기반 모델의 가중치를 직접 바꾸지 않고, 하니스 후보를 만드는 방식과 선택하는 방식에 정규화 원리를 적용한다. 목표는 특정 벤치마크에만 맞는 임시 수정이 아니라 여러 작업에 재사용할 수 있는 메커니즘을 남기는 것이다.
- 시간에 따라 변하는 편집 예산: 제안기는 하나의 후보에 묶을 수 있는 변경 수를 제한하고, 진화 과정에 따라 예산을 조정한다. 한 번에 너무 많은 수정이 들어가 원인을 파악하기 어려워지는 문제를 줄이려는 장치다.
- 미탐색 경로 장려: 과거 진화 이력을 활용해 아직 시도하지 않은 경로를 찾도록 유도한다. 같은 아이디어를 반복하는 탐색 루프를 피하는 데 목적이 있다.
- 비평기의 기준 특화 제안 필터링: 선택기에 포함된 critic은 특정 평가 벤치마크에 지나치게 맞춰진 제안을 걸러낸다.
- 가지치기기의 변경 정리: pruner는 효과가 너무 작거나 유지 비용이 높거나, 이후 변경으로 더 이상 유용하지 않은 수정 사항을 제거한다.
핵심은 하니스를 더 많이 바꾸는 것이 아니다. 변경의 가치와 관리 가능성, 다른 작업으로의 이전 가능성을 높이는 데 있다. 따라서 RRSI는 점수만 최대화하는 진화 루프에 탐색 다양성, 운영 비용, 재사용성이라는 기준을 함께 넣는다.
결과와 영향
제공된 초록에 따르면 RRSI는 코딩, 에이전트형 워크스페이스, 엔지니어링 설계 등을 포함한 8개 벤치마크에서 평가됐다. 진화에 사용한 분할에서는 최대 14.1점의 향상을 기록했고, 5개 분포 외 벤치마크에서는 최대 4.7점의 향상을 보였다. 두 수치의 차이는 의미가 있다. 전자는 대상 작업의 피드백을 활용하는 능력을, 후자는 그중 일부가 새로운 작업으로 이전될 가능성을 보여준다.
이 연구가 제시하는 중요한 관점은 재귀적 자기개선의 대상이 모델 파라미터에만 한정되지 않는다는 점이다. 모델 주변의 워크플로를 자동으로 발견하고 검증하며 불필요한 요소를 제거하는 능력도 에이전트 개발의 핵심 경쟁력이 될 수 있다.
다만 현재 제공된 자료는 주로 초록 수준이다. 상세한 실험 조건, 비교 기준, 소거 실험은 확인되지 않았으므로 비평기와 가지치기기, 편집 예산이 각각 얼마나 기여했는지는 논문 전문을 통해 추가로 검토해야 한다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…