아티클 목록으로
AI 에이전트

RRSI, AI 에이전트의 재귀적 자기개선에 정규화를 더하다

약 3분 소요

들어가며

대규모 언어 모델 기반 에이전트의 성능은 모델 자체만으로 결정되지 않는다. 프롬프트를 어떻게 구성하는지, 작업을 어떻게 나누는지, 어떤 시점에 도구를 호출하는지, 과거 정보를 어떻게 저장하는지, 긴 컨텍스트를 어떻게 관리하는지가 모두 결과에 영향을 준다. 이처럼 모델을 둘러싼 구성 요소를 에이전트 하니스라고 부른다. 최근에는 하니스의 구성 요소를 자동으로 제안하고 평가하는 방법이 등장하면서, 시스템 수준의 재귀적 자기개선이 연구되고 있다.

하지만 자동 진화에는 과적합 문제가 따른다. 진화에 사용한 작업의 형식이나 특정 벤치마크에서 유리한 도구 사용 패턴을 외우기만 해도 해당 분할의 점수는 오를 수 있다. 작업 분포가 바뀌면 이런 향상이 크게 줄거나 사라질 수 있다.

RRSI의 접근법

RRSI는 ‘Regularized Recursive Self-Improvement of Agent Harnesses’의 약자다. 이 방법은 고정된 기반 모델의 가중치를 직접 바꾸지 않고, 하니스 후보를 만드는 방식과 선택하는 방식에 정규화 원리를 적용한다. 목표는 특정 벤치마크에만 맞는 임시 수정이 아니라 여러 작업에 재사용할 수 있는 메커니즘을 남기는 것이다.

  • 시간에 따라 변하는 편집 예산: 제안기는 하나의 후보에 묶을 수 있는 변경 수를 제한하고, 진화 과정에 따라 예산을 조정한다. 한 번에 너무 많은 수정이 들어가 원인을 파악하기 어려워지는 문제를 줄이려는 장치다.
  • 미탐색 경로 장려: 과거 진화 이력을 활용해 아직 시도하지 않은 경로를 찾도록 유도한다. 같은 아이디어를 반복하는 탐색 루프를 피하는 데 목적이 있다.
  • 비평기의 기준 특화 제안 필터링: 선택기에 포함된 critic은 특정 평가 벤치마크에 지나치게 맞춰진 제안을 걸러낸다.
  • 가지치기기의 변경 정리: pruner는 효과가 너무 작거나 유지 비용이 높거나, 이후 변경으로 더 이상 유용하지 않은 수정 사항을 제거한다.

핵심은 하니스를 더 많이 바꾸는 것이 아니다. 변경의 가치와 관리 가능성, 다른 작업으로의 이전 가능성을 높이는 데 있다. 따라서 RRSI는 점수만 최대화하는 진화 루프에 탐색 다양성, 운영 비용, 재사용성이라는 기준을 함께 넣는다.

결과와 영향

제공된 초록에 따르면 RRSI는 코딩, 에이전트형 워크스페이스, 엔지니어링 설계 등을 포함한 8개 벤치마크에서 평가됐다. 진화에 사용한 분할에서는 최대 14.1점의 향상을 기록했고, 5개 분포 외 벤치마크에서는 최대 4.7점의 향상을 보였다. 두 수치의 차이는 의미가 있다. 전자는 대상 작업의 피드백을 활용하는 능력을, 후자는 그중 일부가 새로운 작업으로 이전될 가능성을 보여준다.

이 연구가 제시하는 중요한 관점은 재귀적 자기개선의 대상이 모델 파라미터에만 한정되지 않는다는 점이다. 모델 주변의 워크플로를 자동으로 발견하고 검증하며 불필요한 요소를 제거하는 능력도 에이전트 개발의 핵심 경쟁력이 될 수 있다.

다만 현재 제공된 자료는 주로 초록 수준이다. 상세한 실험 조건, 비교 기준, 소거 실험은 확인되지 않았으므로 비평기와 가지치기기, 편집 예산이 각각 얼마나 기여했는지는 논문 전문을 통해 추가로 검토해야 한다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
VHD-Play, 해를 구한 메커니즘으로 검증 가능한 에이전트 RL 환경 생성
AI 에이전트
cctest.ai
AI 에이전트

VHD-Play, 해를 구한 메커니즘으로 검증 가능한 에이전트 RL 환경 생성

VHD-Play는 환경을 먼저 만들고 평가 규칙을 나중에 붙이는 대신, 해를 구한 수학적 메커니즘을 바탕으로 에이전트 환경을 생성하는 방법을 제안합니다. 상태 변화와 숨겨진 매개변수, 지연된 결과를 포함한 장기 상호작용 학습을 지원합니다.

더 보기
CCTest · Blog
Agensh, 중앙 조정자 없이 1,024개 에이전트의 자율 협업 확장
AI 에이전트
cctest.ai
AI 에이전트

Agensh, 중앙 조정자 없이 1,024개 에이전트의 자율 협업 확장

Agensh는 중앙 오케스트레이터 대신 에이전트들이 직접 작업을 맡고, 발견을 공유하며, 결과를 검증하고 통합하는 멀티에이전트 구조를 제안한다. ProgramBench 실험에서는 에이전트 규모가 커질수록 테스트 통과율이 높아졌다.

더 보기