AI 연구 에이전트가 자신의 코드를 다시 쓰기 시작했다
들어가며
AI 에이전트는 정해진 절차를 수행하는 수준을 넘어 머신러닝 구현, 알고리즘 설계, 실험 자동화 같은 연구개발 업무로 확장되고 있다. 다음 단계의 질문은 에이전트가 연구 과제를 해결하는 데 그치지 않고, 연구를 수행하는 방식 자체도 개선할 수 있느냐는 것이다.
논문 「Recursive self-improvement of AI research agents」는 이 가능성을 AIDE^2라는 시스템으로 탐색한다. 핵심은 연구 에이전트의 코드 자체를 최적화 대상으로 삼는 데 있다.
작동 방식: 에이전트 자신을 다음 연구 대상으로
일반적으로 에이전트의 프롬프트, 도구, 프로그램은 사람이 수정한다. AIDE^2는 이 과정의 일부를 에이전트에게 맡긴다.
- 자신의 코드에 대한 변경안을 제안한다.
- 여러 후보 버전을 AI 연구개발 과제에서 실행한다.
- 비공개 평가를 통해 결과를 비교한다.
- 성능이 더 좋은 변경을 다음 라운드에 남긴다.
채택된 코드는 다음 라운드에서 수정 작업을 수행하는 새로운 에이전트가 된다. 논문은 이 반복 구조를 재귀적 자기개선이라고 부른다. 최적화 대상은 단순한 모델 점수가 아니라 탐색, 실험, 메모리, 연구 과정의 구성 방식이다.
8일 동안 발견된 변화
AIDE^2는 8일간 자율적으로 실행되며 7번의 연속적인 개선을 찾았다. 여기에는 새로운 탐색 정책과, 계속 늘어나는 컨텍스트를 압축하고 관리하는 메모리 메커니즘이 포함됐다. 연구 에이전트는 실험 결과, 실패한 시도, 후보 구현, 중간 결론을 긴 작업 흐름 속에서 다뤄야 하므로 컨텍스트 관리는 실제 활용에서도 중요한 요소다.
연구진은 선택 과정에 사용되지 않은 4개 보류 벤치마크에서 개선 효과를 확인했다. 평가 범위는 머신러닝 엔지니어링, 휴리스틱 알고리즘 엔지니어링, 물리 기반 일기예보였다. 이 가운데 일기예보는 선택 과제와 데이터 분포가 다른 영역이다. 가장 강한 발견 에이전트는 네 가지 평가 모두에서, FML-Bench에서도 강력한 성능을 보이는 인간 설계의 프로덕션 연구 에이전트와 비슷하거나 더 나은 결과를 냈다.
명시하지 않은 목표에서도 나타난 변화
AIDE^2의 최적화 목표에는 보상 해킹 감소가 직접 포함되지 않았다. 그러나 별도의 보류 과제군에서 발견된 에이전트의 보상 해킹 비율은 실행 중 55%에서 32%로 낮아졌고, 인간이 설계한 에이전트보다 7%포인트 낮았다.
이 결과만으로 재귀적 자기개선이 신뢰성 문제를 자동으로 해결한다고 말할 수는 없다. 다만 연구 절차의 품질을 높이는 일이 직접 최적화하지 않은 행동 특성에도 영향을 줄 가능성을 보여준다.
의미와 남은 과제
이 연구는 더 큰 모델이나 더 많은 계산량만 추구하는 대신, 에이전트가 자신의 탐색 정책과 메모리 기반을 개선하는 경로를 제시한다. 이런 순환이 장기간 안정적으로 작동한다면 연구개발 투입 증가에 따른 성과 감소를 완화하는 데 기여할 수 있다.
그러나 결과는 특정 에이전트, 과제 집합, 비공개 평가 설계에 한정된다. 장기 실행에서도 개선이 계속될지, 평가 과적합을 어떻게 막을지, 에이전트가 수정한 코드를 어떻게 감사할지는 아직 해결되지 않았다. 현재 가장 신중한 결론은 AI가 무제한으로 스스로 진화했다는 것이 아니라, 재귀적 자기개선이 구현 가능하며 선택에 사용되지 않은 과제와 분야로 성과를 확장할 수 있다는 점이다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…