AREX-2: 장기 반성과 반복 실행으로 발전하는 AI 에이전트
한 번의 답변에서 지속적인 개선으로
대규모 언어 모델 에이전트는 그럴듯한 답을 생성할 수 있지만, 결과를 검토하고 피드백을 반영해 여러 차례 개선하는 일에는 약점을 보일 수 있다. AREX-2는 바로 이 지점을 겨냥한다. 이 연구에서 말하는 자기개선은 테스트 시점에 현재 해답을 반복적으로 다듬어 처음보다 더 나은 결과를 만들어내는 능력이다.
연구진은 이 능력을 서로 보완하는 두 요소로 나눈다.
- 반성: 현재 해답의 문제를 파악하고 더 나은 수정안을 만드는 능력
- 장기 실행: 여러 라운드 동안 목표와 이전 결과를 유지하며 개선을 실제 행동으로 이어가는 능력
반성만으로는 개선안을 제시하고도 실행을 끝내지 못할 수 있다. 반대로 장기 실행만 있으면 같은 작업을 반복하는 데 그칠 수 있다. AREX-2의 가설은 이 두 능력에 도메인을 넘어 학습할 수 있는 부분이 있으며, 더 명확한 감독 신호를 제공하는 과제에서 학습할 수 있다는 것이다.
검증 가능한 피드백으로 장기 궤적 구성
훈련 데이터는 머신러닝과 알고리즘 프로그래밍 과제에서 합성한 장기 개선 궤적으로 구성된다. 이러한 영역은 결과를 비교적 명확하게 평가할 수 있어, 단순한 최종 답변이 아니라 시도, 실행, 평가, 오류 발견, 재수정의 과정을 기록하기에 적합하다.
Qwen3.8-27B를 기반으로 한 에이전트는 MLE-bench Lite에서 81.8점, Frontier-CS에서 70.7점을 기록했다. 딥 리서치 관련 평가에서도 BrowseComp 84.0, HLE 52.6, GAIA 92.2, DeepSearchQA 93.8을 달성했다. 이는 기술 과제에서 학습한 장기 개선 행동이 적어도 보고된 벤치마크에서는 연구·검색 과제로 전이될 수 있음을 보여준다. 초록에 따르면 사용 가능한 반복 라운드 수를 늘릴수록 성능도 계속 향상됐다.
의미와 남은 질문
AREX-2는 단순히 모델 규모를 키우는 것과 다른 학습 경로를 제안한다. 첫 답변의 품질만 최적화하는 대신, 검증과 수정이 이어지는 문제 해결 과정 자체를 학습 대상으로 삼는 방식이다. 실험, 디버깅, 검증, 재설계가 필요한 업무에서는 이런 능력이 특히 중요할 수 있다.
다만 현재 제공된 자료만으로는 궤적 합성의 세부 방식, 비교 실험, 장기 추론 비용, 라운드별 개선 곡선을 확인할 수 없다. 성능 향상이 반성 데이터에서 비롯됐는지, 장기 실행 훈련에서 비롯됐는지, 또는 두 요소의 결합 효과인지는 논문 전문과 코드 검토가 필요하다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…