아티클 목록으로
AI 에이전트

AREX-2: 장기 반성과 반복 실행으로 발전하는 AI 에이전트

약 3분 소요

한 번의 답변에서 지속적인 개선으로

대규모 언어 모델 에이전트는 그럴듯한 답을 생성할 수 있지만, 결과를 검토하고 피드백을 반영해 여러 차례 개선하는 일에는 약점을 보일 수 있다. AREX-2는 바로 이 지점을 겨냥한다. 이 연구에서 말하는 자기개선은 테스트 시점에 현재 해답을 반복적으로 다듬어 처음보다 더 나은 결과를 만들어내는 능력이다.

연구진은 이 능력을 서로 보완하는 두 요소로 나눈다.

  • 반성: 현재 해답의 문제를 파악하고 더 나은 수정안을 만드는 능력
  • 장기 실행: 여러 라운드 동안 목표와 이전 결과를 유지하며 개선을 실제 행동으로 이어가는 능력

반성만으로는 개선안을 제시하고도 실행을 끝내지 못할 수 있다. 반대로 장기 실행만 있으면 같은 작업을 반복하는 데 그칠 수 있다. AREX-2의 가설은 이 두 능력에 도메인을 넘어 학습할 수 있는 부분이 있으며, 더 명확한 감독 신호를 제공하는 과제에서 학습할 수 있다는 것이다.

검증 가능한 피드백으로 장기 궤적 구성

훈련 데이터는 머신러닝과 알고리즘 프로그래밍 과제에서 합성한 장기 개선 궤적으로 구성된다. 이러한 영역은 결과를 비교적 명확하게 평가할 수 있어, 단순한 최종 답변이 아니라 시도, 실행, 평가, 오류 발견, 재수정의 과정을 기록하기에 적합하다.

Qwen3.8-27B를 기반으로 한 에이전트는 MLE-bench Lite에서 81.8점, Frontier-CS에서 70.7점을 기록했다. 딥 리서치 관련 평가에서도 BrowseComp 84.0, HLE 52.6, GAIA 92.2, DeepSearchQA 93.8을 달성했다. 이는 기술 과제에서 학습한 장기 개선 행동이 적어도 보고된 벤치마크에서는 연구·검색 과제로 전이될 수 있음을 보여준다. 초록에 따르면 사용 가능한 반복 라운드 수를 늘릴수록 성능도 계속 향상됐다.

의미와 남은 질문

AREX-2는 단순히 모델 규모를 키우는 것과 다른 학습 경로를 제안한다. 첫 답변의 품질만 최적화하는 대신, 검증과 수정이 이어지는 문제 해결 과정 자체를 학습 대상으로 삼는 방식이다. 실험, 디버깅, 검증, 재설계가 필요한 업무에서는 이런 능력이 특히 중요할 수 있다.

다만 현재 제공된 자료만으로는 궤적 합성의 세부 방식, 비교 실험, 장기 추론 비용, 라운드별 개선 곡선을 확인할 수 없다. 성능 향상이 반성 데이터에서 비롯됐는지, 장기 실행 훈련에서 비롯됐는지, 또는 두 요소의 결합 효과인지는 논문 전문과 코드 검토가 필요하다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
X-Tree: 재사용 가능한 경험을 AI 에이전트 학습에 넣다
AI 에이전트
cctest.ai
AI 에이전트

X-Tree: 재사용 가능한 경험을 AI 에이전트 학습에 넣다

X-Tree는 에이전트 궤적에서 반복적으로 등장하고 성공과 관련된 행동 구간을 자동으로 찾아 재사용 가능한 경험 트리로 구성합니다. 추가적인 LLM 호출 없이 오프라인 강화학습, RLVR, 자기 증류에 활용할 수 있습니다.

더 보기
CCTest · Blog
LLM 에이전트는 왜 철회된 사용자 지시를 계속 따를까
AI 에이전트
cctest.ai
AI 에이전트

LLM 에이전트는 왜 철회된 사용자 지시를 계속 따를까

새 연구는 사용자가 바꾸거나 철회한 요구사항이 최종 답변과 도구 실행에 계속 영향을 미치는 현상을 측정 가능한 ‘의도 드리프트’로 정의했다. IntentFlux와 StateForge 평가 결과, 명시적인 상태 관리는 도움이 되지만 단일 턴 수준을 완전히 회복하지는 못했다.

더 보기
CCTest · Blog
검색 에이전트의 ‘상호 부정행위’: CrossFit이 자가 진화 오류를 줄이는 방법
AI 에이전트
cctest.ai
AI 에이전트

검색 에이전트의 ‘상호 부정행위’: CrossFit이 자가 진화 오류를 줄이는 방법

자가 진화 검색 에이전트는 서로의 같은 오류를 정답처럼 강화해 내부 보상만 높일 수 있다. CrossFit은 학습 데이터와 평가 경로의 출처를 분리해 이런 피드백 고리를 약화한다.

더 보기