아티클 목록으로
AI 에이전트

Marathoner: 초장기 실행 능력을 학습하는 AI 에이전트

약 3분 소요

서론

최근 AI 에이전트는 도구 호출, 코드 작성, 짧은 다단계 작업에서 상당한 성능을 보인다. 하지만 목표 달성까지 수시간의 계획과 실행이 필요한 과제에서는 문제가 달라진다. 에이전트가 원래 목표에서 벗어나거나 실패한 행동을 반복하고, 작업 후반에 의미 있는 진행을 멈추는 경우가 있기 때문이다. Ant Group 연구진이 제안한 Marathoner는 바로 이 초장기 실행 능력을 높이는 데 초점을 맞춘다.

핵심 접근법

Marathoner는 새로운 모델 구조라기보다 장시간 작업에 맞춘 포스트트레이닝 파이프라인이다.

  • 대규모 소프트웨어 변경에서 과제 생성. 연구진은 GitHub 주요 릴리스 PR 가운데 1,000줄을 초과하는 신규 코드가 포함된 사례를 활용한다. 단순 코딩 문제보다 긴 의존 관계, 중간 실패, 구체적인 최종 목표를 포함하기 쉽다는 점을 이용한 것이다.
  • 다중 과제 연결. 여러 생성 과제를 하나의 연속된 과제로 묶어 실행 길이와 난도를 높인다. 이를 통해 매우 어려운 수준의 훈련 데이터를 만들고자 한다.
  • 거부 샘플링 미세조정. 강력한 교사 모델과 다양한 실행 하네스를 사용해 후보 실행 궤적을 생성한 뒤, 유효한 궤적을 선택해 기반 모델을 지도학습 방식으로 미세조정한다.
  • 샌드박스 기반 강화학습. 초기 학습을 마친 모델은 독립된 환경에서 실제로 과제를 수행한다. 이 과정은 정적인 답변 모방을 넘어 도구 사용, 상태 변화, 오류 복구를 학습하게 한다.
  • 실행 후반 보상. Later Stage Bonus Reward는 작업 후반에도 유의미한 행동을 계속하도록 장려한다. 긴 실행의 초반에는 적극적이지만 후반에 정체되는 문제를 직접 겨냥한 방식이다.

결과와 의미

논문은 초장기 과제를 포함한 5개 벤치마크에서 Marathoner를 평가했으며, 기반 모델 대비 일관되고 상당한 성능 향상을 보고한다. 비교에 사용된 강력한 proprietary model보다 높은 성능을 보였다는 주장도 제시한다. 추가 분석에 따르면 고난도 과제에서 10시간 이상 작업하고 1,000회 이상의 도구 호출을 수행할 수 있다. 다만 제공된 자료에는 벤치마크 이름, 세부 점수, 비교 모델의 전체 설정이 포함되어 있지 않으므로, 최종 판단을 위해서는 원문과 재현 실험을 확인해야 한다.

이 연구의 중요한 점은 ‘지속성’을 에이전트가 학습하고 평가할 수 있는 능력으로 구체화하려 했다는 데 있다. 대규모 코드 변경은 긴 의존 관계와 명확한 종료 조건을 가진 현실적인 과제의 원천이 된다. 샌드박스 롤아웃은 텍스트 중심 학습을 동적인 실행 환경으로 확장하며, 후반 보상은 장기 작업에서 발생하는 단계적 성능 저하를 겨냥한다.

물론 오래 실행한다고 해서 곧바로 깊은 이해나 신뢰할 수 있는 자율성이 확보되는 것은 아니다. 초기 오류가 긴 궤적 전체로 확대될 수 있고, 추론 비용과 상태 관리, 최종 결과 검증도 새로운 부담이 된다. 따라서 Marathoner는 범용 자율지능의 최종 증거라기보다, 장기 실행형 에이전트를 훈련하는 유망한 방향으로 보는 것이 적절하다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Raven: 진화하는 에이전트 하니스를 조합하는 시스템
AI 에이전트
cctest.ai
AI 에이전트

Raven: 진화하는 에이전트 하니스를 조합하는 시스템

Raven은 모델과 도메인별 전용 에이전트 하니스를 자동으로 만들고 개선한 뒤 서로 조합하는 ‘하니스의 하니스’를 제안합니다. 장기·跨도메인 작업을 단일 에이전트가 아닌 모듈형 협업 문제로 재정의하려는 접근입니다.

더 보기
CCTest · Blog
LongCat-DeepResearch가 제시한 협업형 멀티에이전트 연구 워크플로
AI 에이전트
cctest.ai
AI 에이전트

LongCat-DeepResearch가 제시한 협업형 멀티에이전트 연구 워크플로

LongCat-DeepResearch는 개선된 LongCat 모델과 멀티에이전트 워크플로를 결합해 근거 기반 연구 보고서 생성을 시도한다. 여러 평가에서 높은 성과를 보였지만, 계획을 더 추가한다고 항상 품질이 향상되는 것은 아니라는 점도 확인됐다.

더 보기
CCTest · Blog
HybridCUA, GUI와 CLI를 오가는 컴퓨터 사용 에이전트 학습
AI 에이전트
cctest.ai
AI 에이전트

HybridCUA, GUI와 CLI를 오가는 컴퓨터 사용 에이전트 학습

HybridCUA는 그래픽 인터페이스와 명령줄을 함께 사용하고, 작업에 따라 두 방식을 조율하는 컴퓨터 사용 에이전트 학습 방법을 제안한다. 9B 모델은 OSWorld에서 53.6%의 정확도를 기록해 기본 모델보다 14.8%포인트 향상됐다.

더 보기