아티클 목록으로
AI 에이전트

ASCENT, 장기 작업 에이전트의 배포 중 학습을 제안하다

약 3분 소요

배경

장기 작업을 수행하는 AI 에이전트는 한 번의 응답으로 문제를 해결하지 않는다. 여러 차례의 추론과 도구 호출, 환경 조작을 거친 뒤 작업이 끝났을 때 비로소 성공 또는 실패 검증 신호를 받는다. 실제 배포에서는 서로 관련된 작업이 연속적으로 들어오는 경우가 많기 때문에, 이전 작업의 실행 궤적은 이후 작업을 개선할 수 있는 자연스러운 학습 자원이 된다.

문제는 한 번의 시도에서 무엇을 학습해야 하는가다. 기존의 문맥 적응 방식은 반성, 메모리, 스킬을 텍스트로 저장하는 경우가 많다. 이 방식은 올바른 경험을 검색하는 능력과, 동결된 정책이 해당 내용을 정확히 실행하는 능력에 의존한다. 단일 실행에서 생성된 토큰을 그대로 모방하거나 결과에 따라 전부 강화하면, 잘못된 행동과 우연한 선택까지 학습될 수 있다. 장기적으로는 정책이 개선되기보다 불안정해질 가능성이 있다.

ASCENT의 접근법

ASCENT는 Agentic Self-distillation for Cross-task EvolutioN at Test-time의 약자로, 검증된 경험을 사후 정보가 포함된 자기 증류 목표로 바꾼다.

  • 작업을 한 번만 실행: 에이전트는 작업 스트림의 각 항목을 한 번 처리한다. 해당 실행 궤적과 종료 시점의 검증 결과가 지속적인 업데이트를 위한 유일한 학습 신호다.
  • 사후 관점을 제공: 모델의 초기 상태를 유지한 동결 사본이 검증된 전체 궤적을 읽는다. 이 사본은 실행 당시의 정책에는 없었던 결과 정보를 알고 있으므로, 궤적의 각 지점에서 다음 토큰 분포를 더 적절하게 예측할 수 있다.
  • LoRA로 업데이트: 이렇게 얻은 분포를 지속적인 LoRA 파라미터에 증류한다. 업데이트된 가중치는 이후 작업에 남지만, 첫 시도의 모든 행동을 정답으로 취급하지는 않는다.

연구진은 무효한 행동에 해당하는 턴을 제거해 더 효율적인 특권 경험을 만드는 과정도 제시한다. 외부의 정답 궤적이나 더 강력한 교사 모델을 사용하는 것이 아니라, 같은 모델의 안정적인 초기 복사본에 완료된 궤적과 검증 결과를 보여주는 것이 핵심이다.

결과와 의미

논문에 따르면 ASCENT는 ALFWorld와 WebShop에서 평가한 두 모델 규모 모두에서 기본 모델보다 정확한 성공률을 22포인트 이상 높였다. 에피소드당 필요한 턴 수도 줄었으며, 개선 효과는 보류된 미관측 장면으로도 이전됐다. 이는 테스트 시점 학습이 외부 참조 해답이나 강한 교사 없이도 에이전트 자신의 검증된 경험에서 유용한 신호를 얻을 수 있음을 보여준다.

ASCENT가 제시하는 더 큰 방향은 경험을 검색 가능한 텍스트로만 남기는 대신, 실제로 행동을 선택하는 정책 자체에 반영하는 것이다. 관련 작업을 반복적으로 처리하는 시스템에서는 메모리 검색에 대한 의존도를 낮출 수 있다. 다만 이 설정은 작업 종료 시 검증 신호를 필요로 하며, 단일 궤적에 기반한 업데이트는 여전히 잡음과 실패의 영향을 받을 수 있다. 더 희소하거나 지연된 피드백, 개방형 환경에서도 안정적으로 학습하는 방법은 향후 과제로 남는다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
도구 사용 에이전트는 왜 실패하는가: 증거에서 행동까지의 단절
AI 에이전트
cctest.ai
AI 에이전트

도구 사용 에이전트는 왜 실패하는가: 증거에서 행동까지의 단절

에이전트가 최종적으로 올바른 상태에 도달하더라도, 그 행동이 사전에 확보된 증거에 근거했다고 보기는 어렵습니다. SafeActBench 연구는 실행 전 조사와 의존성이 있는 다단계 작업에서 실패가 집중된다는 점을 보여줍니다.

더 보기
CCTest · Blog
프로액티브 에이전트에 필요한 것은 정확성만이 아니다
AI 에이전트
cctest.ai
AI 에이전트

프로액티브 에이전트에 필요한 것은 정확성만이 아니다

프로액티브 LLM 에이전트는 사용자가 요청하기 전에 유휴 연산을 활용해 필요한 지원을 준비한다. 새로운 연구는 작업 능력, 시간 배분, 신뢰를 3T 원칙으로 정리하고 장기 효과를 평가하는 Proactivity-Gym을 제안했다.

더 보기
CCTest · Blog
VeriHarness, 장기 작업을 위한 LLM 에이전트 검증 프레임워크
AI 에이전트
cctest.ai
AI 에이전트

VeriHarness, 장기 작업을 위한 LLM 에이전트 검증 프레임워크

VeriHarness는 테스트 시점에 정답이나 채점 기준이 없어도 장기 작업 에이전트의 결과를 검증하고 개선하는 프레임워크입니다. 여러 실행 결과의 불일치와 합의를 분석하고 환경 증거를 활용해 최종 산출물을 수정합니다.

더 보기