ASCENT, 장기 작업 에이전트의 배포 중 학습을 제안하다
배경
장기 작업을 수행하는 AI 에이전트는 한 번의 응답으로 문제를 해결하지 않는다. 여러 차례의 추론과 도구 호출, 환경 조작을 거친 뒤 작업이 끝났을 때 비로소 성공 또는 실패 검증 신호를 받는다. 실제 배포에서는 서로 관련된 작업이 연속적으로 들어오는 경우가 많기 때문에, 이전 작업의 실행 궤적은 이후 작업을 개선할 수 있는 자연스러운 학습 자원이 된다.
문제는 한 번의 시도에서 무엇을 학습해야 하는가다. 기존의 문맥 적응 방식은 반성, 메모리, 스킬을 텍스트로 저장하는 경우가 많다. 이 방식은 올바른 경험을 검색하는 능력과, 동결된 정책이 해당 내용을 정확히 실행하는 능력에 의존한다. 단일 실행에서 생성된 토큰을 그대로 모방하거나 결과에 따라 전부 강화하면, 잘못된 행동과 우연한 선택까지 학습될 수 있다. 장기적으로는 정책이 개선되기보다 불안정해질 가능성이 있다.
ASCENT의 접근법
ASCENT는 Agentic Self-distillation for Cross-task EvolutioN at Test-time의 약자로, 검증된 경험을 사후 정보가 포함된 자기 증류 목표로 바꾼다.
- 작업을 한 번만 실행: 에이전트는 작업 스트림의 각 항목을 한 번 처리한다. 해당 실행 궤적과 종료 시점의 검증 결과가 지속적인 업데이트를 위한 유일한 학습 신호다.
- 사후 관점을 제공: 모델의 초기 상태를 유지한 동결 사본이 검증된 전체 궤적을 읽는다. 이 사본은 실행 당시의 정책에는 없었던 결과 정보를 알고 있으므로, 궤적의 각 지점에서 다음 토큰 분포를 더 적절하게 예측할 수 있다.
- LoRA로 업데이트: 이렇게 얻은 분포를 지속적인 LoRA 파라미터에 증류한다. 업데이트된 가중치는 이후 작업에 남지만, 첫 시도의 모든 행동을 정답으로 취급하지는 않는다.
연구진은 무효한 행동에 해당하는 턴을 제거해 더 효율적인 특권 경험을 만드는 과정도 제시한다. 외부의 정답 궤적이나 더 강력한 교사 모델을 사용하는 것이 아니라, 같은 모델의 안정적인 초기 복사본에 완료된 궤적과 검증 결과를 보여주는 것이 핵심이다.
결과와 의미
논문에 따르면 ASCENT는 ALFWorld와 WebShop에서 평가한 두 모델 규모 모두에서 기본 모델보다 정확한 성공률을 22포인트 이상 높였다. 에피소드당 필요한 턴 수도 줄었으며, 개선 효과는 보류된 미관측 장면으로도 이전됐다. 이는 테스트 시점 학습이 외부 참조 해답이나 강한 교사 없이도 에이전트 자신의 검증된 경험에서 유용한 신호를 얻을 수 있음을 보여준다.
ASCENT가 제시하는 더 큰 방향은 경험을 검색 가능한 텍스트로만 남기는 대신, 실제로 행동을 선택하는 정책 자체에 반영하는 것이다. 관련 작업을 반복적으로 처리하는 시스템에서는 메모리 검색에 대한 의존도를 낮출 수 있다. 다만 이 설정은 작업 종료 시 검증 신호를 필요로 하며, 단일 궤적에 기반한 업데이트는 여전히 잡음과 실패의 영향을 받을 수 있다. 더 희소하거나 지연된 피드백, 개방형 환경에서도 안정적으로 학습하는 방법은 향후 과제로 남는다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…