행동 전에 비교하기: 장기 도구 사용 에이전트의 가치 추정
들어가며
대규모 언어 모델이 외부 도구를 사용해 복잡한 과제를 수행할 때는 다음에 무엇을 호출할지가 이후의 전체 경로를 바꿀 수 있습니다. 검색, 데이터 조회, 파일 조작, API 호출은 현재 상태를 수정하고, 다음 단계에서 사용할 수 있는 선택지와 필요한 판단을 바꿉니다. 따라서 에이전트는 당장의 행동이 그럴듯한지만 판단해서는 부족합니다. 해당 행동이 최종 과제 성공으로 이어질 가능성까지 실행 전에 추정해야 합니다.
논문 “Choosing Before Acting: Comparative Value Estimation for Long-Horizon Tool-Use Agents”는 이 문제를 Comparative Inference for Tool-use Agents, 즉 CITA로 다룹니다. 핵심 구성요소인 Comparative Inference Model, CIM은 같은 맥락에서 가능한 도구 호출들을 비교하고, 실제 실행에 앞서 다음 행동의 장기적 가치를 평가합니다.
핵심 내용
- 최종 보상만으로는 부족하다. 긴 도구 사용 궤적은 과제 마지막의 성공 또는 실패 신호에 의존하는 경우가 많습니다. 이 신호는 각각의 호출에서 멀리 떨어져 있기 때문에 어떤 행동이 결과에 기여했는지 파악하기 어렵습니다. CITA는 다음 단계에 대한 보다 세밀한 장기 가치 추정을 시도합니다.
- 독립적인 점수보다 비교가 중요하다. 로그에는 실제로 선택된 호출만 기록되며, 다른 도구를 골랐다면 어떤 결과가 나왔을지는 직접 관찰되지 않습니다. CITA는 동일한 상황에서 가능한 대안 호출을 비교하는 감독 신호를 구성해 어떤 선택이 성공을 더 잘 뒷받침하는지 학습합니다.
- 서로 다른 감독 신호를 결합한다. CIM은 관찰된 도구 행동, 베이지안 도구 그래프 시뮬레이터가 제공하는 확장 가능한 감독, LLM 기반 의미 비교 판단을 함께 사용합니다. 이를 통해 단일 로그 궤적만으로 얻기 어려운 반사실적 정보를 보완하려 합니다.
- 실행 전 의사결정을 돕는다. CIM은 후보 호출이 최종 성공에 기여할 가능성을 추정합니다. 에이전트는 이 결과를 사용해 다음 행동의 순위를 정하고, 언어 모델의 즉각적인 생성 선호에만 의존하지 않을 수 있습니다.
의미와 영향
CITA의 핵심 의의는 도구 사용 학습의 초점을 사후 평가에서 사전 비교로 확장했다는 점입니다. 각 도구 호출을 독립적인 분류 문제로 보지 않고, 행동이 상태를 바꾸며 이후의 선택지와 최종 결과에 영향을 미치는 과정으로 다룹니다. 반복적인 검색, 계획 수립, 외부 조작이 필요한 과제에서는 초반의 잘못된 선택이 뒤의 가능한 행동을 제한할 수 있으므로 이런 관점이 특히 중요합니다.
논문 초록에 따르면 CITA는 세 가지 도구 사용 벤치마크와 여러 기반 대규모 언어 모델에서 Tool F1과 과제 성공을 일관되게 개선했습니다. 추가 분석에서는 CIM이 도구 선택을 비교하는 데 사용할 수 있는 단계별 가치 추정도 학습한 것으로 제시됩니다. 다만 제공된 자료에는 구체적인 향상 폭이나 각 감독 신호의 상대적 기여가 포함되어 있지 않습니다. 따라서 세부 성능은 논문 본문의 실험 조건과 함께 확인해야 합니다. 그럼에도 방향은 분명합니다. 유능한 에이전트는 행동하는 방법뿐 아니라 행동하기 전에 각 선택이 어디로 이어질지 비교할 수 있어야 합니다.
출처: arXiv
댓글
로그인 상태 확인 중…
댓글 불러오는 중…