기억을 넘어: PoS가 장기 과업 에이전트에 명시적 신념 상태를 제공하다
들어가며
장기 과업을 수행하는 에이전트에게 필요한 것은 과거 상호작용을 저장하는 일만이 아닙니다. 대화와 행동이 길어질수록 에이전트는 현재 세계가 어떤 상태인지, 아직 확인되지 않은 정보가 무엇인지, 다음 행동이 목표에 실제로 기여하는지를 계속 추적해야 합니다. 기록을 그대로 보존하거나 압축하는 방식만으로는 의사결정에 사용할 수 있는 일관된 이해를 보장하기 어렵습니다.
이 논문은 **PoS(Progression of States)**라는 추론 시점 프레임워크를 제안합니다. PoS는 컨텍스트 관리를 단순한 기록 보관이 아니라 신념의 지속적인 유지 문제로 다룹니다. 에이전트는 다음 행동을 결정할 때 명시적으로 구성된 신념 상태를 활용합니다.
PoS의 주요 구성
- 세계 상태와 과업 요구를 함께 표현. 하나의 신념에는 현재 세계에 대한 추정, 아직 해결되지 않은 정보, 남아 있는 과업 요구사항이 포함됩니다. 이를 통해 에이전트는 현재 상황뿐 아니라 앞으로 학습하거나 달성해야 할 것도 분명히 나타낼 수 있습니다.
- 신념 업데이트 검증. 환경과 상호작용한 뒤 PoS는 갱신된 신념이 서로 모순되지 않는지, 이용 가능한 증거로 뒷받침되는지를 점검합니다. 근거 없는 추론이 사실처럼 굳어지는 것을 막기 위한 절차입니다.
- 실질적인 진전 감시. 에이전트가 그럴듯한 행동을 계속하더라도 목표에 가까워지지 않을 수 있습니다. 논문은 이러한 실패 양상을 Belief Trapping이라고 부릅니다.
- 상황별 회복. PoS는 정체, 반복되는 순환, 목표에서 벗어나는 이탈 등의 패턴을 구분합니다. 동시에 어떤 미해결 요구사항이 과업을 막고 있는지 파악한 뒤, 해당 상황에 맞는 회복 제약을 구성해 같은 행동의 반복을 피하도록 합니다.
실험 결과와 의미
평가는 과업 실행과 증거 탐색형 진단을 포괄하는 네 가지 벤치마크에서 수행됐으며, 세 가지 LLM 백본이 사용됐습니다. PoS는 12개의 벤치마크-백본 조합 모두에서 가장 높은 종합 성능을 기록했습니다. 동일한 백본을 사용하는 최강 기준선과 비교했을 때 보고된 상대적 향상 폭은 ALFWorld에서 최대 22.68%, RCA-100 joint accuracy에서 37.89%였습니다. 제거 실험은 일관성 검증과 회복 메커니즘이 모두 중요하다는 점을 보여줬고, 컨텍스트 확장 실험은 입력 맥락이 커져도 PoS가 견고함을 유지함을 시사했습니다.
이 연구의 핵심 의미는 에이전트 메모리의 목표를 다시 정의했다는 데 있습니다. 중요한 것은 가능한 한 많은 이력을 저장하는 것이 아니라, 점검하고 수정하며 의사결정에 활용할 수 있는 현재의 신념을 유지하는 일입니다. 다단계 계획, 환경 상호작용, 진단을 위한 증거 수집이 필요한 시스템에 특히 관련성이 큽니다. 다만 제공된 소재는 주로 벤치마크 결과를 다루므로, 신념 품질이 기반 모델의 추론 능력에 얼마나 의존하는지와 더 개방적인 환경에서의 성능은 추가 검증이 필요합니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…