Omni-Decision, 증거 원장으로 옴니모달 에이전트의 계획을 재설계하다
들어가며
옴니모달 에이전트는 하나의 질문에 답하기 위해 비디오를 보고, 오디오를 듣고, 웹을 검색하고, 계산 도구를 실행해야 할 수 있다. 이때 여러 모달리티를 인식하는 능력만으로는 충분하지 않다. 무엇이 확인됐는지, 어떤 정보가 부족한지, 다음에 무엇을 조사해야 하는지를 계속 관리하는 계획 능력이 필요하다.
논문 ‘Omni-Decision: Evidence-Ledger Planning for Omni-Modal Agents’는 이 문제를 계획의 병목으로 다룬다. 제안 방식은 모든 관찰 결과를 대화 기록에 계속 쌓는 대신, 작업의 현재 상태를 나타내는 명시적 ‘증거 원장’을 사용한다.
작동 방식
원장은 확인된 증거, 아직 확보하지 못한 증거, 서로 충돌하는 기록을 구분해 저장한다. 따라서 플래너는 과거의 긴 대화를 처음부터 다시 읽는 대신, 현재 조사 상황을 압축한 구조화된 상태를 참조할 수 있다.
비디오, 오디오, 웹페이지 또는 계산 도구에서 관찰 결과가 들어오면 비평기가 먼저 내용을 검토한다. 이후 실제로 활용할 수 있는 정보만 원장에 전달하고, 불필요한 내용은 버린다. 목적은 단순히 컨텍스트 길이를 줄이는 것이 아니라, 후속 의사결정에 필요한 정보만 남기는 것이다.
또한 각 실행 단계에서 상태, 행동, 판정 결과를 기록한다. 이렇게 수집한 궤적은 지도 미세조정과 의사결정 수준의 강화학습에 사용된다. 학습 목표는 멀티모달 내용을 인식하는 데 그치지 않고, 증거가 불완전하거나 서로 충돌할 때 다음 조사 행동을 선택하는 능력까지 포함한다.
실험이 보여주는 신호
백엔드 교체를 활용한 통제 실험에서 인식 백엔드를 교체했을 때보다 플래너를 교체했을 때 성능 하락이 더 크게 나타났다. 연구진은 이를 근거로 현재의 옴니모달 에이전트에서는 인식 모듈을 단순히 강화하는 것보다 증거를 정리하고 행동 순서를 정하는 능력이 더 중요한 병목일 수 있다고 설명한다.
논문이 보고한 성능은 OmniGAIA에서 정확도 81.4%, 질문당 비용은 Gemini-3.1-Pro의 약 43%다. 장시간 비디오 이해 벤치마크인 WorldSense에서는 65.0%를 기록해 가장 강력한 엔드투엔드 모델과 같은 수준이라고 제시한다. 다만 제공된 자료에는 세부적인 제거 실험 설계와 비용 산정 방식이 포함돼 있지 않으므로, 이 수치는 논문의 대표 결과로 해석하는 것이 적절하다.
의미와 과제
증거 원장 방식의 핵심 의미는 컨텍스트 관리를 명시적인 상태 관리 문제로 바꾼다는 데 있다. 장기 검색, 비디오 질의응답, 여러 도구를 사용하는 작업에서는 부족한 증거를 눈에 보이게 만들고, 과거의 잡음이 이후 판단을 방해할 가능성을 줄일 수 있다.
물론 원장의 품질은 비평기의 선별 능력에 좌우된다. 초기에 잘못된 판단이 압축된 상태에 남으면 이후 계획에도 영향을 줄 수 있다. 앞으로는 다양한 모달리티 조합, 더 긴 작업, 잘못된 관찰과 상충하는 기록에 대한 안정성을 추가로 검증해야 한다.
그럼에도 Omni-Decision은 옴니모달 에이전트의 발전 방향이 더 강한 인식 모델에만 있지 않다는 점을 보여준다. 신뢰할 수 있는 증거 정리와 의사결정 구조 역시 장기적인 에이전트 성능을 좌우하는 핵심 요소가 될 수 있다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…