Omni-Decision、証拠台帳でオムニモーダルエージェントの計画を再設計
導入
オムニモーダルエージェントは、動画を見て、音声を聞き、ウェブを検索し、計算ツールを使いながら一つの質問に答えなければならない場合がある。こうしたタスクでは、複数のモダリティを扱えることだけでは十分ではない。何が確認済みで、何が不足し、次にどの情報を調べるべきかを維持する計画能力が必要になる。
論文「Omni-Decision: Evidence-Ledger Planning for Omni-Modal Agents」は、この問題をエージェントの計画の課題として捉える。提案手法は、すべての観測を長い対話履歴へ蓄積する代わりに、タスクの状態を表す明示的な「証拠台帳」を導入する。
手法のポイント
台帳には、確認された証拠、まだ不足している証拠、記録間で食い違っている情報が記載される。プランナーは過去のやり取りを最初から読み直すのではなく、現在の調査状況を整理したコンパクトな状態を参照できる。
知覚モジュールが動画、音声、ウェブページ、計算ツールから観測結果を返すと、批評器がその内容を確認する。利用価値のある情報だけが台帳へ渡され、不要な内容は破棄される。これは単なるコンテキスト短縮ではなく、次の判断に必要な情報を残すための選別である。
さらに、各ステップの状態、行動、判定を軌跡として記録する。これらのデータを使って教師あり微調整と意思決定レベルの強化学習を行い、マルチモーダル情報の認識だけでなく、不完全または矛盾した証拠を前提に次の行動を選ぶ能力も改善する。
実験が示すこと
バックエンドを置き換える制御実験では、知覚バックエンドを変更した場合よりも、プランナーを変更した場合の性能低下が大きかった。著者らはこの結果から、現在のオムニモーダルエージェントでは、知覚能力の向上だけでなく、証拠を整理し、行動の順序を決める仕組みが重要だと論じている。
報告された結果は、OmniGAIAで正解率81.4%、1問あたりのコストはGemini-3.1-Proのおよそ43%である。長時間動画理解のWorldSenseでは65.0%に達し、最も強いエンドツーエンドモデルと同水準とされる。ただし、提供された素材には詳細なアブレーション設計やコスト計算の条件が含まれていないため、これらは論文の主要結果として解釈するのが適切である。
意義と課題
証拠台帳の考え方は、コンテキスト管理を明示的な状態管理へ変える。長期検索、動画質問応答、複数ツールを使う処理では、不足している証拠を見える化し、過去のノイズが後続判断を妨げる可能性を抑えられる。
一方で、台帳の信頼性は批評器の選別に依存する。初期の誤判定が圧縮された状態に残れば、その後の計画にも影響する可能性がある。今後は、モダリティの組み合わせ、タスクの長さ、誤った観測や矛盾した記録に対する安定性を検証する必要がある。
それでも本研究は、オムニモーダルエージェントの進歩が、より強い知覚モデルだけでなく、証拠を整理し意思決定へつなぐ設計にも左右されることを示す一例である。
コメント
ログイン状態を確認中…
コメントを読み込み中…