記憶を超えて:PoSが長期タスク型エージェントに明示的な信念状態を導入
導入
長期的なタスクを実行するエージェントに必要なのは、過去のやり取りを保存することだけではありません。インタラクションが長くなるほど、現在の世界がどのような状態にあるのか、何がまだ分かっていないのか、そして次の行動が本当に目標に近づくのかを追跡する必要があります。履歴をそのまま保持したり圧縮したりするだけでは、意思決定に使える一貫した理解が得られるとは限りません。
この論文は、**PoS(Progression of States)**という推論時フレームワークを提案します。PoSは、コンテキスト管理を履歴の保存ではなく、信念の継続的な維持として捉えます。エージェントは、次の行動を決めるために明示的な信念状態を利用します。
PoSの仕組み
- 世界とタスクを同時に表現。 信念には、現在の世界に対する推定、未解決の情報、残されたタスク要件が含まれます。そのためエージェントは、現状だけでなく、何を学び、何を達成する必要があるかも明示できます。
- 更新を検証。 環境との相互作用後、PoSは新しい信念が内部的に整合しているか、利用可能な証拠によって支えられているかを確認します。根拠のない推測が事実として固定されることを抑える狙いです。
- 進展を監視。 エージェントは一見もっともらしい行動を続けながら、目標に近づかないことがあります。論文はこの失敗を Belief Trapping と呼びます。
- 罠に応じて回復。 PoSは停滞、循環、逸脱などのパターンを区別し、どの未解決要件が進展を妨げているかを判断します。そのうえで、状況に合わせた回復制約を組み立て、同じ行動の反復から抜け出すよう誘導します。
実験結果と意義
評価はタスク実行と証拠探索型の診断を含む4つのベンチマークで行われ、3種類のLLMバックボーンが使われました。PoSは、12のベンチマークとバックボーンの全組み合わせで最高の総合性能を達成しました。同じバックボーンを使う最強ベースラインとの比較では、ALFWorldで最大22.68%、RCA-100のjoint accuracyで37.89%の相対向上が報告されています。アブレーションでは整合性検証と回復の双方が有効であることが示され、コンテキスト拡大実験では、文脈が増えても性能面での頑健性が確認されました。
この研究が示す方向性は、エージェントの記憶を「できるだけ多くの履歴を残す仕組み」から「検証、更新、意思決定に使える現在の信念を保つ仕組み」へと捉え直すものです。多段階計画や環境との相互作用、診断のための証拠収集に有用な考え方です。一方、提示された素材は主にベンチマーク結果を扱っており、信念の品質が基盤モデルの推論能力にどの程度依存するか、より開放的な環境でどう機能するかは今後の検証課題です。
コメント
ログイン状態を確認中…
コメントを読み込み中…