記事一覧へ戻る
メモリ・コンテキスト

記憶を超えて:PoSが長期タスク型エージェントに明示的な信念状態を導入

読了目安 3 分

導入

長期的なタスクを実行するエージェントに必要なのは、過去のやり取りを保存することだけではありません。インタラクションが長くなるほど、現在の世界がどのような状態にあるのか、何がまだ分かっていないのか、そして次の行動が本当に目標に近づくのかを追跡する必要があります。履歴をそのまま保持したり圧縮したりするだけでは、意思決定に使える一貫した理解が得られるとは限りません。

この論文は、**PoS(Progression of States)**という推論時フレームワークを提案します。PoSは、コンテキスト管理を履歴の保存ではなく、信念の継続的な維持として捉えます。エージェントは、次の行動を決めるために明示的な信念状態を利用します。

PoSの仕組み

  • 世界とタスクを同時に表現。 信念には、現在の世界に対する推定、未解決の情報、残されたタスク要件が含まれます。そのためエージェントは、現状だけでなく、何を学び、何を達成する必要があるかも明示できます。
  • 更新を検証。 環境との相互作用後、PoSは新しい信念が内部的に整合しているか、利用可能な証拠によって支えられているかを確認します。根拠のない推測が事実として固定されることを抑える狙いです。
  • 進展を監視。 エージェントは一見もっともらしい行動を続けながら、目標に近づかないことがあります。論文はこの失敗を Belief Trapping と呼びます。
  • 罠に応じて回復。 PoSは停滞、循環、逸脱などのパターンを区別し、どの未解決要件が進展を妨げているかを判断します。そのうえで、状況に合わせた回復制約を組み立て、同じ行動の反復から抜け出すよう誘導します。

実験結果と意義

評価はタスク実行と証拠探索型の診断を含む4つのベンチマークで行われ、3種類のLLMバックボーンが使われました。PoSは、12のベンチマークとバックボーンの全組み合わせで最高の総合性能を達成しました。同じバックボーンを使う最強ベースラインとの比較では、ALFWorldで最大22.68%、RCA-100のjoint accuracyで37.89%の相対向上が報告されています。アブレーションでは整合性検証と回復の双方が有効であることが示され、コンテキスト拡大実験では、文脈が増えても性能面での頑健性が確認されました。

この研究が示す方向性は、エージェントの記憶を「できるだけ多くの履歴を残す仕組み」から「検証、更新、意思決定に使える現在の信念を保つ仕組み」へと捉え直すものです。多段階計画や環境との相互作用、診断のための証拠収集に有用な考え方です。一方、提示された素材は主にベンチマーク結果を扱っており、信念の品質が基盤モデルの推論能力にどの程度依存するか、より開放的な環境でどう機能するかは今後の検証課題です。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
WUSH-KV:データ適応型変換で低ビット KV キャッシュ量子化を改善
メモリ・コンテキスト
cctest.ai

WUSH-KV:データ適応型変換で低ビット KV キャッシュ量子化を改善

WUSH-KV は、キャリブレーションデータから Key と Value 用の変換を個別に構築し、低ビット KV キャッシュ量子化の誤差を抑える手法です。2-bit 評価では、検証したモデルと下流タスク全体で OSCAR 変換と同等以上の結果が報告されています。

続きを読む
CCTest · Blog
長時間動画の記憶を「物体中心」に:GEBが視覚エンティティの履歴を構築
メモリ・コンテキスト
cctest.ai

長時間動画の記憶を「物体中心」に:GEBが視覚エンティティの履歴を構築

長時間動画の質問応答では、関連場面を検索するだけでなく、異なる時点の物体が同じ実体かを判断する必要があります。Amazon ScienceのGEBは、視覚的に接地した観察をエンティティの履歴として結び付けます。

続きを読む
CCTest · Blog
分割KVキャッシュ圧縮が生む周期的な検索の弱点
メモリ・コンテキスト
cctest.ai

分割KVキャッシュ圧縮が生む周期的な検索の弱点

分割型KVキャッシュ圧縮を使うモデルでは、同じ情報でも圧縮ウィンドウ内の位置によって検索しやすさが変わることが分かりました。平均スコアだけでは、周期的に現れる弱点を見落とす可能性があります。

続きを読む