なぜLLMエージェントは撤回された指示に従い続けるのか
導入
ユーザーは最初のメッセージで、常に完全で固定された依頼を伝えるわけではない。文章の作成を頼んだ後で形式を変えたり、条件を削除したり、先ほどの決定を明確に撤回したりする。人間なら、通常は最新で有効な要件を優先する。しかしLLMエージェントでは、すでに無効になった情報が自動的に消えるとは限らない。古い条件が最終回答に残ったり、ツール呼び出しの引数に入り込んだりする可能性がある。
論文「When Users Change Their Minds: Measuring and Repairing Intent Drift in LLM Agents」は、この問題を「意図ドリフト」と呼ぶ。単に長い会話で誤りが増えると報告するのではなく、失敗を再現可能な評価課題として設計し、修正方法も検討している点が特徴だ。
主なポイント
- IntentFluxで制御された対話を作成。 検証可能なタスクを、意図の変更を含む対話へ変換しながら、元のタスク評価器を保持する。これにより、最終依頼を直接与えた場合と、変化する対話から復元させた場合を同じ基準で比較できる。
- 古い情報が増えるほど性能が低下。 627件の校正では、置き換えられた情報や撤回された情報が増えると、平均タスクスコアが0.476から0.384へ下がった。8モデルの比較でも、同じ最終タスクであっても、多ターン対話から復元させた場合は、単一ターンで提示した場合より完全正解が少なかった。
- 明示的な状態管理は改善に寄与。 StateForgeは、生成や実行の前に、現在有効な要件を整理して保持する。General-Testでは平均スコアが0.367から0.467に上昇した。
- 状態管理だけでは十分でない。 正解の最終状態を与えた場合も、単一ターンの性能には戻らなかった。問題は最終意図を推定できるかだけでなく、その状態を回答生成や実行にどう反映するかにもあると考えられる。
意味と影響
この研究は、エージェントのコンテキスト管理を「履歴を多く保存すること」と同一視できないことを示す。ツールを使うシステムでは、現在有効な制約、変更された要件、明確に撤回された内容を区別する必要がある。古い指示がプロンプト内で同じ強さを持ち続ければ、知識やツールが十分でも、すでに不要な計画を実行しかねない。
IntentFluxの価値は、曖昧だった対話上の失敗を再現可能な評価へ変えた点にある。タスク、対話の変化、評価器を分けて分析できるため、どこで性能が落ちるのかを調べやすい。StateForgeは、実行前に構造化された状態整理を挿入する方向が有効であることを示すが、完全な解決策ではない。
実運用では、不可逆な操作の前に、エージェントが現在有効だと判断した目的と制約を表示し、矛盾があれば確認を求める設計が重要になる。論文は意図ドリフトの解決を主張してはいないが、多ターンエージェントを評価・改善するための明確な出発点を提供している。
コメント
ログイン状態を確認中…
コメントを読み込み中…