記事一覧へ戻る
モデル評価

LLMエージェントは脚本を守れるか?長期一貫性のベンチマーク

読了目安 2 分

対話型の物語やゲームでは、モデルが自然な文章を出すだけでは不十分です。重要なのは、長い対話の中でも世界観を崩さず、すでに置いた設定や後で必要になる展開をきちんと守れるかです。論文はこの課題を Narrative Commitment Preservation(NCP) と名付けました。

著者らは NCP-Bench を提案しています。これは映画のあらすじから作られた 100 個の物語環境で、各環境には物語の軌跡、守るべき約束、初期事実が構造化されており、対話の途中で自動的に検証できます。

このベンチマークで見る点

  • 既存の事実と矛盾しないか
  • プレイヤーの行動にきちんと反応しているか
  • 後で達成すべき物語要素を失っていないか
  • 長い対話でも整合性を保てるか

主な結果

  • 文章の自然さが高くても、一貫性が高いとは限らない
  • 敵対的な介入があると、強いモデルでも論理矛盾が出やすい
  • 最高性能の GPT-5.2 でも、20 ターン後の無矛盾生存率は 42% にとどまる
  • モデル全体で、事実衝突率は 40% から 68% の範囲
  • 100 ターンの制限内で、全ての物語上の約束を守り切る例はごく少数

この研究の意義は、AIゲームやロールプレイエージェントに必要な能力が、単なる会話の滑らかさではないと示した点にあります。長期的な記憶、計画、状態管理がなければ、モデルはすぐに矛盾を起こします。NCP-Bench は、その弱点を見つけるための実用的なテスト基盤です。

将来のエージェントに求められるのは、「それらしく話す」ことではなく、「長く付き合っても筋を通す」ことだと言えるでしょう。

出典: Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
TraceDance、実運用の軌跡からAIエージェントの行動ベンチマークを自動生成
モデル評価
cctest.ai
モデル評価

TraceDance、実運用の軌跡からAIエージェントの行動ベンチマークを自動生成

TraceDanceは、実際のエージェント運用で見つかった望ましくない行動を、対象を絞った評価ベンチマークへ変換するシステムです。環境全体を再現せず、記録済みの意思決定点からモデルの次の応答を評価します。

続きを読む
CCTest · Blog
Duplex-MPE、全二重音声アシスタントが「話すべき時」を評価
モデル評価
cctest.ai
モデル評価

Duplex-MPE、全二重音声アシスタントが「話すべき時」を評価

Duplex-MPEは、複数の人が共有する会話の中で、音声アシスタントが答えるべきか、黙るべきか、発話を止めるべきかを測るベンチマークです。発話頻度の高さだけでは、良い参加者とは限らないことが示されました。

続きを読む
CCTest · Blog
端末上のプライバシー保護がオークション予算を狂わせる理由
モデル評価
cctest.ai
モデル評価

端末上のプライバシー保護がオークション予算を狂わせる理由

機械学習による入札判断をプライバシー保護端末へ移すと、予算情報も分散し、同期遅延が発生する。新たな監査研究は、古い残高が過剰支出を拡大し、支払い変換が操作可能なインセンティブを生む可能性を示した。

続きを読む