記事一覧へ戻る
モデル評価

LLMエージェントは脚本を守れるか?長期一貫性のベンチマーク

読了目安 2 分

対話型の物語やゲームでは、モデルが自然な文章を出すだけでは不十分です。重要なのは、長い対話の中でも世界観を崩さず、すでに置いた設定や後で必要になる展開をきちんと守れるかです。論文はこの課題を Narrative Commitment Preservation(NCP) と名付けました。

著者らは NCP-Bench を提案しています。これは映画のあらすじから作られた 100 個の物語環境で、各環境には物語の軌跡、守るべき約束、初期事実が構造化されており、対話の途中で自動的に検証できます。

このベンチマークで見る点

  • 既存の事実と矛盾しないか
  • プレイヤーの行動にきちんと反応しているか
  • 後で達成すべき物語要素を失っていないか
  • 長い対話でも整合性を保てるか

主な結果

  • 文章の自然さが高くても、一貫性が高いとは限らない
  • 敵対的な介入があると、強いモデルでも論理矛盾が出やすい
  • 最高性能の GPT-5.2 でも、20 ターン後の無矛盾生存率は 42% にとどまる
  • モデル全体で、事実衝突率は 40% から 68% の範囲
  • 100 ターンの制限内で、全ての物語上の約束を守り切る例はごく少数

この研究の意義は、AIゲームやロールプレイエージェントに必要な能力が、単なる会話の滑らかさではないと示した点にあります。長期的な記憶、計画、状態管理がなければ、モデルはすぐに矛盾を起こします。NCP-Bench は、その弱点を見つけるための実用的なテスト基盤です。

将来のエージェントに求められるのは、「それらしく話す」ことではなく、「長く付き合っても筋を通す」ことだと言えるでしょう。

出典: Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
SWE-Bench ProMax:多言語の大規模リファクタリングでコードエージェントを評価
モデル評価
cctest.ai
モデル評価

SWE-Bench ProMax:多言語の大規模リファクタリングでコードエージェントを評価

SWE-Bench ProMax は、AI コーディングエージェントの評価対象を単純なバグ修正から、複数ファイルにまたがる振る舞い維持型のリファクタリングへ広げるベンチマークです。

続きを読む
CCTest · Blog
個人化LLMはユーザープロファイルを作り話するのか
モデル評価
cctest.ai
モデル評価

個人化LLMはユーザープロファイルを作り話するのか

この研究は、個人化LLMが証拠のないままユーザー属性を推測してしまう問題を、初めて大規模に定量化したものだ。 さらに重要なのは、モデル自身の自己評価が、モデル同士を比べる場面では信頼できない指標になりうる点である。

続きを読む