LLM 代理能否守住剧本?一项面向长程一致性的互动叙事基准
在许多 AI 叙事或游戏场景里,模型最难的并不是“说得像”,而是“说得久、说得稳”。这篇工作把这个问题明确命名为 Narrative Commitment Preservation(NCP),关注的是:当用户不断插话、改写行动、制造干扰时,LLM 代理是否还能守住已经建立的事实,并推进后续必须完成的剧情节点。
作者据此提出 NCP-Bench,从 100 个电影梗概中构建出 100 个互动叙事环境。每个环境都带有结构化的叙事规范,包括故事轨迹、承诺项和初始事实,系统可以在交互过程中自动检查模型是否前后矛盾、是否真实回应了玩家动作,以及关键剧情是否被完成。
核心发现
- 高语言质量不等于高一致性:模型即使在表面上能生成流畅自然的文本,也未必能持续遵守既定设定。
- 长程交互更容易失控:随着回合增加,模型更容易引入前后冲突,尤其在对抗式干预下。
- 强模型也不例外:实验显示,表现最好的模型 GPT-5.2 在 20 轮后仍只有 42% 的无冲突存活率。
- 冲突并不少见:不同模型的事实冲突率大致落在 40% 到 68% 之间。
- 真正完整跑通很难:在 100 轮限制内,同时无冲突并完成全部承诺的案例只有少数。
这项研究的意义在于,它把“长程叙事是否可靠”从主观体验变成了可度量、可复现实验问题。对于 AI 游戏、互动故事、角色扮演代理和其他需要持续记忆与状态一致性的系统来说,NCP-Bench 提供了一个更接近真实使用场景的压力测试框架。
更重要的是,它提醒我们:未来的代理系统不只要会生成漂亮的下一句,还要能在长时间、多分支、强干扰的互动中维持世界观和任务承诺。对行业来说,这类基准有助于发现“看起来聪明、实际上不稳”的模型短板,并推动更可靠的记忆、规划与状态管理方法。
评论
正在确认登录状态……
正在加载评论……