返回文章列表
模型评测

LLM 代理能否守住剧本?一项面向长程一致性的互动叙事基准

阅读约 2 分钟

在许多 AI 叙事或游戏场景里,模型最难的并不是“说得像”,而是“说得久、说得稳”。这篇工作把这个问题明确命名为 Narrative Commitment Preservation(NCP),关注的是:当用户不断插话、改写行动、制造干扰时,LLM 代理是否还能守住已经建立的事实,并推进后续必须完成的剧情节点。

作者据此提出 NCP-Bench,从 100 个电影梗概中构建出 100 个互动叙事环境。每个环境都带有结构化的叙事规范,包括故事轨迹、承诺项和初始事实,系统可以在交互过程中自动检查模型是否前后矛盾、是否真实回应了玩家动作,以及关键剧情是否被完成。

核心发现

  • 高语言质量不等于高一致性:模型即使在表面上能生成流畅自然的文本,也未必能持续遵守既定设定。
  • 长程交互更容易失控:随着回合增加,模型更容易引入前后冲突,尤其在对抗式干预下。
  • 强模型也不例外:实验显示,表现最好的模型 GPT-5.2 在 20 轮后仍只有 42% 的无冲突存活率。
  • 冲突并不少见:不同模型的事实冲突率大致落在 40% 到 68% 之间。
  • 真正完整跑通很难:在 100 轮限制内,同时无冲突并完成全部承诺的案例只有少数。

这项研究的意义在于,它把“长程叙事是否可靠”从主观体验变成了可度量、可复现实验问题。对于 AI 游戏、互动故事、角色扮演代理和其他需要持续记忆与状态一致性的系统来说,NCP-Bench 提供了一个更接近真实使用场景的压力测试框架。

更重要的是,它提醒我们:未来的代理系统不只要会生成漂亮的下一句,还要能在长时间、多分支、强干扰的互动中维持世界观和任务承诺。对行业来说,这类基准有助于发现“看起来聪明、实际上不稳”的模型短板,并推动更可靠的记忆、规划与状态管理方法。

来源链接:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
个性化大模型会“脑补”用户画像:自我监控并不可靠
模型评测
cctest.ai
模型评测

个性化大模型会“脑补”用户画像:自我监控并不可靠

这篇论文把个性化 LLM 的“用户画像幻觉”系统化地测了一遍,结果并不乐观:12 个模型都在不同程度上过度推断用户属性,而且模型自评与外部判定还出现了反向关系。 研究的重点不是某个模型是否更强,而是提醒我们:靠模型自己说“我很谨慎”,并不能作为个性化可信度的证据。

阅读全文