返回文章列表
AI 智能体

用户改主意后,LLM Agent 为什么还在执行旧指令?

阅读约 3 分钟

导语

在多轮对话中,用户很少一次性说清所有需求。他们可能先要求生成一份方案,随后改变格式、删掉某个条件,甚至明确撤回此前的决定。对人类来说,最新且有效的要求通常应覆盖旧要求;但对 LLM Agent 而言,已经失效的信息并不会自然消失。它们仍可能影响最终回答,甚至进入工具调用参数。

这正是论文《When Users Change Their Minds: Measuring and Repairing Intent Drift in LLM Agents》研究的“意图漂移”(intent drift)。论文的重点不只是指出模型会犯错,而是尝试把这种多轮交互中的失败模式变成可执行、可比较的评测问题。

核心要点

  • IntentFlux 提供受控测试环境。 研究者把原本可验证的任务转换成包含意图变化的对话,同时保留原任务的评分器。这样,模型在单轮直接接收最终要求,与从不断变化的对话中恢复最终要求时,可以使用相同的任务标准比较。
  • 旧信息越多,任务表现越差。 在 627 个校准案例中,随着对话中被替代或撤回的信息增加,平均任务分数从 0.476 降至 0.384。研究还比较了八个模型,发现同一个最终任务通过演化对话恢复时,完全正确的比例显著低于直接以单轮形式提供。
  • 显式维护状态有帮助。 研究者提出 StateForge,在生成答案或执行动作之前,先维护一份当前仍然有效的需求状态。General-Test 上,平均任务分数由 0.367 提升至 0.467。
  • 状态记录并非完整解决方案。 即使向模型提供真实的最终状态,表现仍未恢复到单轮任务水平。这说明错误不只来自“没有识别出用户最后想要什么”,还可能出现在模型如何利用状态、组织回答或执行任务的阶段。

意义与影响

这项工作提醒开发者,Agent 的上下文管理不能简单等同于保存更多历史消息。对需要调用工具的系统而言,关键问题是区分当前约束、已被修改的要求和明确撤回的内容。如果旧要求持续留在提示词中,模型即使具备足够的知识和工具能力,也可能执行一个已经过时的计划。

IntentFlux 的价值在于把“记住了太多东西”转化为可复现实验:任务本身、对话变化和评分标准可以被拆开观察。StateForge 则说明,在执行前增加结构化的状态维护步骤,是一种有效但有限的修复方向。未来的 Agent 评测因此不应只看单轮准确率,也需要测试需求覆盖、撤回、重写和连续修改等情境。

对于产品系统,这意味着确认机制和状态可见性同样重要。Agent 在采取不可逆工具操作前,最好能够明确展示它认为当前有效的目标与约束,并在检测到冲突时请求确认。论文并未声称某一种架构已经彻底解决意图漂移,但它为衡量这一问题及比较缓解方案提供了更清晰的起点。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章