返回文章列表
AI 安全

当智能体的记忆开始“洗白”权限:持久化记忆的新安全风险

阅读约 3 分钟

导语

长期运行的 LLM 智能体通常需要跨会话保存信息:用户偏好、任务进度、已完成操作,以及哪些行为被允许、限制或撤销。记忆因此不再只是提升连续性的辅助模块,它也可能成为智能体判断“能不能做某件事”的依据。

来自 EleutherAI 的研究《Agent Memory Is a Surface for Endogenous Authorization Laundering》关注了一个容易被忽视的失效模式:当智能体把错误的授权状态写入持久化记忆,后续系统可能将这条记录当作真实依据,执行原本没有被允许的操作。由于错误来自智能体自身的记忆更新,而不是外部攻击,研究者将其称为“内生授权洗白”(endogenous authorization laundering)。

核心要点

  • 权限会在记忆中被错误重构。 在多轮、增量式更新中,系统可能把模糊表述、过期状态或不完整上下文整理成并不存在的授权。原始历史一旦被压缩,虚假权限的来源也更难追溯。
  • 错误可能从写入环节传递到执行环节。 研究者提出 EAL-Bench,同时测试记忆写入模型能否准确保存不断变化的授权状态,以及执行模型是否会根据错误记忆采取行动。
  • 风险覆盖多个任务领域。 实验涉及采购、网络安全和金融场景,评估了五个记忆写入模型与两个执行模型。结果显示,在增量记忆更新条件下,写入模型对未经授权请求生成虚假权限的比例最高达到 50.2%;一旦虚假权限已经存在,执行模型在 98.6% 的试验中据此行动。
  • 防护并非没有代价。 研究考察了两种方法:要求记忆中的权限必须由有效源事件支持,以及使用有界事件溯源记录权限变化。两者都能显著减少授权洗白,但也会拒绝更多合法操作,形成明确的安全性与可用性权衡。

意义与影响

这项工作提醒开发者重新审视“记忆”的系统定位。传统上,记忆常被当作上下文管理或产品体验组件;但在能够调用工具、访问数据或执行外部操作的智能体中,记忆实际上参与构成了有效的授权策略。如果它能写入“谁被允许做什么”,却不保留对应的来源和变更过程,那么一次看似普通的摘要错误,就可能演变成权限错误。

更稳妥的设计方向,是把授权状态与普通事实记忆区分开来。权限不应仅以自然语言结论保存,还应关联明确的来源事件、适用范围、有效期限和撤销记录。与此同时,事件溯源也不能无限增长,因此如何在可审计性、上下文成本和响应效率之间取得平衡,仍是工程难题。

研究并未主张简单地拒绝所有不确定请求。相反,它揭示了安全机制带来的误拒绝成本:过于严格的验证会损害合法任务完成率,过于宽松的记忆更新又会扩大未授权行动风险。未来的智能体评估,除了测量任务成功率和工具调用准确率,也需要单独检查记忆是否忠实反映权限历史,以及错误是否会被执行层放大。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章