返回文章列表
记忆与上下文

不止于记忆:PoS让长程智能体维护可验证的信念状态

阅读约 2 分钟

导语

对长程智能体而言,问题并不只是“记住发生过什么”。当任务持续几十步甚至更久,智能体还必须知道世界当前处于什么状态、哪些信息仍然未知,以及下一步行动是否真的让目标更近。单纯保留或压缩交互历史,无法保证这些内容被组织成连贯、可执行的理解。

论文提出的 PoS(Progression of States),把长程上下文管理从“保存历史”推进到“持续维护信念”。它是一种无需额外训练的推理时框架,核心产物不是一段更长的上下文,而是一个显式的信念状态。

核心机制

  • 把状态与任务需求放在一起。 PoS的信念同时描述当前世界的估计、尚未确认的信息,以及仍需完成的任务要求。这样,智能体不仅能回答“现在是什么情况”,还能够明确“还缺什么、还要做什么”。
  • 验证信念更新。 每次与环境交互后,系统会检查新的信念是否前后一致,是否得到已有证据支持,避免将未经验证的推断直接当成事实。
  • 监测真实进展。 智能体可能持续采取看似合理的行动,却没有缩小问题范围或推进目标。论文将这种状态称为 Belief Trapping,即信念陷阱。
  • 识别陷阱并恢复。 PoS会区分停滞、循环和偏移等陷阱模式,同时判断究竟是哪类未解决需求阻碍了任务。随后,它组合出有针对性的恢复约束,引导后续行动脱离原有路径,而不是继续重复尝试。

实验结果与意义

论文在覆盖任务执行和证据搜寻式诊断的四个基准上进行评估,并使用三种语言模型骨干。PoS在全部12个“基准—骨干”组合中取得最高总体表现;相较于同一骨干下的最强基线,在ALFWorld上的相对提升最高达到22.68%,在RCA-100联合准确率上的相对提升达到37.89%。消融实验进一步表明,一致性验证和恢复机制都对效果有贡献;上下文扩展实验则显示,PoS在上下文不断增长时仍保持韧性。

这项工作的价值在于重新定义了智能体记忆的目标:记忆不是越多越好,而是要形成能够被检查、更新并用于决策的当前信念。对需要长期规划、环境交互或逐步诊断的系统来说,这种设计有助于减少“知道很多却没有进展”的失败模式。不过,论文素材主要展示了基准实验结果,信念质量对模型本身推理能力的依赖,以及在更开放环境中的表现,仍值得进一步观察。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章