EmbodiedMemory-Bench:用长期交互检验具身智能的记忆能力
导语
具身智能的难点不只是“看见并行动”,还在于能否把过去经历转化为之后可用的知识。对于需要长时间探索、反复操作并面对环境变化的任务,智能体必须记住细节,判断物体和场景状态是否发生变化,还要理解一次行动带来的结果。现有评测往往更关注单次任务成功率,难以回答智能体究竟有没有形成可靠、可更新的世界记忆。
一个面向具身记忆的专门基准
浙江大学 ZJU-OmniAI 团队提出 EmbodiedMemory-Bench,即 EMem-Bench,试图补上这一评测空缺。基准包含 2,554 个可执行交互回合,覆盖四类记忆挑战:
- 细粒度视觉记忆:保留环境中的局部视觉信息,而非只形成笼统印象;
- 动态世界状态跟踪:随着观察和行动持续更新物体、位置及场景状态;
- 从交互结果中学习:记录行动成功、失败或产生变化后揭示出的环境信息;
- 经验泛化:把先前任务中的经验迁移到后续决策,而不是每次从零开始。
任务设置的关键在于分离“建立记忆”和“使用记忆”两个阶段。智能体需要先通过一段交互历史收集信息并形成记忆,之后在新的任务中调用这些信息、执行动作并完成目标。这比单纯把更长的观察历史输入模型,更接近真实机器人在持续环境中的工作方式。
结构化记忆,而非简单堆叠历史
论文还提出 Embodied-Memorizer(EMem),一种外部记忆系统。它将具身经验组织为空间记忆、事件记忆和场景记忆,分别服务于位置关系、行动及其结果、整体环境语境等信息。这样的划分意在降低长期历史中的信息冗余,让模型能够按照任务需要检索不同类型的内容。
在此基础上,研究团队训练了 EMem-8B,一个用于管理和使用这些记忆的 8B 策略模型。作者还评估了多种开源与闭源多模态大模型,以及具有代表性的多模态记忆系统。结果显示,当前模型在四项能力上的表现仍然较弱且不均衡;在骨干模型匹配的条件下,EMem 在所比较的记忆系统中取得最佳总体表现,并能改善开源和闭源模型的效果。EMem-8B 也进一步超过了其基础模型。
意义与影响
EMem-Bench 的价值不只在于新增一个数据集,更在于把“记忆”拆解为可观察、可比较的具身能力。它提示研究者,扩大上下文窗口或保存更多历史,并不等于真正掌握了世界状态;记忆还必须具备更新、关联行动结果和迁移经验的能力。
对于后续研究,这一基准可用于比较不同外部记忆架构、训练策略和智能体规划方法,也有助于推动模型从被动读取历史,转向维护一个持续演化的环境表示。由于素材未提供各任务的具体分数和实验细节,当前更适合将其视为评测框架与系统设计方向,而不是对某一模型能力的全面定论。
评论
正在确认登录状态……
正在加载评论……