返回文章列表
记忆与上下文

让长视频记住“同一个东西”:GEB为视觉实体建立可检索传记

阅读约 3 分钟

导语

让模型回答一段长视频中的问题,真正困难的往往不是“看见了什么”,而是判断不同时间看到的是否是同一个东西。一个人可能在上午把蓝色水杯放在厨房,晚上又在客厅拿起它;如果系统只按时间顺序记录事件,或者只依赖“蓝色水杯”这样的文字描述,就可能把不同物体混在一起,也可能无法把同一物体的多次出现串联起来。

Amazon Science提出的 Grounded Entity Biographies(GEB),试图把长视频记忆从事件时间线推进到实体视角:围绕具体的物理对象建立一份跨时间的“传记”。

核心要点

  • 从事件记忆转向实体记忆:GEB把不同视频片段中、经过视觉定位的同一物理实例的观察进行归组,而不是只保存孤立的事件描述。
  • 保留每次出现的上下文:实体被连接起来后,系统并不会抹去它在不同时间、地点和事件中的具体信息,因此既能追踪身份,也能回看情境。
  • 联合检索传记与事件证据:回答问题时,GEB会把相关实体的传记和对应的片段证据一并提供给模型,帮助模型沿着身份关联重建对象经历。
  • 身份关联是关键增益来源:论文的消融结果显示,仅增加更多文字描述并不能完全复现效果;视觉上建立的实体身份链接,以及在问答阶段读取传记,都对性能提升有所贡献。

评测表现

研究团队在四个基准上进行评估,其中包括覆盖一天乃至一周记录的长时段视频,测试同时涉及选择题和开放式问答。结果显示,GEB整体优于此前的长视频记忆框架。在EgoLifeQA上,GEB达到72.0%的准确率,比此前最佳公开结果高4.4个百分点。素材并未披露完整的系统实现细节,因此更适合将GEB理解为一种围绕“视觉身份—事件上下文—检索问答”组织记忆的框架,而不是单纯增加上下文长度。

意义与影响

GEB指出了长视频理解中的一个基础问题:时间连续性并不等于身份连续性。对于生活记录、监控视频或机器人长期感知而言,系统不仅要知道某件事发生过,还要知道这件事涉及的具体对象后来去了哪里、发生了什么变化。把实体作为记忆组织单位,有望减少同类物体之间的混淆,也能让检索结果更贴近问题所指的那个对象。

当然,实体身份的视觉关联也可能受到遮挡、视角变化和外观相似等因素影响。GEB的价值首先在于明确了长视频记忆应解决的对象级连接问题,并用实验说明:更丰富的描述不一定足够,可靠的身份链接同样是构建长期视频记忆的核心。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章