LatentStream:让流式视频记忆从检索走向内化
导语
让多模态大模型理解一段持续输入的视频,难度远高于分析一张图片或一段剪辑好的短视频。模型既要遵守时间因果,不能提前看到未来内容,又要在内存预算有限的情况下记住足够多的历史事件。当用户在较晚时刻提出问题时,答案可能依赖几分钟前出现的一个人物、动作或场景变化。
目前常见的解决思路,是把视频历史压缩进外部记忆库,查询到来后再检索相关片段,并将其作为额外视觉上下文交给模型。这种方法能够缓解上下文长度压力,但历史信息始终以“外部材料”的形式存在,模型的持续推理仍需要反复查找和读取。
LatentStream做了什么
论文提出的LatentStream,希望把流式视频记忆从“存储—检索”推进到“检索—内化”。核心不是简单增加记忆容量,而是让检索到的历史证据逐步沉淀为一个紧凑、可演化的潜在工作记忆。
- 分层组织视频历史。 Query-agnostic Hierarchical Streaming Memory在固定预算下,将视觉历史划分为短期、中期和长期层级。系统借助Jenks引导的自适应合并策略,根据内容分布组织不同时间尺度的信息,而不是对所有片段使用完全相同的压缩方式。
- 逐步扩大记忆视野。 当查询出现后,Hierarchical Latent Memory Evolution为不同组的潜在记忆令牌安排逐渐扩大的记忆感受野。它们先从对应范围检索证据,再将信息写入固定长度的潜在表示,随后继续接触更广的历史范围。
- 用置信度指导优化。 Progressive Confidence-guided Latent Memory Optimization依据不同记忆组的预测熵构造层级化的进展奖励,用于联合优化潜在记忆。直观而言,模型不仅要找到信息,还要逐步形成更可靠的记忆状态。
意义与局限
LatentStream的价值在于重新定义了视频记忆的角色:记忆不再只是一个等待查询的档案库,也可以成为随时间演化、直接参与推理的工作状态。固定长度的潜在记忆有望减少长视频处理中反复搬运视觉上下文的成本,并为在线和离线视频理解提供统一的记忆机制。
不过,现有素材没有提供具体基准分数、数据集结果或消融实验细节,因此“达到先进表现”的范围和优势来源仍需结合论文全文判断。潜在记忆也带来新的问题,例如信息压缩后是否会遗失关键细节、错误记忆能否被后续过程纠正,以及不同查询是否会引导记忆产生不一致的内化结果。总体看,这项工作代表了流式视频理解中一个值得关注的方向:从被动保存历史,转向主动形成可持续使用的内部记忆。
评论
正在确认登录状态……
正在加载评论……