OneStreamer:让流式视频模型边看边记,并在恰当时机响应
导语
传统视频大模型往往在两个方案之间取舍:要么保留较长的视觉上下文,换取更好的历史信息检索;要么只关注最近画面,以控制计算和延迟。但在真实的流式交互中,未来的问题通常尚未出现,模型必须先判断哪些信息值得记录;与此同时,它还要在证据足够时及时回答,而不是等到视频结束。
OneStreamer 针对这一场景提出了一个统一框架。论文的核心思路不是把“看视频”“记忆”和“回答问题”拆成彼此独立的模块,而是让模型在视频持续到来时,通过主动生成过程同时完成证据记录与任务响应。
核心机制
- 分层字幕记忆:Proactive Hierarchical Caption Memory(PHCM)会为观察到的内容生成带时间定位的局部细节描述,并在事件完成后形成摘要。这样,旧画面即使已经离开最近视觉窗口,相关事实仍可以通过生成的文字记录被调用。
- 视觉窗口与文本记忆协同:推理时,模型将最近的视觉内容与此前生成的字幕记录结合,而不必反复访问全部历史视觉特征。这为长视频交互提供了更经济的历史信息保留方式。
- 学习响应时机:Proactive State Transition Learning(PSTL)关注模型何时从等待状态转向响应状态。它保留不同输出锚点上的监督,并选择具有代表性的状态变化和状态持续 token,减少重复等待标签对训练的主导。
- 流式数据构造:研究团队建立了数据合成流程,使输出内容和输出时间与当时可获得的视频证据相匹配,再将生成的字幕、问答和清理后的开放数据结合,形成 OneStreamer-1M。
实验信号与意义
素材显示,OneStreamer 的 4B 版本在八项流式视频理解基准上都取得了参与比较方法中的最佳综合表现,覆盖感知、记忆和主动响应等能力。消融结果还表明,保留模型生成的字幕能够改善历史问答,同时没有削弱实时感知;PSTL 只使用 27.5% 的标注状态 token,却优于密集状态监督。
这项工作的重要性在于,它把流式视频模型的记忆单位从“持续保存视觉特征”转向“根据当前证据生成可复用记录”。这种设计有望降低历史视觉回看的负担,也更贴近摄像头助手、长视频分析和持续监控等需要及时交互的场景。当然,字幕记忆本身仍依赖模型对视频的正确概括,记录错误可能在后续问答中被重复使用。因此,未来评估不仅要看回答是否正确,也应关注记忆内容的事实性、时间定位和错误传播问题。
评论
正在确认登录状态……
正在加载评论……