返回文章列表
视觉与视频

ShallowStream:先浅层建索引,再深层理解连续视频

阅读约 2 分钟

导语

让多模态大语言模型持续观看视频,难点并不只是“看得准”,还在于能否长期、低成本地处理不断到来的帧。自动驾驶、机器人、工业监控、安防预警和可穿戴助手都需要这种能力,但如果每来一帧都完整运行一次 MLLM,计算开销会迅速累积,KV cache 也会随预填充深度扩张。

核心思路:把模型深度拆开使用

现有流式视频方法已经尝试过视觉 token 剪枝、token 合并、量化、按需取帧以及上下文卸载等方向。ShallowStream关注的是另一个常被忽略的维度:模型深度。

它的做法可以概括为“先浅后深”:

  • 流式阶段只运行浅层。 新帧到达后,模型利用较浅的层完成初步编码,并将相关 KV cache 组织成持续更新的轻量索引。
  • 索引始终在线。 系统无需为每个问题重新处理全部视频内容,而是保留对历史帧的低成本表示。
  • 查询阶段再调用深层。 当用户提出问题时,浅层产生的注意力分数用于衡量不同帧与问题的相关性。
  • 兼顾相关性与多样性。 检索并非简单选择分数最高的若干帧,而是加入多样性感知策略,尽量覆盖回答所需的不同证据,减少相似帧重复占据上下文。

这套架构的关键,不是完全放弃深层模型,而是把深层计算从“每帧必做”改成“有查询时针对候选证据执行”。因此,持续监控阶段可以保持较轻的计算负担,回答问题时再集中使用模型的完整理解能力。

结果与意义

论文称,ShallowStream 的理解表现可达到现有最强流式方法相近的水平,同时将单帧预填充延迟最高降低 52.1 倍,10 秒端到端延迟最高降低 11.9 倍。这里的价值不仅体现在速度,也体现在系统设计:KV cache 不再随着完整模型深度重复累积,持续视频场景的内存和计算压力因此有望得到缓解。

从方法论看,ShallowStream提供了一种“分层推理”的思路。浅层负责持续感知、压缩和定位,深层负责在需要时进行精细回答。这对于长时间运行、查询频率不稳定的视觉系统尤其重要。不过,论文摘要并未给出完整实验设置、模型配置和不同场景下的详细误差分析,因此其优势仍应结合原文实验进一步评估。

总体而言,这项工作把流式视频优化从 token 数量和缓存管理,进一步拓展到模型深度调度,为低延迟视频理解系统提供了一个值得关注的方向。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
视频生成对齐与蒸馏不必二选一:DM-Align尝试单阶段优化
视觉与视频
cctest.ai
视觉与视频

视频生成对齐与蒸馏不必二选一:DM-Align尝试单阶段优化

一项发表于 arXiv 的研究提出 DM-Align,将视频生成模型的分布蒸馏与人类偏好对齐放进同一优化框架。该方法借鉴 DPO 与 GRPO,从样本分布差异中直接构造偏好梯度,以降低传统强化学习流程的计算与稳定性成本。

阅读全文
CCTest · Blog
Gemini推出Agentic Video Understanding:让模型自己决定“看哪里”
视觉与视频
cctest.ai
视觉与视频

Gemini推出Agentic Video Understanding:让模型自己决定“看哪里”

Google DeepMind为Gemini引入Agentic Video Understanding,使模型能够动态搜索视频片段,并按需调用画面、音频和字幕信息。官方称,该能力在部分基准上可将Token消耗降低最多88%,成本降低最多66%,准确率提升最多7%。

阅读全文