返回文章列表
视觉与视频

长视频视觉Token怎么分配?研究发现,挑帧比压缩更重要

阅读约 3 分钟

长视频理解的瓶颈,往往不是模型完全看不懂,而是它根本没有机会看到足够多的内容。以每秒采样一帧计算,一小时视频就会产生3600张图像;受限于上下文长度和推理成本,系统通常只能保留其中很小的一部分。问题在于:这部分预算应该花在更清晰的少数帧上,还是花在更多但更低分辨率的帧上?

这篇研究的价值,首先在于把几个容易被混在一起的决策拆开。作者固定帧评分方式、提示词边界、空间分辨率策略和回答模型,只分别改变选帧、空间压缩以及压缩后预算如何重新投入,并在三个长视频基准、两个回答模型和六种免训练选帧规则上进行比较。这样的设计避免了“换了一套方法就同时换了多个变量”的问题。

核心发现

  • 选什么帧,是最重要的杠杆。 在 LongVideoBench 的小时级视频测试中,查询驱动的8帧比均匀采样的16帧高出6.9个百分点。也就是说,更多帧并不自动带来更好的理解,关键在于它们是否覆盖了与问题相关的证据。
  • 经典算法并不逊色。 未经修改的正交匹配追踪(OMP)是一种已有数十年的稀疏近似算法,但在三个基准上都能与研究中比较的专用选帧器持平或相差不超过一个百分点。这提示,长视频选帧未必需要复杂、专门训练的组件。
  • 降低单帧分辨率的代价很小。 在时间戳不变的情况下,将每帧的空间Token预算减半,准确率损失最多为0.44个百分点。对于受上下文和显存约束的系统,单纯追求高分辨率可能并非最优资源使用方式。
  • 省下来的预算要继续投入。 如果只压缩画面而不改变帧数,收益并不明显;但将节省的Token用于把帧数翻倍,同时保持相近的总预算,准确率还能提高约2到3个百分点。研究的关键结论不是“压缩越多越好”,而是“压缩应服务于更广的时间覆盖”。

意义与影响

这项工作把长视频推理重新表述为一个预算分配问题:先决定哪些时间片段最值得看,再决定每一帧需要多少空间细节,最后把节省下来的资源投向新的证据。对工程实践而言,一个合理的默认策略可能是优先采用问题感知的选帧,再适度降低单帧Token,并把预算用于扩大时间覆盖,而不是把所有资源集中在少数高清画面上。

研究还提醒人们谨慎解读选帧方法的对比。作者发现,自身的AKS基线存在实现错误,而且不同回答模型之间的结果差距可达0.07至3.74个百分点。由此可见,公平的消融实验、实现核验和跨模型复现,与提出一个新选帧名称同样重要。需要注意的是,这些结论来自特定基准、模型和预算设置,不能直接推断所有视频任务都适合相同的压缩比例。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
Gemini推出Agentic Video Understanding:让模型自己决定“看哪里”
视觉与视频
cctest.ai
视觉与视频

Gemini推出Agentic Video Understanding:让模型自己决定“看哪里”

Google DeepMind为Gemini引入Agentic Video Understanding,使模型能够动态搜索视频片段,并按需调用画面、音频和字幕信息。官方称,该能力在部分基准上可将Token消耗降低最多88%,成本降低最多66%,准确率提升最多7%。

阅读全文