OmniScope:让全模态大模型压缩音视频 Token 时不再“互相误导”
导语
全模态大模型要同时理解视频画面、声音和文本查询,推理时往往会产生大量音视频 Token。Token 越多,prefill 阶段越慢,显存压力也越大。因此,如何在不明显损失答案质量的前提下压缩 Token,正在成为 OmniLLM 落地的重要问题。
OmniScope 这篇论文的切入点很直接:过去不少压缩方法会用一种模态去判断另一种模态该保留什么,例如让视频线索指导音频,或让音频线索筛选画面。但作者发现,这个假设并不总成立。
核心要点
- 音频与视频的“重要时刻”可能错位:同一个问题下,答案相关的视频片段和音频片段往往不在同一时间达到峰值。如果强行用单向跨模态指导,激进压缩时可能删掉关键线索。
- 查询是共享锚点,但显著性要分开算:OmniScope 使用用户查询作为共同的语义参照,同时分别估计音频和视频 Token 的相关性,避免让一种模态替另一种模态做决定。
- 按模态分配 Token 预算:框架会为音频和视频设置各自的压缩预算,而不是把所有 Token 混在一起统一裁剪。
- 视觉侧保留全局与变化:论文提出 anchor-delta 策略,在压缩视觉 Token 时兼顾全局上下文和时间上的变化信息。
- 音频侧按秒合并冗余:对于音频 Token,OmniScope 在每秒内部进行合并,以减少重复,同时尽量保留时间连续性。
实验结果与意义
在四个音视频基准和两个 Qwen2.5-Omni 模型规模上,OmniScope 在不同压缩设置下取得了最佳平均准确率。尤其是在总体只保留 25% Token 时,论文报告最高可带来 3.53 倍 prefill 加速,并减少超过 15% GPU 显存占用,平均准确率仅下降 0.35 分。
这组结果的价值不只在于某个压缩技巧,而在于给全模态推理提供了一个清晰原则:查询可以跨模态共享,但显著性估计不应被简单绑定。对需要处理长视频、长音频或实时音视频交互的应用来说,这类免训练压缩方法有望降低部署成本,也能减少重新训练带来的工程负担。
当然,素材中披露的信息主要来自论文摘要,更多细节仍需结合完整论文和代码验证,例如不同任务类型下的预算分配策略是否稳定、极端长视频场景是否仍然有效。但从方向看,OmniScope 把“多模态信息不同步”这个常被忽略的问题推到了前台。
评论
正在确认登录状态……
正在加载评论……