返回文章列表
多模态

V-CoLA:面向线性注意力的视觉Token压缩方法

阅读约 3 分钟

导语

视觉语言模型(VLM)能够处理图像与文本,但图像通常会被编码成数量可观的视觉Token,并与文本Token一同送入模型。随着输入序列变长,视觉Token带来的计算和显存开销日益突出。因此,在尽量不损害理解能力的前提下压缩视觉Token,已经成为多模态推理优化的重要方向。

论文《V-CoLA: Vision Token Compression with Linear Attention》关注的是一个容易被忽略的问题:过去不少视觉Token压缩方法主要围绕Softmax注意力设计,而新一代混合架构开始引入线性注意力,例如论文提到的Qwen3.5。在线性注意力环境中,原有的注意力分数或视觉特征相似度指标并不能直接稳定迁移,压缩后可能出现明显的性能下降。

核心方法

V-CoLA是一套无需额外训练的视觉Token压缩框架,主要包含两个环节:

  • 唯一性意识的重要性评估:方法不只判断某个视觉Token是否“显著”,还关注它是否携带其他Token没有表达的信息。具有独特内容的Token可能对应关键目标、局部细节或场景信息,即使它与周围Token并不形成高注意力,也不应被简单删除。
  • 自适应Token合并:在确定重要Token后,V-CoLA对需要压缩的Token进行合并,而不是仅依靠截断或单纯丢弃。这样可以在降低序列长度的同时,尽量保留视觉信息的整体结构。
  • 兼容分块并行实现:论文特别强调了实现层面的设计,使压缩流程能够配合线性注意力的分块并行机制运行。这意味着方法不仅关注算法指标,也考虑实际推理时的执行效率。

实验结果

根据论文摘要,在多个基准测试中,保留50%的视觉Token时,V-CoLA达到原始模型99.5%的性能;当视觉Token压缩到原来的12.5%时,性能仍超过88%。在预填充阶段,论文报告的加速范围为1.86倍至6.15倍。上述结果表明,视觉Token数量与模型能力之间并非简单的线性关系,合理识别冗余和独特信息,能够带来较大的压缩空间。

意义与影响

V-CoLA的价值首先在于它把视觉Token压缩问题放到了线性注意力这一新计算范式下重新审视。对于采用混合架构的VLM,直接复用面向Softmax注意力的方法可能并不可靠,而面向架构特性的压缩策略更有机会获得稳定收益。

其次,V-CoLA无需训练,降低了部署前重新训练或微调模型的门槛。它仍有待进一步验证的地方,例如不同视觉编码器、任务类型和模型架构下的适用范围,以及压缩比例与准确率之间的更细致权衡。不过,从减少预填充成本的角度看,这项工作为多模态模型的高效推理提供了一个具有实践价值的方向。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
Kandinsky 6.0 Video:让视频生成同时具备画面、声音与口型同步
多模态
cctest.ai
多模态

Kandinsky 6.0 Video:让视频生成同时具备画面、声音与口型同步

Kandinsky 6.0 Video 是一组面向文本或图像输入的音视频生成模型,可输出带有同步 44 kHz 音频和唇形匹配的 5 秒视频。其核心是连接视频与音频生成流的双流 CrossDiT 架构,并以开源方式发布代码、权重和 Diffusers 集成。

阅读全文