V-CoLA:面向线性注意力的视觉Token压缩方法
导语
视觉语言模型(VLM)能够处理图像与文本,但图像通常会被编码成数量可观的视觉Token,并与文本Token一同送入模型。随着输入序列变长,视觉Token带来的计算和显存开销日益突出。因此,在尽量不损害理解能力的前提下压缩视觉Token,已经成为多模态推理优化的重要方向。
论文《V-CoLA: Vision Token Compression with Linear Attention》关注的是一个容易被忽略的问题:过去不少视觉Token压缩方法主要围绕Softmax注意力设计,而新一代混合架构开始引入线性注意力,例如论文提到的Qwen3.5。在线性注意力环境中,原有的注意力分数或视觉特征相似度指标并不能直接稳定迁移,压缩后可能出现明显的性能下降。
核心方法
V-CoLA是一套无需额外训练的视觉Token压缩框架,主要包含两个环节:
- 唯一性意识的重要性评估:方法不只判断某个视觉Token是否“显著”,还关注它是否携带其他Token没有表达的信息。具有独特内容的Token可能对应关键目标、局部细节或场景信息,即使它与周围Token并不形成高注意力,也不应被简单删除。
- 自适应Token合并:在确定重要Token后,V-CoLA对需要压缩的Token进行合并,而不是仅依靠截断或单纯丢弃。这样可以在降低序列长度的同时,尽量保留视觉信息的整体结构。
- 兼容分块并行实现:论文特别强调了实现层面的设计,使压缩流程能够配合线性注意力的分块并行机制运行。这意味着方法不仅关注算法指标,也考虑实际推理时的执行效率。
实验结果
根据论文摘要,在多个基准测试中,保留50%的视觉Token时,V-CoLA达到原始模型99.5%的性能;当视觉Token压缩到原来的12.5%时,性能仍超过88%。在预填充阶段,论文报告的加速范围为1.86倍至6.15倍。上述结果表明,视觉Token数量与模型能力之间并非简单的线性关系,合理识别冗余和独特信息,能够带来较大的压缩空间。
意义与影响
V-CoLA的价值首先在于它把视觉Token压缩问题放到了线性注意力这一新计算范式下重新审视。对于采用混合架构的VLM,直接复用面向Softmax注意力的方法可能并不可靠,而面向架构特性的压缩策略更有机会获得稳定收益。
其次,V-CoLA无需训练,降低了部署前重新训练或微调模型的门槛。它仍有待进一步验证的地方,例如不同视觉编码器、任务类型和模型架构下的适用范围,以及压缩比例与准确率之间的更细致权衡。不过,从减少预填充成本的角度看,这项工作为多模态模型的高效推理提供了一个具有实践价值的方向。
评论
正在确认登录状态……
正在加载评论……