返回文章列表
多模态

VisCo:让视觉语言模型“自己”压缩视觉 Token

阅读约 3 分钟

导语

视觉语言模型在理解图片、回答视觉问题或进行多模态推理时,往往需要处理大量视觉 Token。这些 Token 带来了更细粒度的图像表达,也直接推高了推理延迟和显存占用。因此,如何在尽量不损失模型能力的前提下减少视觉 Token,正在成为多模态模型落地中的关键问题。

Hugging Face Daily Papers 收录的论文 VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression 给出了一个有意思的方向:与其为视觉语言模型再设计一个外部压缩模块,不如让预训练模型本身承担“压缩器”的角色。

核心要点

  • 问题背景:视觉 Token 太贵
    VLM 通常会把图像切分或编码成大量视觉 Token,再与文本 Token 一起进入语言模型推理。Token 数越多,注意力计算、显存占用和响应延迟就越高,尤其在高分辨率图像或长上下文多图输入场景中更明显。

  • 现有方法的两类局限
    一类训练无关方法通常依赖启发式指标来挑选或丢弃视觉 Token,部署简单,但在高压缩率下容易明显损伤性能。另一类训练式方法会引入外部压缩模块,虽然更灵活,却可能需要较高重训练成本,也可能迫使原有 VLM 主干适应新模块,从而影响预训练模型已有先验。

  • VisCo 的关键假设:编码能力已经在模型里
    论文认为,有效压缩的核心不是简单删 Token,而是把视觉信息重新编码成更紧凑的表示。预训练 VLM 本身已经学习到强大的跨模态信息组织能力,只是过去的压缩方法没有充分利用这一点。

  • 用 memory tokens 承载压缩后的视觉信息
    VisCo 被设计为一个参数共享的自压缩框架,类似自编码器:编码阶段把视觉信息压缩进少量 memory tokens,解码阶段再利用这些压缩表示恢复或传递必要信息。同时,它还将编码到解码过程中的层级信息进行迁移,以降低压缩带来的语义损失。

  • 实验结论强调高压缩场景稳定性
    根据摘要,VisCo 在论文评估的所有压缩比例上都超过既有方法,并且在更激进压缩下增益更大。尤其值得注意的是,论文称其在极端单 Token 设置下仍保持稳定。此外,当 learned memory tokens 与原始视觉 Token 一起使用时,还可能提升基础模型表现,说明这些 memory tokens 并非只是“删减版图像”,而可能捕获了互补表示。

意义与影响

VisCo 的价值在于把视觉 Token 压缩从“外部裁剪”转向“内部自编码”。如果这一思路在更多模型、任务和真实部署环境中得到验证,它可能为多模态模型降低推理成本提供更温和的路径:减少 Token 数,同时尽量保留预训练 VLM 的原有能力。

对开发者而言,这类方法的潜在吸引力在于训练效率和兼容性。它不再把压缩视为一个完全独立的附加系统,而是利用模型已有的表示能力学习更紧凑的视觉记忆。对于需要处理多图、长上下文或资源受限推理的应用,这类视觉记忆 Token 机制值得持续关注。

不过,素材中尚未给出完整实验细节、具体基准和部署成本数据,因此仍需阅读论文与代码进一步判断其泛化能力、训练代价和工程复杂度。论文页面显示项目已提供 GitHub 仓库,并有作者评论称该工作被 ACM MM 2026 接收。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章