返回文章列表
多模态

视觉编码器会被淘汰吗?多模态模型规模化的新答案

阅读约 3 分钟

导语

当前主流多模态大语言模型通常先借助预训练视觉编码器提取图像特征,再将这些视觉表示交给语言模型处理。这样做能够提供成熟的视觉先验,降低多模态训练的难度,但也意味着系统由多个相对独立的组件构成。另一条路线是直接从原始像素开始训练,让语言模型本身学习视觉表示。它更简单、更统一,却长期缺少清晰的规模化规律。

腾讯混元团队的这项研究,正面比较了“有视觉编码器”和“无视觉编码器”两类模型,重点考察模型规模、训练算力与最终损失之间的关系。

核心要点

  • 无编码器并非全面落后。 在文本目标上,两类架构的损失—算力前沿几乎重合。这意味着,去掉视觉编码器并不会天然破坏语言建模能力。
  • 多模态目标需要更大的模型。 对于无视觉编码器架构,最优算力分配会倾向于使用更大的模型;而文本目标的最优分配变化相对有限。换言之,直接学习视觉表示需要更强的模型容量来消化额外负担。
  • 小规模劣势可能随训练扩大而消失。 无编码器模型在较小规模下表现不如基于编码器的模型,但研究预测,当训练算力达到约 $10^{22}$ FLOPs 时,两者在多模态目标上的差距可能被抹平。作者认为,这一算力水平仍处于实际预训练预算可触及的范围内。
  • 语言模型会形成视觉专门化。 随着训练算力增加,视觉 token 之间的双向交互变得更有价值,视觉处理倾向于向更早的层移动,同时视觉 token 的专家路由更加集中。这些变化说明,语言模型并不是被动接收像素,而是在训练中逐步承担视觉编码器的功能。

意义与影响

这项工作并不意味着视觉编码器马上会从多模态系统中消失。预训练编码器在中小规模训练、数据效率和工程稳定性方面仍可能具有明显优势,而研究结论主要来自规模化趋势与损失前沿的比较,也不等同于所有下游任务都会出现相同结果。

更重要的启示是:视觉先验的价值可能是阶段性的。模型规模较小时,现成编码器能够快速提供可用的视觉表示;当算力、参数量和训练数据持续增加后,统一模型有机会用自身容量重新学习这些能力。这样一来,未来多模态预训练的竞争重点,可能从“如何接入一个更强的视觉编码器”,转向“如何设计让语言模型高效学习视觉的结构与训练方案”。

如果这一趋势在更广泛的任务和数据设置中得到验证,无编码器架构将带来更简化的系统、更少的组件耦合,以及潜在的端到端优化空间。不过,其真实价值仍需通过完整实验、下游评测和实际成本比较进一步确认。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章