从零训练原生多模态模型,Scaling Law 开始变得清晰
导语
多模态大模型通常有两条路线:一种是在已有大语言模型上接入视觉编码器或适配模块,另一种则是在预训练阶段就把文本、图像等输入放在同一个框架里共同学习。腾讯混元团队这篇论文讨论的是后者,也就是“原生多模态预训练”。它关心的不是某个榜单分数,而是一个更底层的问题:如果从零训练视觉-语言 Transformer,在算力固定时,模型参数量、训练 token 数和数据配比到底该怎样选?
核心要点
-
原生多模态预训练的价值:论文认为,只依赖纯文本预训练会限制模型对物理世界和视觉信息的感知。相比后期拼接式架构,从一开始就联合训练多模态输入,有机会形成更深的跨模态融合,并减少不同模块优化不对称带来的问题。
-
计算规律具有可预测性:研究显示,在给定计算预算下,最小训练目标损失符合可建模的 compute law;同时,计算最优的模型规模与 token 数也呈现幂律变化。这意味着多模态预训练并非只能靠经验试错,未来有可能像语言模型一样进行更系统的规模规划。
-
语言目标和多模态目标并不同步:论文特别强调,语言学习的资源分配规律对数据组成相对不敏感。换言之,即使多模态数据比例变化,语言目标的 scaling 行为仍较稳定。但多模态目标则不同,它对数据混合比例更敏感。
-
文本占比较高时需要更大模型:研究指出,文本偏重的数据混合在更大模型规模下才更具计算效率,这会把最优资源配置推向更高模型容量。也就是说,数据配比不是简单的“多放文本更安全”或“多放图像更多模态”,而要和模型规模一起考虑。
-
提出效率前沿思路:通过建模数据组成对 compute law 和分配指数的影响,论文进一步给出一种效率前沿,用于描述模型大小、token 数和数据混合之间的更优组合。
意义与影响
这项工作的重要性在于,它把原生多模态模型的训练从“架构选择”推进到“可预测扩展”。对于大模型团队来说,算力预算往往是硬约束,真正困难的是如何避免把预算浪费在不合适的模型尺寸或数据混合上。论文给出的结论提示,多模态 scaling 不能直接照搬纯语言模型经验,尤其是在数据配比影响多模态目标时,需要单独建立规律。
下游评估还显示,原生多模态预训练可能带来正向跨模态迁移,包括提升纯文本空间推理能力,以及增强多模态上下文学习的稳健性。虽然素材未给出具体实验数字,但其方向清晰:未来多模态基础模型的训练将更依赖对模型、数据与算力三者关系的精细建模。
评论
正在确认登录状态……
正在加载评论……