Meta 这项多模态预训练研究,试图给“图文联合训练”建立物理规律
阅读约 2 分钟
导语
多模态大模型正在从“先做语言、再补视觉”转向“从一开始就统一训练”。但真正决定训练效果的,并不只是参数量和数据量,还有模态之间如何交换信息、是否协同、以及何时把视觉真正接入模型。Meta 这篇研究试图给这些问题建立更接近“经验物理学”的解释框架。
核心要点
- 知识流动并不对称:语言、视觉理解、视觉生成三者之间的迁移路径不同,并不是简单地“互相加成”。
- 协同还是竞争,取决于数据复杂度:当任务和数据足够复杂时,模态更容易形成互补;在较简单设定下,模态之间可能出现抢占能力的现象。
- 架构选择很关键:共享注意力和共享归一化、再配合模态专属前馈层,更容易促成协同;这一结论对不同视觉 tokenizer 设计也具有一定泛化性。
- 越早统一,通常越好:从训练最初阶段就让模态共同学习,效果往往优于后期对齐或顺序式训练。延迟融合还可能引发“视觉懒惰”——模型更倾向依赖语言先验,而不是主动使用视觉信息。
- 训练配方可以大幅省算力:作者总结出一套高效预训练方案,在生成性能上只用到约 5% 的算力预算也能取得较强结果。
这项研究意味着什么
这篇论文的价值不在于提出一个单点技巧,而在于把多模态预训练从“经验堆叠”推进到“机制归纳”。对于行业来说,这有两个直接启发:第一,做多模态模型不应只看是否接上视觉编码器,更要看模态之间是否真的形成信息流;第二,训练策略比很多人想象得更早影响最终能力,尤其是视觉能力是否会被语言主导。
作者还提到,这些发现随后在更大规模的训练中得到验证,包括训练多个 13.5B MoE 模型、使用 2T tokens 的设定。虽然这不会立刻改变所有产品路线,但它确实为统一多模态预训练提供了一套更可操作的设计原则。
评论
正在确认登录状态……
正在加载评论……