返回文章列表
多模态

Multimodal Flow:把语言与视觉放进同一条连续生成路径

阅读约 3 分钟

导语

当前的统一多模态模型通常有两条路线:一条把文本和图像都转换成离散令牌,另一条则让语言继续使用离散预测、图像采用连续生成。前者容易受到视觉量化损失的限制,后者需要为不同模态设计不同的训练目标与采样流程。HUST Vision Lab 提出的 Multimodal Flow,试图从表示空间和生成机制两方面消除这种割裂。

核心方法

  • 统一的连续表示:模型不把图像压缩成离散视觉词表,而是直接使用多模态连续表示。文本块与图像被组织成有序的“连续超块”,文本仍然保留令牌顺序,图像则保留空间结构。
  • 共享流模型骨干:Multimodal Flow 使用 chunk-causal 架构,在 Flow Matching 框架下学习覆盖这些超块的单一向量场。这样,语言和视觉可以参与同一个连续生成过程,而不必分别采用自回归语言建模和图像扩散式采样。
  • 跨模态交互与模态适配:联合注意力负责让文本和图像相互影响;与此同时,模态专属的前馈网络承担各自的特征处理,试图在共享建模与模态差异之间取得平衡。
  • 训练和推理分工:训练阶段,模型可以并行预测多个目标超块,以提高学习效率;推理阶段,则按顺序逐步生成超块,从而形成统一但具有因果结构的生成流程。

实验信息

论文以 MF-1 为实例开展多模态预训练,并比较了 0.6B、1.2B 和 1.6B 三种规模。摘要显示,持续预训练在不同规模上都能带来稳定的多模态能力提升。在使用 150B 预训练 token 的设置下,模型在 GenEval 与 DPG-Bench 上的平均分为 82.8,在 VQAv2、MMBench 与 POPE 上的平均分为 75.3。作者还报告称,在数据、优化方式和参数预算相匹配的条件下,Multimodal Flow 优于具有代表性的混合式与离散式模型。

意义与局限

这项工作的价值不只是提出一种新的图像生成方式,更在于重新思考统一多模态模型的基本单位:它不再强行把视觉变成语言式离散 token,而是把文本和图像都视为连续空间中的结构化块。若这一方向能够进一步扩展,语言理解、图像生成和跨模态推理或许可以共享更多底层机制,模型训练与部署也有机会减少模态专属组件。

不过,现有材料主要给出了方法概览和汇总指标,尚不足以判断其在长文本生成、复杂组合图像、推理速度、训练成本以及不同数据配比下的详细表现。连续建模是否能在更大规模和更多任务上持续优于成熟的离散或混合方案,仍需后续实验验证。

项目代码和模型已公开,为研究者复现实验、比较不同统一多模态范式提供了入口。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章