LLaDA-Image:以开放训练配方打造统一图像生成与编辑模型
导语
开源图像生成模型正在从“能生成图片”走向“理解指令并持续编辑图片”。论文《LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes》提出了一套统一的生成与编辑模型家族,核心目标是在保持视觉质量的同时,提升对细粒度指令、参考图像和多语言文字的处理能力。
核心方案
LLaDA-Image 的主体是一个从零训练的 6B 参数 Diffusion Transformer(DiT)。与仅依赖大规模图文配对数据的路线不同,研究团队先进行图像-only 预训练和中期训练,利用约 2.2 亿个样本建立更稳固的视觉生成先验;随后再结合文本条件与理解能力。其视觉语言理解模块建立在 LLaDA2.0-Mini 扩散语言模型骨干之上,并在训练中保持冻结。
这一设计把“视觉生成能力”和“语言理解能力”进行了相对清晰的分工:DiT 负责图像空间中的生成建模,冻结的理解模块则帮助模型解析编辑指令和多模态条件。模型支持文本生成、VQ 条件生成、基于参考图像的编辑,以及中英文文字渲染。
训练效率也是论文强调的部分。作者在 DiT 中统一使用无参数 RMSNorm,并配合 Muon 优化器,以降低大规模优化的复杂度。论文没有只发布模型文件,还同步开放训练代码和较为完整的训练配方,这使得外部研究者能够更直接地复现实验或继续改进。
两个版本
- LLaDA-Image Base:采用 50 步采样,面向高质量文本到图像生成和指令驱动编辑。
- LLaDA-Image-Turbo:通过蒸馏减少采样步骤,支持 2—4 步推理,更适合对响应速度敏感的应用场景。
评测与影响
根据论文摘要,LLaDA-Image 在 Qwen-Image-Bench 英文和中文赛道上的综合得分分别为 53.53 和 53.38,并被报告为两个赛道中开源模型的最佳成绩。更重要的是,它把生成、编辑、参考图像控制和文字渲染放进同一模型家族,体现出开源图像模型从单一任务向统一能力平台演进的趋势。
不过,现有素材主要展示了方法、能力范围和总体成绩,尚未提供训练成本、数据授权细节以及各项能力的分项对比。因此,LLaDA-Image 的开放价值不仅取决于榜单表现,也取决于后续社区能否依据公开配方验证其可复现性,并检验模型在不同分辨率、复杂编辑和真实生产环境中的稳定性。
评论
正在确认登录状态……
正在加载评论……