返回文章列表
扩散模型

LLaDA-Image:以开放训练配方打造统一图像生成与编辑模型

阅读约 2 分钟

导语

开源图像生成模型正在从“能生成图片”走向“理解指令并持续编辑图片”。论文《LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes》提出了一套统一的生成与编辑模型家族,核心目标是在保持视觉质量的同时,提升对细粒度指令、参考图像和多语言文字的处理能力。

核心方案

LLaDA-Image 的主体是一个从零训练的 6B 参数 Diffusion Transformer(DiT)。与仅依赖大规模图文配对数据的路线不同,研究团队先进行图像-only 预训练和中期训练,利用约 2.2 亿个样本建立更稳固的视觉生成先验;随后再结合文本条件与理解能力。其视觉语言理解模块建立在 LLaDA2.0-Mini 扩散语言模型骨干之上,并在训练中保持冻结。

这一设计把“视觉生成能力”和“语言理解能力”进行了相对清晰的分工:DiT 负责图像空间中的生成建模,冻结的理解模块则帮助模型解析编辑指令和多模态条件。模型支持文本生成、VQ 条件生成、基于参考图像的编辑,以及中英文文字渲染。

训练效率也是论文强调的部分。作者在 DiT 中统一使用无参数 RMSNorm,并配合 Muon 优化器,以降低大规模优化的复杂度。论文没有只发布模型文件,还同步开放训练代码和较为完整的训练配方,这使得外部研究者能够更直接地复现实验或继续改进。

两个版本

  • LLaDA-Image Base:采用 50 步采样,面向高质量文本到图像生成和指令驱动编辑。
  • LLaDA-Image-Turbo:通过蒸馏减少采样步骤,支持 2—4 步推理,更适合对响应速度敏感的应用场景。

评测与影响

根据论文摘要,LLaDA-Image 在 Qwen-Image-Bench 英文和中文赛道上的综合得分分别为 53.53 和 53.38,并被报告为两个赛道中开源模型的最佳成绩。更重要的是,它把生成、编辑、参考图像控制和文字渲染放进同一模型家族,体现出开源图像模型从单一任务向统一能力平台演进的趋势。

不过,现有素材主要展示了方法、能力范围和总体成绩,尚未提供训练成本、数据授权细节以及各项能力的分项对比。因此,LLaDA-Image 的开放价值不仅取决于榜单表现,也取决于后续社区能否依据公开配方验证其可复现性,并检验模型在不同分辨率、复杂编辑和真实生产环境中的稳定性。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
DiffusionGemma:用离散扩散打破大模型逐词生成瓶颈
扩散模型
cctest.ai
扩散模型

DiffusionGemma:用离散扩散打破大模型逐词生成瓶颈

DeepMind 团队在技术报告中介绍了 DiffusionGemma:一个基于 Gemma 4 微调而来的开放权重实验模型,用离散扩散方式并行生成文本。它的核心看点不是参数规模,而是试图把文本生成从“一个 token 接一个 token”推进到“成块迭代细化”。

阅读全文
CCTest · Blog
文本条件也有缩放规律?这篇论文重新审视视觉生成提示词
扩散模型
cctest.ai
扩散模型

文本条件也有缩放规律?这篇论文重新审视视觉生成提示词

这篇论文研究了视觉生成中文本条件的经验缩放规律,指出真正起作用的并不只是提示词长度,而是提示中结构化语言的含量。作者进一步用这些规律改进训练数据与提示生成器,使系统在多类图像生成评测中取得更强表现。

阅读全文