EditBridge:让扩散模型更忠实地编辑4K图像
EditBridge提出一种面向超高分辨率图像编辑的扩散桥框架,不再把低分辨率编辑结果简单交给独立超分辨率模型处理,而是利用原始高清图像补回真实细节。论文称,该方法可在2K分辨率下实现3.6至8.4倍加速,并将4K编辑耗时控制在61秒。
阅读全文EditBridge提出一种面向超高分辨率图像编辑的扩散桥框架,不再把低分辨率编辑结果简单交给独立超分辨率模型处理,而是利用原始高清图像补回真实细节。论文称,该方法可在2K分辨率下实现3.6至8.4倍加速,并将4K编辑耗时控制在61秒。
阅读全文DeepMind 团队在技术报告中介绍了 DiffusionGemma:一个基于 Gemma 4 微调而来的开放权重实验模型,用离散扩散方式并行生成文本。它的核心看点不是参数规模,而是试图把文本生成从“一个 token 接一个 token”推进到“成块迭代细化”。
阅读全文这篇论文研究了视觉生成中文本条件的经验缩放规律,指出真正起作用的并不只是提示词长度,而是提示中结构化语言的含量。作者进一步用这些规律改进训练数据与提示生成器,使系统在多类图像生成评测中取得更强表现。
阅读全文这篇论文提出 Explorative Modeling,通过在训练阶段探索多个候选匹配并选择最优项,让生成模型更明确地落到数据分布的不同模式上。作者认为,探索规模可成为参数量和数据量之外的第三条预训练缩放轴。
阅读全文Adobe 研究团队提出 Chimera,一种面向图像与视频生成的混合视觉扩散骨干网络,试图在长上下文场景中降低全注意力的计算成本。论文还给出 HeteroP 缩放方法,并用类似 Chinchilla 的规律指导模型规模与数据配比。
阅读全文NVIDIA 相关研究提出 Parallel Decoding Distillation(PDD),试图用更简单、可扩展的轨迹蒸馏方式,让扩散与流匹配模型在少量网络评估下完成高质量生成。
阅读全文索尼研究团队提出 Spectral Alignment(SPA),试图从频率域校准扩散与流匹配模型在推理过程中的误差累积。该方法只在推理阶段加入轻量引导,号称额外计算开销约 3%–4%。
阅读全文一篇新论文用因果可解释性方法研究文生图 Diffusion Transformer,发现文本模板 token 虽然在编码器输出处几乎不携带具体提示词信息,却会在生成过程中成为维持对象身份的关键语义寄存器。
阅读全文Mage-Flow 试图证明,图像生成模型的竞争力不只来自参数规模,也来自 tokenizer、主干网络与训练系统的协同设计。它以 4B 规模同时覆盖文生图和指令式图像编辑,并提供 Base、RL 对齐和 4 步 Turbo 版本。
阅读全文DiFA 是一个无需重新训练的扩散模型推理框架,试图用前向扩散过程的统计结构来校准反向生成轨迹。它将历史预测视为相关观测,通过时间共识和偏差引导提升生成稳定性与细节保留。
阅读全文DiffGI 针对服装等薄壳、非流形 3D 形状难以被体表示准确建模的问题,提出以连续 2D TSDF 和可微 Marching Squares 连接 2D 潜空间与 3D 表面优化。它的重点不是单纯换一种编码,而是让表面重建从后处理变成可训练链路的一部分。
阅读全文UT Austin 研究者提出 Token Time Continuous Diffusion(TTCD),试图用连续空间和逐 token 时间机制提升扩散语言模型在高速生成下的质量。它在条件生成和数独求解等任务中显示出相对离散扩散模型的优势。
阅读全文一篇 arXiv 新论文提出 Cyclone,将潜在扩散模型、循环一致性约束与图文模型知识结合,用于自动驾驶场景中的多天气编辑。它的重点不是单纯“加雨加雾”,而是在无需成对数据的情况下生成更真实且保留结构的驾驶图像。
阅读全文一篇新论文提出 HTFM,把重尾源分布看作由随机时钟调制的高斯混合,从而让流匹配模型更适合极端事件、长尾类别和金融/天气等数据。该方法在保持低采样步数优势的同时,试图改善模式覆盖、样本质量与尾部统计恢复。
阅读全文TCAM-Diff 面向高分辨率 3D 医学影像生成,将稠密体数据压缩到三平面表示,并用跨注意力扩散模型学习这些特征。论文称,该方法在脑肿瘤、胰腺和结肠数据集上取得了优于同等潜空间规模编码器-解码器方案的结果。
阅读全文