返回文章列表
扩散模型

Chimera:面向长视频生成的混合视觉扩散架构

阅读约 2 分钟

导语

高分辨率图像、长视频和多模态条件正在把视觉生成模型推向更长的上下文窗口。传统全注意力 Transformer 虽然表达能力强,但计算量随序列长度呈二次增长,在长视频生成中很快变得昂贵。Adobe 等作者提出的 Chimera,正是针对这一瓶颈设计的混合视觉扩散骨干网络。

核心要点

  • 统一处理多模态视觉 token:Chimera 将文本、图像和视频 token 放在一个按栅格顺序排列的序列中处理,并且不使用位置嵌入。这意味着模型试图通过结构本身和数据顺序来学习跨模态、跨时空关系。
  • 用混合模块替代纯全注意力:模型引入 Kimi Delta Attention(KDA)承担长上下文状态跟踪,复杂度为 O(N);同时穿插 Multi-head Latent Attention(MLA),为 token 提供直接的全局交互通道;再通过面向不同模态的短卷积捕捉局部时空信息。
  • MoE 扩展容量但控制激活计算:Chimera 使用稀疏混合专家层扩大总参数规模。论文中训练的版本总参数为 11B,但每次计算只激活约 2B 参数,以在容量和成本之间取得平衡。
  • HeteroP 解决异构架构缩放问题:由于 Chimera 不是单一 Transformer 堆叠,宽度、深度和不同张量的超参数不能简单套用同一规则。HeteroP 按模块功能 fan-in 和模型深度迁移超参数,使研究者能够得到一组调校一致的模型家族,再拟合类似 Chinchilla 的计算最优规律。

实验结果与意义

论文报告称,以预训练扩散损失衡量,Chimera 的稠密骨干相比匹配的全注意力 Wan-2.1 2B 基线计算效率提升 1.7 倍;完整系统达到 7.3 倍。更值得关注的是,在没有针对视频长度做专门微调的情况下,它可从 5 秒训练片段零样本外推到 30 秒视频,最后 5 秒的 FID 仅下降 6.5%。

这些结果说明,长视频扩散模型的关键可能不只是“堆更多全注意力层”,而是把线性复杂度的状态机制、少量全局交互、局部卷积和 MoE 容量扩展组合起来。HeteroP 与计算最优规律也提示,视觉生成模型正在进入更系统化的缩放阶段:不仅要决定模型有多大,还要决定激活参数、训练 token 数以及图像与视频数据比例如何分配。

当然,素材主要来自论文摘要,更多生成质量、人类偏好、训练数据细节和部署成本仍需阅读完整论文验证。但 Chimera 提供了一个清晰信号:面向长视频和多模态生成的扩散架构,正在从标准 Transformer 向更异构、更计算感知的方向演进。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章