MiniMax H3 实时生成的关键,不只是把 DiT 跑得更快
导语
视频生成服务的性能,往往不取决于单个模型模块的峰值速度。MiniMax H3 同时生成视频和同步音频,一次请求要经过视觉语言编码器、长序列音视频 DiT、视频与音频 VAE,随后还要完成 GPU 到 CPU 的传输、进程间通信以及 H.264/AAC 封装。vLLM-Omni 的实践说明,若只优化 DiT,仍会留下大量系统开销。
核心要点
- 先做全链路优化。 对长序列注意力,vLLM-Omni 传递有效序列长度、减少结构性填充,并让各 rank 只构造本地所需的嵌入和 RoPE 数据;Fast Ulysses 借助 NCCL SymmetricMemory 减少注意力前后的布局重排。
- 融合重复出现的算子。 Q/K RMSNorm 与 RoPE、调制与归一化、残差计算,以及 SwiGLU 等操作被合并,目标是降低 49 次扩散前向中频繁的小算子启动成本。
- 让解码和输出不再成为新瓶颈。 视频 VAE 采用八卡分片解码,音视频并行处理。解码后的帧在 GPU 上直接转换为紧凑的 uint8 格式,再通过固定内存和进程间通道传输,并以平面数据送入 H.264 编码,避免反复创建大型中间缓冲区。
- FastH3 攻击剩余的主要耗时。 FastVideo 将 MiniMax H3 的 49 次 DiT 前向缩减为 4 次。在 8 张 NVIDIA B300、1344×768、24 FPS 的独立测试中,生成完整的 10.125 秒 MP4 用时 8.678 至 8.710 秒,满足“完整响应早于播放结束”的实时标准。
数据应如何解读
基础系统对比使用 50 个 sigma 点和 49 次 DiT 前向。在相同提示词与种子的一组实验中,vLLM-Omni 的客户端端到端耗时为 56.917 秒,其中 DiT 总耗时 51.800 秒,视频与音频 VAE 共耗时 0.952 秒,MP4 封装耗时 1.528 秒;Diffusers 参考实现为 82.239 秒。文章将其描述为 30.8% 的完整响应延迟下降,但这一结果属于基础 H3 系统优化,并不等同于 FastH3 的加速比。
需要注意的是,FastH3 与基础系统使用了不同的代码版本、提示词、种子和实验产物。因此,素材只报告 FastH3 的绝对延迟,没有将两组数据直接相除。这里的“实时”也有明确边界:它指完整 MP4 已生成且可播放,不代表首帧延迟更低,也不代表边生成边传输。
意义与影响
这项工作对多模态推理服务的启示是,模型计算只是链路的一部分。扩散步数减少后,VAE、数据搬运和媒体编码会迅速显露出来,只有把内存布局、通信、解码和封装一起设计,低延迟才可能转化为用户真正感知到的响应速度。对服务商而言,完整媒体交付时间应成为核心指标,而不是只看 DiT 的执行时间或首帧表现。
来源:vLLM Blog
评论
正在确认登录状态……
正在加载评论……