返回文章列表
多模态

Kandinsky 6.0 Video:让视频生成同时具备画面、声音与口型同步

阅读约 3 分钟

导语

视频生成正在从“先生成画面、再补配声音”转向音视频协同建模。Kandinsky Lab 发布的 Kandinsky 6.0 Video,试图把人物动作、环境声、对白和口型放进同一个生成流程中。该系列包含 3B 参数的 Lite 版和 29B 参数的 Pro 版,能够根据文字或输入图像生成约 5 秒、带同步 44 kHz 音频的视频,并支持唇形同步。生成结果还可以通过内置超分辨率模型提升至 Full-HD,即 1920×1080。

核心技术:两条生成流相互“对话”

Kandinsky 6.0 Video 延续了 Kandinsky 5.0 的视频生成能力,但没有简单地把音频模块附加到视频模型之后。它采用双流 CrossDiT 架构:一条是预训练的视频流,另一条是从头训练的音频流,二者通过双向交叉注意力交换信息。

这种设计的关键在于,音频不再只是视频生成完成后的配乐。声音节奏、说话内容和画面中的动作可以在生成过程中相互影响,从而改善时间对齐、语义一致性以及人物说话时的口型匹配。训练过程先利用大规模音频语料训练音频流,再在成对的音视频数据上联合训练,同时尽量保留音频和视频各自的单模态质量。之后,模型还经过监督微调、基于强化学习的后训练以及蒸馏,以降低推理成本;素材提到的蒸馏版本可使用 10 步生成。

评测表现与开放策略

根据素材披露的 VABench 结果,Kandinsky 6.0 Video Pro 在语音质量、音频审美、音画对齐、唇形同步、不同步程度和视觉真实感等指标上,在所列出的 LTX 2.5、Kandinsky Lite 与 Kandinsky Pro 中取得最佳结果。人工对比中,Pro 版明显优于 Kandinsky 5.0 Video Pro;相较 LTX 2.5,它在视觉质量、运动真实感、提示词遵循、伪影控制和综合任务完成度方面更受偏好,语音质量也具有统计显著优势。强化学习后训练还使 Pro 版的语音词错误率下降 47%。这些结果说明,模型的改进并不局限于画面清晰度,而是覆盖了“看起来像真实视频”和“听起来、说起来同步”两个维度。

项目还单独发布了 1.4B 参数的视频超分辨率模型,支持 ×2、×2.25 和 ×4 放大,并在 KVAE 潜空间中处理视频。其蒸馏版本每个切片只需两次模型评估,有助于处理高分辨率视频的计算压力。

意义与局限

对短视频创作、角色对白、教育演示和多媒体原型开发而言,音视频一体化生成可以减少后期配音、对口型和时间轴校正工作。MIT 许可证、模型权重、源代码和 Diffusers 集成的同步开放,也降低了研究者和开发者试用这套方案的门槛。

不过,当前公开描述的主要能力仍集中在约 5 秒片段。更长时长的叙事连续性、复杂多人对话、声音身份稳定性以及实际部署成本,仍需通过代码、权重和更多独立测试进一步验证。Kandinsky 6.0 Video 的价值,首先在于展示了开放模型如何把视频、语音与音画同步纳入统一生成框架,而不是仅凭单项画质参与竞争。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章