返回文章列表
多模态

KVAE:面向多模态生成的音频、图像与视频分词器家族

阅读约 2 分钟

导语

在潜在扩散模型(LDM)中,tokenizer 往往决定了模型“看见”音频、图像或视频的方式。它把高维原始信号压缩到潜空间,既影响训练速度,也影响生成质量,还会限制后续应用的上限。Kandinsky Lab 的技术报告《KVAE: Family of Tokenizers for Multimodal Generative Models》正是围绕这一基础环节展开:团队发布了一组面向文本条件生成的 KVAE tokenizer,覆盖音频、图像和视频三种模态。

核心要点

  • 多模态统一布局:KVAE 不是单一模型,而是一组 tokenizer 家族,包括 KVAE-Audio、KVAE-3D 和 KVAE-2D,分别服务于音频、视频和图像生成。
  • 音频方向:KVAE-Audio 是连续式全频带 48 kHz tokenizer,潜变量频率为 50 Hz,通道数为 64,面向后续音频生成任务。
  • 视频方向:KVAE-3D 提供两种因果视频 tokenizer,对应 4x16x16 与 4x8x8 两种压缩配置。因果设计对视频生成尤其重要,因为它更贴近时间序列建模的需求。
  • 图像方向:KVAE-2D 将图像按 8 倍压缩,并使用 32 个潜空间通道,定位于图像潜扩散生成的基础编码器。
  • 评测维度较完整:报告同时关注重建质量与生成效果。重建指标包括 PSNR、LPIPS、PESQ 等;生成侧则比较 Frechet Distance、CLIP score、CLAP score,并加入主观的 side-by-side 评估。

意义与影响

这项工作的价值不只在于“又发布了一个 VAE”。在扩散模型工程中,tokenizer 常常被低估:它压缩得越好,后续生成模型越容易学习;它保留的信息越合理,生成结果越可能兼顾细节、语义和稳定性。KVAE 把音频、图像、视频三个方向放在同一技术报告中讨论,说明多模态生成正在从单点模型竞争,转向底层表示与压缩方案的竞争。

报告称,KVAE 在多项客观和主观指标上可匹敌或超过 Wan-2.2、HunyuanVideo-1.5、FLUX.2、MovieGen、StableAudio、MMAudio 等开源或公开体系中的 tokenizer。需要注意的是,这些结果仍应结合论文中的实验设置理解,但其公开推理代码、权重、训练细节、模型选择方法和设计消融,降低了社区验证与二次开发的门槛。

如果后续文本到视频、文本到音频或统一多模态生成模型要进一步提升效率与质量,类似 KVAE 这样的基础 tokenizer 会成为关键组件。它未必直接面向普通用户,却可能影响下一代生成模型的训练成本、输出质量和可扩展性。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章