記事一覧へ戻る
マルチモーダル

KVAE:音声・画像・動画生成に向けたTokenizerファミリー

読了目安 3 分

導入

潜在拡散モデル(LDM)では、tokenizer の品質が生成モデル全体の性能を大きく左右する。画像、音声、動画といった高次元データは、そのまま扱うのではなく、まず圧縮された潜在表現へ写像される。この変換がうまくいかなければ、後段の生成モデルがいくら強力でも、学習効率や生成品質に限界が生じる。

Kandinsky Lab の技術報告「KVAE: Family of Tokenizers for Multimodal Generative Models」は、この基盤部分に焦点を当てている。KVAE は単一の tokenizer ではなく、音声、画像、動画の各モダリティに対応したファミリーとして設計され、いずれもテキスト条件付きの潜在拡散生成で使うことを想定している。

主なポイント

  • 多モーダル対応:KVAE は KVAE-Audio、KVAE-3D、KVAE-2D からなり、音声、動画、画像の tokenizer をまとめて提供する。
  • 音声モデル:KVAE-Audio は連続表現を用いるフルバンド 48 kHz tokenizer で、潜在表現は 50 Hz、64 チャンネルという構成になっている。
  • 動画モデル:KVAE-3D は 4x16x16 と 4x8x8 の圧縮設定を持つ 2 種類の因果的動画 tokenizer を提供する。時間方向の扱いを考えると、因果性は動画生成において重要な設計要素となる。
  • 画像モデル:KVAE-2D は入力画像を 8 倍に圧縮し、32 チャンネルの潜在表現を使う。
  • 評価の幅:報告では PSNR、LPIPS、PESQ などの再構成指標に加え、Frechet Distance、CLIP score、CLAP score など生成品質に関わる指標、さらに side-by-side の主観評価も扱っている。

意義と影響

KVAE の重要性は、tokenizer を単なる前処理としてではなく、生成モデルの中核部品として扱っている点にある。潜在表現が情報を適切に保持し、かつ効率よく圧縮されていれば、後段の拡散モデルはより学習しやすくなる。逆に、圧縮で重要な情報が失われれば、生成結果の細部や一貫性に影響が出る。

報告によれば、KVAE は Wan-2.2、HunyuanVideo-1.5、FLUX.2、MovieGen、StableAudio、MMAudio などの前線的なオープンソース tokenizer と比較して、客観指標および主観評価で同等またはそれ以上の結果を示したとされる。もちろん、こうした比較は実験条件と合わせて読む必要があるが、推論コード、重み、学習の詳細、モデル選択方法、設計選択の消融が公開されている点は、再現と検証の面で大きい。

今後、テキストから動画、テキストから音声、あるいは統合的な多モーダル生成モデルを構築するうえで、KVAE のような基盤 tokenizer は重要な選択肢になり得る。生成品質の競争は、モデル本体だけでなく、どのような潜在表現を使うかという層でも進んでいる。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
マルチモーダル事前学習の仕組みを整理する:知識の流れ、協調、早期統合
マルチモーダル
cctest.ai
マルチモーダル

マルチモーダル事前学習の仕組みを整理する:知識の流れ、協調、早期統合

この研究は、単なるモデル提案ではなく、統合型マルチモーダル事前学習の内部で何が起きているかを実験的に整理したものです。知識の流れ、モダリティ間の協調、早期統合、効率的な学習レシピの4点が柱です。

続きを読む
CCTest · Blog
VAD:マルチモーダル蒸留で教師の補正から視覚証拠を切り出す
マルチモーダル
cctest.ai
マルチモーダル

VAD:マルチモーダル蒸留で教師の補正から視覚証拠を切り出す

VAD は、マルチモーダル on-policy 蒸留における教師モデルの補正が、本当に画像証拠に基づいているのかを推定する手法です。教師の出力をそのまま模倣するのではなく、視覚的に帰属できる成分から学生モデルの学習目標を再構成します。

続きを読む