Kandinsky 6.0 Video、映像・音声・リップシンクを同時生成
導入
動画生成の競争軸は、映像の美しさだけから、音声や動きとの整合性へ広がっています。人物が話す動画では、発話内容、声のタイミング、顔の動き、口の形が揃って初めて自然に見えます。Kandinsky Labが公開したKandinsky 6.0 Videoは、この課題を音声と映像の同時生成として扱うモデル群です。
ラインアップは、3BパラメータのKandinsky 6.0 Video Liteと、29BパラメータのProです。いずれもテキストまたは画像を入力として、約5秒の動画と同期した44 kHz音声を生成し、リップシンクにも対応します。内蔵の超解像モデルを使えば、出力をFull HD、つまり1920×1080まで引き上げられます。
中核技術は双方向の音声・映像連携
Kandinsky 6.0 Videoは、動画生成器の後段に音声を付け足す構成ではありません。Dual-stream CrossDiTによって、事前学習済みの動画ストリームと、新たに学習した音声ストリームを分けて持ち、双方向のクロスアテンションで接続します。
この構成の意味は、同期を単なるタイムスタンプ合わせとして扱わない点にあります。音声のリズムや発話内容は人物の動きと関係し、映像の状況は生成すべき音や声の手がかりになります。両ストリームが生成中に情報を交換できれば、後処理で口パクや効果音を修正するよりも、意味と時間の整合をモデル内部で扱いやすくなります。
学習は段階的です。まず大規模な音声コーパスで音声ストリームをゼロから訓練し、その後、音声と映像が対になったデータで両者を共同学習します。この際、音声単独・映像単独での品質を維持することも重視されています。さらに教師あり微調整、強化学習ベースの後処理、蒸留を行います。素材では、10ステップでの生成を可能にする蒸留にも触れています。
評価結果から見える強み
公開素材に記載されたVABenchでは、Kandinsky 6.0 Video Proが、比較対象として挙げられたLTX 2.5、Kandinsky Lite、Kandinsky Proに対し、音声品質、音声の美的品質、音画の整合、リップシンク、非同期の少なさ、視覚的リアリズムで最良の結果を示したとされています。
人手評価では、前世代のKandinsky 5.0 Video Proを明確に上回りました。LTX 2.5との比較でも、視覚品質、動きのリアリティ、プロンプト追従、アーティファクトの少なさ、総合的な課題達成でProが好まれ、音声品質では統計的に有意な優位が報告されています。また、強化学習による後学習によって、Proの音声単語誤り率が47%低下したと素材は説明しています。
超解像とオープン公開
別途、1.4Bパラメータの動画超解像拡散Transformerも公開されました。KVAEの潜在空間で動画を処理し、×2、×2.25、×4の拡大に対応します。蒸留版のπ-Flow DXは、タイルごとに2回のモデル評価で処理できるとされています。
コード、重み、Diffusers統合はMITライセンスで公開されています。短編動画、キャラクターの会話、教育コンテンツ、映像プロトタイプでは、後からの吹き替えや口パク修正を減らせる可能性があります。一方、公開情報の中心は約5秒のクリップです。長時間のストーリー整合性、複数人の会話、人物や声の一貫性、実運用時の計算コストは、今後の検証課題として残ります。
コメント
ログイン状態を確認中…
コメントを読み込み中…