記事一覧へ戻る
拡散モデル

Chimera:長尺動画生成に向けたハイブリッド視覚拡散モデル

読了目安 3 分

導入

画像生成と動画生成は、より高解像度、より長い時間軸、より複雑なマルチモーダル条件へと進んでいます。その一方で、標準的な全注意 Transformer はシーケンス長に対して二次的に計算量が増えるため、長尺動画の拡散モデルでは大きな制約になります。Chimera は、この問題に対して提案されたハイブリッド型の視覚拡散バックボーンです。

主要なポイント

  • テキスト・画像・動画を単一ストリームで処理:Chimera は、テキスト、画像、動画 token をラスタ順に並べた 1 本の系列として扱います。位置埋め込みを使わない点も特徴で、構造と順序そのものから時空間関係を学ばせる設計です。
  • 全注意だけに頼らない構成:Kimi Delta Attention(KDA)は O(N) の計算量で長文脈の状態追跡を担います。一方、Multi-head Latent Attention(MLA)を挿入することで、直接的なグローバル相互作用も確保します。さらに、モダリティを意識した短い畳み込みが局所的な空間・時間情報を補います。
  • 疎な MoE による容量拡張:Chimera は Sparse Mixture-of-Experts を用いて総パラメータ数を増やしつつ、実際に活性化される計算量を抑えます。論文で示された大規模モデルは 11B パラメータを持ち、活性化パラメータは 2B とされています。
  • HeteroP によるスケーリング:このモデルは均一な Transformer ブロックの積み重ねではないため、単純な幅・深さの拡大では調整が難しくなります。HeteroP は、各テンソルの機能的 fan-in とモデル深度に基づいてハイパーパラメータを移し替え、一貫して調整されたモデル系列を作ります。

意義と影響

論文によれば、事前学習時の拡散損失で見ると、Chimera の密なバックボーンは対応する全注意型 Wan-2.1 2B ベースラインに比べて 1.7 倍の計算効率を示し、完全なシステムでは 7.3 倍に達します。また、長さ専用の微調整なしに、5 秒の訓練クリップから 30 秒動画へゼロショットで外挿し、最後の 5 秒での FID 劣化は 6.5% にとどまったとされています。

この結果は、長尺動画の拡散モデルを作るうえで、全注意を単純に大規模化するだけでは不十分である可能性を示します。線形時間の状態追跡、限定的なグローバル相互作用、局所畳み込み、MoE による容量拡張を組み合わせる方向が、今後の有力な設計候補になり得ます。

ただし、ここで扱える情報は主に要旨レベルです。データの詳細、生成品質の人手評価、実運用時のコストなどは論文本体での確認が必要です。それでも Chimera は、長文脈の視覚生成モデルがより異種混合的で、計算効率を重視した設計へ向かっていることを示す研究といえます。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
ソニーの SPA、スペクトル事前分布で拡散モデルの Exposure Bias を軽減
拡散モデル
cctest.ai
拡散モデル

ソニーの SPA、スペクトル事前分布で拡散モデルの Exposure Bias を軽減

ソニーの研究チームは、拡散モデルとフローマッチングモデルの推論時誤差を周波数領域で補正する Spectral Alignment(SPA)を提案した。事前に学習したスペクトル先験を使い、中間予測のパワースペクトルを軽量に校正する。

続きを読む