記事一覧へ戻る
拡散モデル

DiffusionGemma:離散拡散でLLMの逐次生成ボトルネックに挑む

読了目安 3 分

導入

現在の大規模言語モデルの多くは、自己回帰型の仕組みに依存しています。つまり、最初のトークンを出し、その結果を使って次のトークンを出す、という流れを最後まで繰り返します。この方式は高品質な生成を支えてきましたが、同時に推論速度の大きな制約にもなっています。

DeepMind チームの技術報告で紹介された DiffusionGemma は、この前提に別の角度から挑戦します。モデルはテキストを1トークンずつ確定するのではなく、256トークンのブロックを並列に扱い、離散拡散によって反復的に修正します。目的は、自己回帰型モデルの逐次デコードのボトルネックを避けながら、実用的な言語能力を保つことです。

主なポイント

  • ブロック単位の並列生成:DiffusionGemma は 256 トークンのまとまりを対象にし、複数回の前向き計算で内容を整えていきます。これにより、各トークンが前のトークンの完了を待つ構造を弱めます。
  • テキスト向けの離散拡散:拡散モデルは画像生成でよく知られていますが、テキストは離散的な記号列です。DiffusionGemma は双方向のノイズ除去を学習し、乱れたトークン列からより自然な出力を復元する方向で設計されています。
  • Gemma 4 からの微調整:ゼロから訓練するのではなく、3.8B の活性化パラメータと 25.2B の総パラメータを持つ Gemma 4 の Mixture-of-Experts モデルを出発点にしています。報告によると、拡散化のための学習は元の自己回帰モデルの総学習トークン予算の 10% 未満で済んでいます。
  • 二段階の学習手法:第一段階では教師あり微調整で双方向ノイズ除去を教えます。第二段階では強化学習とサンプラー蒸留を組み合わせ、生成品質と推論効率の両方を改善します。
  • 高い生成速度:評価全体の平均で、1回の前向き計算あたり約20トークンを生成し、単一の NVIDIA H100 GPU 上で約1,500出力トークン/秒に達するとされています。
  • 既存能力の維持:拡散向けに微調整された後も、思考モード、マルチモーダル入力、長いコンテキストへの対応を維持すると報告されています。また、自己回帰生成も小さな性能低下で可能だとされています。

意義と影響

DiffusionGemma の重要性は、LLM の高速化を単なるエンジニアリング最適化ではなく、生成方式そのものの再設計として提示している点にあります。もし拡散ベースのテキスト生成が品質を保ちながら高スループットを実現できるなら、推論サービスのコスト構造に大きな影響を与える可能性があります。

特に、長文生成、対話型アシスタント、大量コンテンツ生成のように出力速度が重要な場面では、1回の計算でより多くのトークンを進められることが大きな利点になります。一方で、この報告は DiffusionGemma が自己回帰生成能力も残している点を示しており、将来的には拡散と自己回帰を組み合わせたハイブリッドなデコード方式が現れる可能性もあります。

ただし、現段階では実験的なモデルとして見るべきです。概要だけでは、タスクごとの弱点や運用上の制約までは十分に判断できません。それでも、DiffusionGemma は「より大きなモデル」だけでなく「どう生成するか」も LLM 競争の重要な軸になることを示しています。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
視覚生成におけるテキスト条件のスケーリング則を探る
拡散モデル
cctest.ai
拡散モデル

視覚生成におけるテキスト条件のスケーリング則を探る

この論文は、画像生成におけるプロンプトの長さではなく、構造化された言語情報が拡散モデルの学習損失にどう関係するかを調べている。著者らはその知見を使い、構造化プロンプトと専用 prompter による生成性能の改善を試みた。

続きを読む
CCTest · Blog
Explorative Modeling、生成モデルに「探索」という第3のスケーリング軸を導入
拡散モデル
cctest.ai
拡散モデル

Explorative Modeling、生成モデルに「探索」という第3のスケーリング軸を導入

Explorative Modeling は、生成結果とデータの対応を複数探索し、最良の候補から学習する新しい生成モデリング手法です。論文は、探索量がパラメータ数・データ量に続く第3の事前学習スケーリング軸になり得ると主張しています。

続きを読む
CCTest · Blog
Chimera:長尺動画生成に向けたハイブリッド視覚拡散モデル
拡散モデル
cctest.ai
拡散モデル

Chimera:長尺動画生成に向けたハイブリッド視覚拡散モデル

Chimera は、高解像度画像や長尺動画の生成で問題になる全注意機構の計算コストを抑えるための、ハイブリッド型視覚拡散バックボーンです。KDA、MLA、短い畳み込み、疎な MoE、そして HeteroP というスケーリング手法を組み合わせています。

続きを読む