記事一覧へ戻る
拡散モデル

HC-DLM、並列拡散生成でトークン間の依存関係を維持

読了目安 3 分

導入

拡散言語モデルは、自動回帰生成とは異なる選択肢として研究されています。左から右へ1トークンずつ生成するのではなく、ノイズを含む系列全体を段階的に洗練できるため、双方向の推論やグローバルな制約充足を必要とする課題に適しています。一方で、並列生成の効率を保ちながら、同時に生成されるトークン同士の依存関係をどう維持するかが課題でした。

イリノイ大学アーバナ・シャンペーン校の研究チームは、Hierarchical Continuous Diffusion Language Models(HC-DLM)を提案しました。この手法は、離散トークン生成と連続潜在状態の更新を、別々の処理ではなく一つのデノイジング過程に組み込みます。

主なポイント

  • 離散拡散のボトルネック:複数位置を並列に復元すると、各トークンが周辺分布から独立にサンプリングされる可能性があります。並列性は得られますが、同時に生成されたトークン間の統計的依存が弱くなります。数独や数学的計画では、局所的に自然な出力でも全体制約に違反することがあります。
  • 連続拡散の限界:共有された連続状態をデノイズすることで系列全体の情報は保てます。しかし最終的に離散化されるまで、その状態と有効なトークン配置を結びつける明示的な信号が十分ではありません。
  • 唯一の持続状態:HC-DLMでは、連続潜在変数が生成中に残り続ける唯一の状態です。各ステップでそこからトークンを読み出し、その結果を次の潜在状態更新の足場として利用します。
  • 統一された学習目標:学習目的はトークン尤度の変分下限から導出されます。これにより、離散過程と連続過程を単純に接続するのではなく、同じ確率的枠組みで最適化できます。

結果と意味

論文では、構造化推論の数独、数学的計画のCountdown、言語モデリングのLM1Bを評価しています。著者らの報告によれば、同程度のモデル規模で、HC-DLMは離散および連続拡散のベースラインに対し、数独とCountdownの正解率、さらにLM1Bの生成困惑度で改善を示しました。提供された素材には具体的な改善幅がないため、これらは手法の有効性を示す報告として捉えるのが適切です。

この研究の要点は、連続表現を追加したことだけではありません。トークンは最終出力になるまで待つのではなく、各デノイジング段階で中間的な構造情報として次の潜在状態に影響を与えます。これにより、拡散モデルは全体の整合性と離散的な妥当性をより密接に扱える可能性があります。

ただし、現時点の素材には詳細なアブレーション、サンプリング速度、計算コスト、スケーリングに関する情報はありません。今後は、依存関係を保つ効果が追加の推論負荷に見合うのか、より大規模なモデルや一般的な言語タスクでも再現するのかを検証する必要があります。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
固定状態キャッシュがBlock Diffusionにもたらす長文脈性能
拡散モデル
cctest.ai
拡散モデル

固定状態キャッシュがBlock Diffusionにもたらす長文脈性能

3Bパラメータのblock diffusionを比較した研究で、状態空間型の系列ミキサーが正確でサイズ一定のキャッシュを実現できることが示された。長いコンテキストでは、Mambaが注意機構よりメモリ、遅延、スループットで大きく優位に立つ。

続きを読む
CCTest · Blog
LLaDA-Image:生成と編集を統合するオープンな画像モデル
拡散モデル
cctest.ai
拡散モデル

LLaDA-Image:生成と編集を統合するオープンな画像モデル

LLaDA-Imageは、ゼロから学習した6BパラメータのDiTと、凍結した視覚言語理解モジュールを組み合わせた画像生成・編集モデルです。蒸留版のTurboは推論を2〜4ステップに短縮し、重み・コード・学習レシピも公開されます。

続きを読む