記事一覧へ戻る
拡散モデル

ソニーの SPA、スペクトル事前分布で拡散モデルの Exposure Bias を軽減

読了目安 3 分

導入

拡散モデルは、ノイズを含む状態から少しずつ画像を復元していく反復サンプリングによって高品質な生成を実現する。一方で、この仕組みには誤差が蓄積しやすいという弱点がある。訓練時には制御されたノイズ分布を見ているが、推論時にはモデル自身の過去の予測に基づく軌道を進むため、両者のずれが後続ステップに影響する。この問題は一般に exposure bias と呼ばれる。

論文 Spectral Prior for Reducing Exposure Bias in Diffusion Models では、このずれを周波数領域から分析する。著者らは、訓練時と推論時の間に周波数依存の系統的な差が存在し、それを周波数ごとの SNR 誤差として解釈できると述べている。

核心ポイント

  • 誤差は周波数ごとに異なる:サンプリング中の中間予測は、全体として一様にずれるのではなく、低周波・中周波・高周波で異なるずれ方を示す可能性がある。
  • 固定的な補正では不十分:重要なのは、ミスマッチの方向がモデルや時間ステップによって変わる点だ。特定の周波数を常に強める、あるいは弱めるといった単純な規則は、広いモデルに適用しにくい。
  • SPA はスペクトル先験を利用する:提案手法 Spectral Alignment は、まず訓練データからパラメトリックなスペクトルモデルをオフラインでフィットする。このモデルが、推論時に参照する事前分布となる。
  • FFT による推論時ガイダンス:サンプリング中には、中間予測のパワースペクトルが事前分布に近づくように誘導する。勾配計算には FFT ベースの効率的な処理を用いる。
  • CFG と補完的に使える:Classifier-Free Guidance は主に条件制御やプロンプト追従を強める仕組みであり、SPA はスペクトルの整合性を狙う。目的が異なるため、併用できるとされている。

意義と影響

SPA の特徴は、基盤モデルを再訓練するのではなく、推論時の補正として導入できる点にある。既存の生成パイプラインに追加して検証しやすいことは、実用面で大きな利点になり得る。

また、対象モデルの幅も広い。論文では、DDPM や ADM のようなピクセル空間の拡散モデル、SD2.0 や SDXL のような潜在拡散モデル、さらに SD3.5 や FLUX を含むフローマッチングモデルで一貫した改善が示されたと説明されている。これは、スペクトル上の訓練・推論ミスマッチが特定のモデルだけの現象ではない可能性を示している。

もちろん、素材だけでは詳細な実験設定やケースごとの効果までは分からない。解像度、サンプラー、プロンプト条件、実装方法によって効果は変わり得るため、実運用を判断するには論文本文と公開コードの確認が必要だ。それでも、周波数領域から exposure bias を補正するという発想は、拡散モデル推論の改善策として注目に値する。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
LLaDA-Image:生成と編集を統合するオープンな画像モデル
拡散モデル
cctest.ai
拡散モデル

LLaDA-Image:生成と編集を統合するオープンな画像モデル

LLaDA-Imageは、ゼロから学習した6BパラメータのDiTと、凍結した視覚言語理解モジュールを組み合わせた画像生成・編集モデルです。蒸留版のTurboは推論を2〜4ステップに短縮し、重み・コード・学習レシピも公開されます。

続きを読む
CCTest · Blog
DiffusionGemma:離散拡散でLLMの逐次生成ボトルネックに挑む
拡散モデル
cctest.ai
拡散モデル

DiffusionGemma:離散拡散でLLMの逐次生成ボトルネックに挑む

DiffusionGemma は、テキストを1トークンずつ生成するのではなく、256トークンのブロックを並列に反復修正する実験的なオープンウェイト言語モデルです。Gemma 4 を微調整して作られ、速度と能力の新しいバランスを狙っています。

続きを読む