記事一覧へ戻る
拡散モデル

ソニーの SPA、スペクトル事前分布で拡散モデルの Exposure Bias を軽減

読了目安 3 分

導入

拡散モデルは、ノイズを含む状態から少しずつ画像を復元していく反復サンプリングによって高品質な生成を実現する。一方で、この仕組みには誤差が蓄積しやすいという弱点がある。訓練時には制御されたノイズ分布を見ているが、推論時にはモデル自身の過去の予測に基づく軌道を進むため、両者のずれが後続ステップに影響する。この問題は一般に exposure bias と呼ばれる。

論文 Spectral Prior for Reducing Exposure Bias in Diffusion Models では、このずれを周波数領域から分析する。著者らは、訓練時と推論時の間に周波数依存の系統的な差が存在し、それを周波数ごとの SNR 誤差として解釈できると述べている。

核心ポイント

  • 誤差は周波数ごとに異なる:サンプリング中の中間予測は、全体として一様にずれるのではなく、低周波・中周波・高周波で異なるずれ方を示す可能性がある。
  • 固定的な補正では不十分:重要なのは、ミスマッチの方向がモデルや時間ステップによって変わる点だ。特定の周波数を常に強める、あるいは弱めるといった単純な規則は、広いモデルに適用しにくい。
  • SPA はスペクトル先験を利用する:提案手法 Spectral Alignment は、まず訓練データからパラメトリックなスペクトルモデルをオフラインでフィットする。このモデルが、推論時に参照する事前分布となる。
  • FFT による推論時ガイダンス:サンプリング中には、中間予測のパワースペクトルが事前分布に近づくように誘導する。勾配計算には FFT ベースの効率的な処理を用いる。
  • CFG と補完的に使える:Classifier-Free Guidance は主に条件制御やプロンプト追従を強める仕組みであり、SPA はスペクトルの整合性を狙う。目的が異なるため、併用できるとされている。

意義と影響

SPA の特徴は、基盤モデルを再訓練するのではなく、推論時の補正として導入できる点にある。既存の生成パイプラインに追加して検証しやすいことは、実用面で大きな利点になり得る。

また、対象モデルの幅も広い。論文では、DDPM や ADM のようなピクセル空間の拡散モデル、SD2.0 や SDXL のような潜在拡散モデル、さらに SD3.5 や FLUX を含むフローマッチングモデルで一貫した改善が示されたと説明されている。これは、スペクトル上の訓練・推論ミスマッチが特定のモデルだけの現象ではない可能性を示している。

もちろん、素材だけでは詳細な実験設定やケースごとの効果までは分からない。解像度、サンプラー、プロンプト条件、実装方法によって効果は変わり得るため、実運用を判断するには論文本文と公開コードの確認が必要だ。それでも、周波数領域から exposure bias を補正するという発想は、拡散モデル推論の改善策として注目に値する。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Mage-Flow:4B規模で画像生成と編集を担うネイティブ解像度モデル
拡散モデル
cctest.ai
拡散モデル

Mage-Flow:4B規模で画像生成と編集を担うネイティブ解像度モデル

Mage-Flow は、画像生成モデルの競争力を単純な巨大化ではなく、トークナイザー、バックボーン、学習システムの共同設計で高めようとする取り組みだ。4B規模でテキスト画像生成と指示ベース編集の両方を扱う。

続きを読む
CCTest · Blog
DiTの「無用」に見えるテンプレートトークンが意味を保持する
拡散モデル
cctest.ai
拡散モデル

DiTの「無用」に見えるテンプレートトークンが意味を保持する

新しい研究は、文生画像 Diffusion Transformer における構造的なテキストテンプレートトークンが、単なる飾りではないことを示した。生成中に物体の同一性を保つ暗黙的な意味レジスタとして働くという。

続きを読む