記事一覧へ戻る
拡散モデル

DiFA:拡散モデル推論を「数値積分」から「状態推定」へ捉え直す

読了目安 3 分

導入

拡散モデルのサンプリングは、多くの場合、数値積分の問題として説明されます。各ステップでモデルがノイズやクリーンデータを予測し、サンプラーが逆方向の軌道を少しずつ進める、という理解です。論文 DiFA: Inference-Time Forward-Process Alignment for Diffusion Models は、この見方だけでは不十分だと主張します。デノイジングモデルの出力には統計的な不確実性があり、推論中に連続して得られる予測は、互いに関係を持つ観測として利用できるからです。

重要なポイント

  • 推論を逐次状態推定として扱う:DiFA は、推論時のデータ予測の洗練を、単なる ODE/SDE の積分ではなく、状態推定の問題として再定義します。
  • 過去の予測を観測として再利用:逆過程の各ステップで得られるデータ予測を、同じクリーン画像に対する相関した観測とみなし、因果的な履歴バッファに蓄積します。
  • 前向き過程との整合:履歴から構築される temporal consensus anchor は、前向き拡散過程の統計構造に沿うよう設計されています。これにより、少ないステップでのサンプリングにおける誤差蓄積を抑えることを狙います。
  • Kalman filtering に着想を得た統合:DiFA は、構造的一貫性とノイズレベルの互換性を手がかりに、過去の予測を重み付けして統合します。
  • 細部を守る deviation guidance:時間的な合意は安定性を高める一方で、画像を過度に滑らかにする可能性があります。そこで DiFA は残差的な細部を適応的に保つ仕組みを導入しています。

意義と影響

DiFA の大きな特徴は、再学習を必要としない点です。モデル本体を変えるのではなく、推論時に得られる予測列の解釈と使い方を変えるため、さまざまなサンプラーやアーキテクチャに適用しやすい方向性を示しています。

素材によれば、DiFA は CIFAR-10 と ImageNet において、FID、IS、FD-DINOv2 などの評価指標で改善を示しています。また、ピクセル空間と潜在空間の両方で、サンプリングの安定性や細かなテクスチャ表現を高める可能性があるとされています。ただし、提示素材には具体的な数値は含まれていないため、ここで注目すべきはベンチマークの細かな差分よりも、推論を統計的フィルタリングとして扱う発想そのものです。

今後の拡散モデル研究では、単に積分器を高速化するだけでなく、生成軌道上に蓄積される不確実な予測をどう整合させるかが、より重要なテーマになるかもしれません。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
LLaDA-Image:生成と編集を統合するオープンな画像モデル
拡散モデル
cctest.ai
拡散モデル

LLaDA-Image:生成と編集を統合するオープンな画像モデル

LLaDA-Imageは、ゼロから学習した6BパラメータのDiTと、凍結した視覚言語理解モジュールを組み合わせた画像生成・編集モデルです。蒸留版のTurboは推論を2〜4ステップに短縮し、重み・コード・学習レシピも公開されます。

続きを読む
CCTest · Blog
DiffusionGemma:離散拡散でLLMの逐次生成ボトルネックに挑む
拡散モデル
cctest.ai
拡散モデル

DiffusionGemma:離散拡散でLLMの逐次生成ボトルネックに挑む

DiffusionGemma は、テキストを1トークンずつ生成するのではなく、256トークンのブロックを並列に反復修正する実験的なオープンウェイト言語モデルです。Gemma 4 を微調整して作られ、速度と能力の新しいバランスを狙っています。

続きを読む