記事一覧へ戻る
拡散モデル

TBSM:三体散乱で一步生成モデルを訓練する新手法

読了目安 4 分

導入

近年の生成モデルには、いくつかの代表的な設計があります。GANは敵対的な識別器から学習信号を得て、拡散モデルはあらかじめ決めたノイズからデータへの経路をたどります。また、高速な少ステップ生成では、強力な教師モデルからの蒸留に依存することも多くあります。論文「Three-Body Scattering for Generative Modeling」は、これらとは異なる発想を提示します。生成サンプルが実データ分布へ近づくために、どの方向へ動くべきかを直接学習するという考え方です。

中心となる考え方

TBSM、すなわちThree-Body Scattering Modelingは、生成を分布間の輸送場を学ぶ問題として定式化します。分布エネルギー、特にエネルギー距離に基づく量から、サンプル単位の運動を導きます。各projectile、つまり動かす対象となる生成サンプルに対し、1つの実データ由来の参照が引力を与え、もう1つの独立に生成された参照が斥力を与えます。

この三体構造により、ミニバッチ内の全ペア相互作用に頼るのではなく、各サンプルに対して定数サイズの相互作用で損失を作れます。論文によれば、projectileと条件を固定したとき、この散乱方向の期待値は、生成分布と実分布のエネルギー距離二乗の半分に対する2-Wasserstein勾配流の速度に一致します。つまり、生成器は「このサンプルをどちらへ修正すべきか」という回帰ターゲットを直接受け取ることになります。

主なポイント

  • 一步・少ステップ生成向け:長い反復サンプリングではなく、1回または少数回の推論で高品質生成を狙います。
  • 引力と斥力の組み合わせ:実サンプルへ近づけ、別の生成サンプルから離すことで分布のずれを補正します。
  • O(B)の損失構成:B個の凍結ターゲットイベントからO(B)個のサンプル単位損失を作り、全ペア場より軽量です。
  • オンライン追跡:条件付き期待値をオンラインで追跡し、場推定のノイズ低減を狙います。
  • 凍結特徴での散乱:画像実験では、凍結された画像特徴空間内の散乱信号を用いています。

結果と位置づけ

ImageNet-256では、NFE=1の一步生成で競争力のある結果が報告されています。ピクセル空間のPixelDiT-XLはFID 2.23、潜在空間のDiT-XLはFID 1.63に到達したとされています。素材ではさらに、最大20Bパラメータ規模のテキスト画像生成モデルでも、追加の補助損失なしに一步・少ステップ生成の安定訓練を示したと説明されています。

この成果の意味は、単にサンプリング回数を減らすことだけではありません。一步生成では、意味整合性、細部の品質、分布カバレッジを1回の前向き計算に圧縮する必要があります。TBSMは、固定されたノイズ除去経路を学ぶのではなく、生成分布を実分布へ押し戻す輸送信号を直接学ぶことで、この難題に取り組んでいます。

意義と今後の注目点

論文は、拡散型の教師信号、Drift系の力学、GAN的な目的関数を、分布輸送場という観点から結び直すデザインマップも示しています。これは、生成モデルの複数の流派を統一的に理解する手がかりになります。

一方で、学習コスト、特徴空間の選択への感度、ドメインを変えたときの安定性、強力なベースラインとの公平な比較は、完全な論文と再現実験で確認すべき点です。それでもTBSMは、高効率な生成モデルに向けた有力な方向性を示しています。長い生成軌道をなぞる代わりに、サンプルを正しい方向へ動かす力そのものを学ぶ、という発想が核にあります。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
ソニーの SPA、スペクトル事前分布で拡散モデルの Exposure Bias を軽減
拡散モデル
cctest.ai
拡散モデル

ソニーの SPA、スペクトル事前分布で拡散モデルの Exposure Bias を軽減

ソニーの研究チームは、拡散モデルとフローマッチングモデルの推論時誤差を周波数領域で補正する Spectral Alignment(SPA)を提案した。事前に学習したスペクトル先験を使い、中間予測のパワースペクトルを軽量に校正する。

続きを読む
CCTest · Blog
Mage-Flow:4B規模で画像生成と編集を担うネイティブ解像度モデル
拡散モデル
cctest.ai
拡散モデル

Mage-Flow:4B規模で画像生成と編集を担うネイティブ解像度モデル

Mage-Flow は、画像生成モデルの競争力を単純な巨大化ではなく、トークナイザー、バックボーン、学習システムの共同設計で高めようとする取り組みだ。4B規模でテキスト画像生成と指示ベース編集の両方を扱う。

続きを読む
CCTest · Blog
DiTの「無用」に見えるテンプレートトークンが意味を保持する
拡散モデル
cctest.ai
拡散モデル

DiTの「無用」に見えるテンプレートトークンが意味を保持する

新しい研究は、文生画像 Diffusion Transformer における構造的なテキストテンプレートトークンが、単なる飾りではないことを示した。生成中に物体の同一性を保つ暗黙的な意味レジスタとして働くという。

続きを読む