記事一覧へ戻る
拡散モデル

Mage-Flow:4B規模で画像生成と編集を担うネイティブ解像度モデル

読了目安 3 分

導入

近年の画像生成モデルは高性能になる一方で、学習、微調整、推論のコストも急速に大きくなっている。Mage-Flow が示すのは、単に数十B級へ拡大するのではなく、4B規模でも設計を詰めれば競争力を持てるという方向性だ。対象はテキストからの画像生成だけではない。Mage-Flow-Edit によって、指示に基づく画像編集も同じ基盤上で扱う。

主なポイント

  • 共有された4B規模スタック:Mage-Flow は画像生成、Mage-Flow-Edit は画像編集を担当する。どちらも共通の設計要素を用い、Base、RL-aligned、4-step Turbo の各バリアントを持つ。
  • Mage-VAE による効率化:Mage-VAE は、一段階の拡散風エンコード/デコードと anchor-latent 正則化を使う軽量な潜在トークナイザーである。素材によれば、強力な公開 VAE に近い再構成品質を維持しながら、トークン化の計算コストを一桁以上削減する。FLUX.2-VAE と比べ、画素あたりのエンコード MACs は約12分の1、デコード MACs は約22分の1とされる。
  • ネイティブ解像度への対応:NR-MMDiT は Mage-VAE の潜在空間で rectified flow matching により学習される。単一チェックポイントで 512 から 2048 までの解像度、任意のアスペクト比、さらに 512×2048 のような 4:1 の極端な比率にも対応するという。
  • システムレベルの高速化:native-resolution packing、FlashAttention の可変長処理、サンプルごとの 2D RoPE、CUDA カーネル融合により、エンドツーエンドの学習スループットを約2.5倍改善したとされる。CFG の条件付き/無条件分岐も一度の forward にまとめられる。
  • 編集機能の統合:Mage-Flow-Edit は、意味内容の変更、外観変換、画像修復、構造を意識した出力などを、画像とテキストを条件とする統一モデル内で扱う。

意義と影響

Mage-Flow の重要性は、効率を単なる実装上の工夫ではなく、モデル設計の中心に置いた点にある。4B規模のモデルがより大きなオープンシステムに近い性能を示せるなら、研究者や小規模チームにとって微調整や展開のハードルは下がる。

また Turbo 版は実利用に直結する。素材では、単一 A100 上の 1024² 解像度で Mage-Flow-Turbo が 0.59 秒/枚、Mage-Flow-Edit-Turbo が 1.02 秒/編集、ピークメモリが約 18〜20GB とされている。高解像度生成や編集を対話的に使ううえで、低遅延化は大きな意味を持つ。

もちろん、競争力の評価には公開重み、詳細なベンチマーク、第三者による再現が欠かせない。それでも Mage-Flow は、パラメータ数の拡大だけに頼らず、VAE、解像度処理、GPU 実行をまとめて最適化する実践的な拡散モデル設計として注目に値する。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
DiTの「無用」に見えるテンプレートトークンが意味を保持する
拡散モデル
cctest.ai
拡散モデル

DiTの「無用」に見えるテンプレートトークンが意味を保持する

新しい研究は、文生画像 Diffusion Transformer における構造的なテキストテンプレートトークンが、単なる飾りではないことを示した。生成中に物体の同一性を保つ暗黙的な意味レジスタとして働くという。

続きを読む
CCTest · Blog
DiFA:拡散モデル推論を「数値積分」から「状態推定」へ捉え直す
拡散モデル
cctest.ai
拡散モデル

DiFA:拡散モデル推論を「数値積分」から「状態推定」へ捉え直す

DiFA は、拡散モデルの推論時に得られる過去の予測を相関のある観測として扱う、再学習不要のフレームワークです。前向き拡散過程に沿った時間的コンセンサスにより、生成の安定性と細部表現の改善を狙います。

続きを読む