記事一覧へ戻る
拡散モデル

Mage-Flow:4B規模で画像生成と編集を担うネイティブ解像度モデル

読了目安 3 分

導入

近年の画像生成モデルは高性能になる一方で、学習、微調整、推論のコストも急速に大きくなっている。Mage-Flow が示すのは、単に数十B級へ拡大するのではなく、4B規模でも設計を詰めれば競争力を持てるという方向性だ。対象はテキストからの画像生成だけではない。Mage-Flow-Edit によって、指示に基づく画像編集も同じ基盤上で扱う。

主なポイント

  • 共有された4B規模スタック:Mage-Flow は画像生成、Mage-Flow-Edit は画像編集を担当する。どちらも共通の設計要素を用い、Base、RL-aligned、4-step Turbo の各バリアントを持つ。
  • Mage-VAE による効率化:Mage-VAE は、一段階の拡散風エンコード/デコードと anchor-latent 正則化を使う軽量な潜在トークナイザーである。素材によれば、強力な公開 VAE に近い再構成品質を維持しながら、トークン化の計算コストを一桁以上削減する。FLUX.2-VAE と比べ、画素あたりのエンコード MACs は約12分の1、デコード MACs は約22分の1とされる。
  • ネイティブ解像度への対応:NR-MMDiT は Mage-VAE の潜在空間で rectified flow matching により学習される。単一チェックポイントで 512 から 2048 までの解像度、任意のアスペクト比、さらに 512×2048 のような 4:1 の極端な比率にも対応するという。
  • システムレベルの高速化:native-resolution packing、FlashAttention の可変長処理、サンプルごとの 2D RoPE、CUDA カーネル融合により、エンドツーエンドの学習スループットを約2.5倍改善したとされる。CFG の条件付き/無条件分岐も一度の forward にまとめられる。
  • 編集機能の統合:Mage-Flow-Edit は、意味内容の変更、外観変換、画像修復、構造を意識した出力などを、画像とテキストを条件とする統一モデル内で扱う。

意義と影響

Mage-Flow の重要性は、効率を単なる実装上の工夫ではなく、モデル設計の中心に置いた点にある。4B規模のモデルがより大きなオープンシステムに近い性能を示せるなら、研究者や小規模チームにとって微調整や展開のハードルは下がる。

また Turbo 版は実利用に直結する。素材では、単一 A100 上の 1024² 解像度で Mage-Flow-Turbo が 0.59 秒/枚、Mage-Flow-Edit-Turbo が 1.02 秒/編集、ピークメモリが約 18〜20GB とされている。高解像度生成や編集を対話的に使ううえで、低遅延化は大きな意味を持つ。

もちろん、競争力の評価には公開重み、詳細なベンチマーク、第三者による再現が欠かせない。それでも Mage-Flow は、パラメータ数の拡大だけに頼らず、VAE、解像度処理、GPU 実行をまとめて最適化する実践的な拡散モデル設計として注目に値する。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
LLaDA-Image:生成と編集を統合するオープンな画像モデル
拡散モデル
cctest.ai
拡散モデル

LLaDA-Image:生成と編集を統合するオープンな画像モデル

LLaDA-Imageは、ゼロから学習した6BパラメータのDiTと、凍結した視覚言語理解モジュールを組み合わせた画像生成・編集モデルです。蒸留版のTurboは推論を2〜4ステップに短縮し、重み・コード・学習レシピも公開されます。

続きを読む
CCTest · Blog
DiffusionGemma:離散拡散でLLMの逐次生成ボトルネックに挑む
拡散モデル
cctest.ai
拡散モデル

DiffusionGemma:離散拡散でLLMの逐次生成ボトルネックに挑む

DiffusionGemma は、テキストを1トークンずつ生成するのではなく、256トークンのブロックを並列に反復修正する実験的なオープンウェイト言語モデルです。Gemma 4 を微調整して作られ、速度と能力の新しいバランスを狙っています。

続きを読む