Multimodal Flow、言語と視覚を一つの連続生成プロセスで統合
概要
統合型マルチモーダルモデルには、主に二つの設計があります。言語と画像の両方を離散トークンとして扱う方法と、言語には離散予測、画像には連続生成を使う方法です。前者は画像の量子化による情報損失が課題になり得ます。後者は、モダリティごとに異なる学習目標やサンプリング手順を必要とします。HUST Vision Lab の Multimodal Flow は、言語と視覚を同じ連続的な生成過程で扱う設計を探っています。
手法のポイント
- 連続ハイパーチャンク:画像を離散的な視覚語彙へ変換するのではなく、マルチモーダルな連続表現を利用します。テキストブロックと画像を順序付けられた「連続ハイパーチャンク」として配置し、テキストのトークン順序と画像の空間構造を保持します。
- 共有 Flow Matching:chunk-causal バックボーンが、ハイパーチャンク全体に対する単一のベクトル場を Flow Matching で学習します。言語と画像を、別々の生成方式ではなく共通の連続プロセスでモデル化する考え方です。
- 共有と専用の組み合わせ:共同注意機構によってテキストと画像を相互作用させつつ、モダリティ専用のフィードフォワードネットワークで各々の特徴を処理します。
- 学習と推論の違い:学習時には複数の目標チャンクを並列に予測し、推論時にはハイパーチャンクを順番に生成します。連続表現を使いながら、因果的な生成順序も維持します。
実験結果
著者らは MF-1 を実装し、0.6B、1.2B、1.6B の規模でマルチモーダル事前学習を行いました。概要によれば、継続事前学習による性能向上は各規模で一貫して確認されています。150B の事前学習トークンを用いた設定では、GenEval と DPG-Bench の平均スコアが 82.8、VQAv2、MMBench、POPE の平均が 75.3 でした。また、データ量、最適化方法、パラメータ予算をそろえた比較では、代表的な離散型およびハイブリッド型モデルを上回ったと報告されています。
意義と残る課題
この研究の重要性は、画像を言語のような離散トークンへ無理に変換せず、テキストと画像を構造化された連続ブロックとして扱う点にあります。これにより、言語理解、画像生成、クロスモーダルな相互作用をより共通の基盤で研究できる可能性があります。モダリティ固有の目的関数やサンプリング処理を減らせるなら、統合モデルの設計も簡素化できるでしょう。
一方、現時点の資料だけでは、長文生成、複雑な画像構成、推論速度、学習コスト、データ配分の違いによる影響までは判断できません。大規模化しても連続フロー方式の優位性が維持されるかは、今後の比較実験に委ねられます。
コードとモデルは公開されており、再現実験や他方式との比較に利用できます。
コメント
ログイン状態を確認中…
コメントを読み込み中…