記事一覧へ戻る
マルチモーダル

原生マルチモーダル事前学習に Scaling Law を適用する研究

読了目安 3 分

導入

マルチモーダル大規模モデルには、大きく分けて二つの作り方がある。一つは、既存のテキスト中心 LLM に視覚エンコーダや接続モジュールを追加する方法。もう一つは、事前学習の段階からテキストと画像などを同じ枠組みで学習させる方法である。この論文が扱うのは後者、つまり原生マルチモーダル事前学習だ。焦点は性能ランキングではなく、固定された計算予算の中で、モデルサイズ、学習 token 数、データ混合比をどう決めるべきかという根本的な問題にある。

主なポイント

  • 原生マルチモーダル学習の意義:著者らは、テキストのみの事前学習では物理世界や視覚情報の知覚に限界があると指摘する。最初から複数モダリティを共同で学習すれば、より深いクロスモーダル統合が可能になり、後段で結合するアーキテクチャにありがちな最適化の非対称性も緩和できる可能性がある。

  • 計算法則は予測可能:研究では、最小の目的損失が予測可能な compute law に従うことが示されている。また、計算効率の観点で最適なモデルサイズと token 数は、べき乗則としてスケールする。これは、原生マルチモーダル学習も経験則だけでなく、より体系的に設計できる可能性を示している。

  • 言語目標とマルチモーダル目標は異なる:特に重要なのは、言語側の資源配分法則がデータ構成に対して比較的安定している点だ。マルチモーダルデータの比率が変わっても、言語学習の振る舞いは大きく変わりにくい。一方で、マルチモーダル目標はデータ混合比に強く左右される。

  • テキスト比率が高い場合は大規模モデルが有利:論文によれば、テキスト中心の混合データは、より大きなモデルスケールで初めて計算効率が高くなる。そのため、最適な資源配分はより大きなモデル容量へと移動する。データ配合は単独で決めるものではなく、モデル規模と同時に考える必要がある。

  • 効率フロンティアの提示:データ構成が compute law と配分指数に与える影響をモデル化することで、著者らはモデルサイズ、token 数、データ混合の組み合わせを示す効率フロンティアを導いている。

意味と影響

この研究の価値は、新しい単一モデルの発表ではなく、原生マルチモーダルモデルの拡張をより予測可能にしようとしている点にある。基盤モデルの開発では計算資源が大きな制約であり、モデルサイズやデータ構成を誤れば予算を大きく浪費する。今回の結果は、マルチモーダルの scaling を純粋な言語モデルの経験からそのまま導くことはできないと示唆している。

また、下流評価では、原生マルチモーダル事前学習が正のクロスモーダル転移を生み、純テキストの空間推論やマルチモーダル in-context learning の堅牢性を高める可能性も示されている。具体的な数値は素材中に示されていないが、今後のマルチモーダル基盤モデルでは、計算量、データ、モデル容量の関係を精密に設計することがますます重要になるだろう。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Motion-Omni:対話モデルが発話と全身動作を同時に生成
マルチモーダル
cctest.ai
マルチモーダル

Motion-Omni:対話モデルが発話と全身動作を同時に生成

Motion-Omniは、音声対話と表情、手振り、全身動作を共通の隠れ状態から生成するエンドツーエンドモデルです。従来の音声生成後に動作を付ける方式に比べ、動作品質を保ちながらリアルタイム性を高めています。

続きを読む
CCTest · Blog
DreamX-Creator、7Bモデルで原生音声・映像生成を2Kへ
マルチモーダル
cctest.ai
マルチモーダル

DreamX-Creator、7Bモデルで原生音声・映像生成を2Kへ

DreamX-Creator 1.0は、音声を後処理で付け足すのではなく、7Bの生成モデルで映像と音声を同時に生成します。公開された2Kリファイナーにより、高解像度の同期した音声・映像生成をより利用しやすくすることを目指します。

続きを読む