記事一覧へ戻る
マルチモーダル

視覚エンコーダーは不要になるのか?マルチモーダル学習の拡大則を検証

読了目安 3 分

導入

現在の多くのマルチモーダル大規模言語モデルは、まず事前学習済みの視覚エンコーダーで画像を特徴量に変換し、その結果を言語モデルへ入力する。視覚エンコーダーは強力な視覚的先行知識を提供できるため、学習を安定させやすい。一方で、視覚と言語を別々の部品に分ける設計でもあり、システム全体は複雑になる。

これに対してエンコーダーなしのモデルは、画像の画素から直接視覚表現を学習する。構造はより統一的だが、どの程度の規模で従来方式に近づけるのかは十分に整理されていなかった。Tencent Hunyuanの研究チームは、両方式を同じ視点から比較し、モデルサイズと学習計算量の関係を調べた。

主なポイント

  • テキスト能力への影響は小さい。 テキスト目標では、視覚エンコーダーの有無による損失と計算量のフロンティアはほぼ重なった。エンコーダーを外しても、言語モデリング能力が本質的に損なわれるとは限らない。
  • マルチモーダル学習では大きなモデルが必要になる。 エンコーダーを除くと、マルチモーダル目標に対する計算資源の最適配分は、より大きなモデル側へ移る。モデル自身が視覚表現を獲得しなければならないため、容量への要求が増えると考えられる。
  • 初期の不利は固定的ではない。 小規模では、既存の視覚的先行知識を利用できるモデルが優位に立つ。しかし研究では、約10^22 FLOPs付近でエンコーダーなしのモデルが追いつく可能性が予測された。この水準は、実用的な事前学習予算の範囲内だと説明されている。
  • 言語モデルが視覚エンコーダーの役割を引き受ける。 計算量が増えるほど、視覚 token 同士の双方向相互作用が有効になる。また、視覚処理はより前段の層へ移り、視覚 token の専門家ルーティングは集中する。これは、モデルが視覚情報専用の処理経路を内部に形成することを示唆する。

意義と限界

今回の結果は、視覚エンコーダーがすぐに実運用システムから消えることを意味しない。中小規模では、事前学習済みエンコーダーがデータ効率や初期性能、実装の安定性で有利な可能性がある。また、約10^22 FLOPsという値はスケーリング分析から得られた予測であり、すべての下流タスクで同じ転換点が現れると証明したものではない。

それでも、視覚的先行知識の価値がモデル規模とともに相対的に小さくなるという示唆は重要だ。小さなモデルでは既存のエンコーダーを利用することが効率的な近道になるが、十分な計算量とデータがあれば、単一の言語モデルが視覚能力を自ら学ぶ可能性がある。今後は、強い視覚エンコーダーを接続する方法だけでなく、モデルが画素から視覚を効率よく学ぶ構造と訓練方法が競争軸になるだろう。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
AV-GRPO、音声・映像生成の強化学習をモダリティ別に分解
マルチモーダル
cctest.ai
マルチモーダル

AV-GRPO、音声・映像生成の強化学習をモダリティ別に分解

AV-GRPO は、音声と映像を同時に生成する拡散モデルで問題になる報酬の混在、計算コスト、同期評価の難しさに取り組む手法です。5DAV データセットは、学習難度を制御しながらサンプルを複数の次元に分解します。

続きを読む
CCTest · Blog
PrismML、1ビット小型モデルをQualcomm製スマートグラス向けに展開
マルチモーダル
cctest.ai
マルチモーダル

PrismML、1ビット小型モデルをQualcomm製スマートグラス向けに展開

PrismMLは、QualcommのSnapdragon AR1 Gen 1 Platformを搭載するスマートグラス向けに、1ビットのBonsai言語モデルを披露した。約20億パラメータの視覚言語モデルで、端末上の処理を目指すが、搭載製品はまだ発表されていない。

続きを読む