記事一覧へ戻る
マルチモーダル

プログラム検証で視覚言語モデルの自己進化を安定化するVQS

読了目安 3 分

はじめに

ラベルなし画像を使って視覚言語モデルを自己進化させるには、質問を増やすだけでは不十分です。生成された質問に信頼できる答えを付けなければ、誤った教師信号が後続の学習に入り込みます。従来の手法では、複数回サンプリングした答えの多数決を採用したり、別のモデルに判定を任せたりします。しかし、同じ視覚的な誤りを共有する回答が多数を占めることもあります。

MBZUAIの研究チームは、この問題に対してVQS(Verifiable QA Generation for Self-Evolving Models)を提案しました。ポイントは、モデルに完成した答えの優劣を判断させるのではなく、プログラムが利用する小さな事実を一つずつ確認させることです。実装も公開されています。

画像を構造化してから答える

VQSの処理は主に三段階に分かれます。

  • 画像を解析する:画像をシーングラフ、グラフの表、図の関係グラフなどの構造化記録に変換します。
  • プログラムで質問と答えを作る:固定プログラムが記録から質問を生成し、必要なフィールドを使って答えを計算します。答えをモデルの自由な推測だけに任せません。
  • 局所的な主張を検証する:モデルは、プログラムが実際に読み取った短い事実だけを確認します。例えば、特定の物体が存在するか、ある数値が表のどの行に対応するか、といった内容です。

この確認結果は、画像解析器の学習目標を選ぶためにも使われます。したがって、解析器もラベルなし画像から段階的に改善できます。認識、構造化、検証可能な質問応答が一つの循環を形成する設計です。

なぜ誤りを減らせるのか

多数決は、最も多い答えが正しいという仮定に依存します。モデルが同じ視覚的な偏りを持っていれば、誤答でも一致する可能性があります。モデル判定も、回答の表現や推論の長さ、自身の認識ミスに影響されます。

VQSは判断単位を小さくします。計算や関係の組み合わせは固定プログラムに任せ、モデルは視覚的な事実の確認に集中します。報告された人手評価では、VQSの答えの94%が正しいと判定されました。一方、多数決の正答率は76%でした。自己進化中に作られたラベルを調べると、多数決ラベルの24%、モデル判定ラベルの18%が誤りでした。合成データを増やすだけでなく、教師信号を検証する仕組みが重要であることを示しています。

実験結果と意味

10種類のベンチマークで、VQSは2B、4B、8B規模のQwen3-VLを最大3.18ポイント改善し、各規模で最も強い自己進化ベースラインを上回りました。3回の学習ラウンドを重ねると、2Bモデルの改善幅は3.84ポイントに達しました。単発のデータ選別ではなく、反復学習に適した方法であることがうかがえます。

VQSが示すのは、マルチモーダル自己学習の役割分担です。モデルは画像を理解して構造を提案し、固定プログラムは検証可能な生成と計算を担い、モデルは必要な事実だけを確認します。解析自体の誤りを完全に除くものではありませんが、誤りを小さく監査しやすい単位に分解できます。人手ラベルが限られる視覚質問応答では、このプログラム制約型の検証が有力な方向になりそうです。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
OmniTaskonomyが示す、視覚生成から視覚理解への能力転移
マルチモーダル
cctest.ai
マルチモーダル

OmniTaskonomyが示す、視覚生成から視覚理解への能力転移

画像生成の学習は、条件が合えば視覚理解も高められるのでしょうか。OmniTaskonomyは、19種類の画像間生成タスクと25種類の理解能力を整理し、どのタスク間で転移が起きるのかを分析しました。

続きを読む
CCTest · Blog
SentZero、胸部X線のゼロショット解析を文単位で強化
マルチモーダル
cctest.ai
マルチモーダル

SentZero、胸部X線のゼロショット解析を文単位で強化

SentZeroは、胸部X線と放射線科レポートを用いた文中心の視覚言語事前学習フレームワークです。正例の多様性不足や、臨床的に同等な文を負例とみなす問題に対処し、マルチタスクのゼロショット解析を目指します。

続きを読む
CCTest · Blog
視覚エンコーダーは不要になるのか?マルチモーダル学習の拡大則を検証
マルチモーダル
cctest.ai
マルチモーダル

視覚エンコーダーは不要になるのか?マルチモーダル学習の拡大則を検証

Tencent Hunyuanの研究チームは、視覚エンコーダーを使うモデルと使わないモデルのスケーリング特性を比較した。エンコーダーなしのモデルは小規模では不利だが、計算量の増加によって差を縮められる可能性が示された。

続きを読む