プログラム検証で視覚言語モデルの自己進化を安定化するVQS
はじめに
ラベルなし画像を使って視覚言語モデルを自己進化させるには、質問を増やすだけでは不十分です。生成された質問に信頼できる答えを付けなければ、誤った教師信号が後続の学習に入り込みます。従来の手法では、複数回サンプリングした答えの多数決を採用したり、別のモデルに判定を任せたりします。しかし、同じ視覚的な誤りを共有する回答が多数を占めることもあります。
MBZUAIの研究チームは、この問題に対してVQS(Verifiable QA Generation for Self-Evolving Models)を提案しました。ポイントは、モデルに完成した答えの優劣を判断させるのではなく、プログラムが利用する小さな事実を一つずつ確認させることです。実装も公開されています。
画像を構造化してから答える
VQSの処理は主に三段階に分かれます。
- 画像を解析する:画像をシーングラフ、グラフの表、図の関係グラフなどの構造化記録に変換します。
- プログラムで質問と答えを作る:固定プログラムが記録から質問を生成し、必要なフィールドを使って答えを計算します。答えをモデルの自由な推測だけに任せません。
- 局所的な主張を検証する:モデルは、プログラムが実際に読み取った短い事実だけを確認します。例えば、特定の物体が存在するか、ある数値が表のどの行に対応するか、といった内容です。
この確認結果は、画像解析器の学習目標を選ぶためにも使われます。したがって、解析器もラベルなし画像から段階的に改善できます。認識、構造化、検証可能な質問応答が一つの循環を形成する設計です。
なぜ誤りを減らせるのか
多数決は、最も多い答えが正しいという仮定に依存します。モデルが同じ視覚的な偏りを持っていれば、誤答でも一致する可能性があります。モデル判定も、回答の表現や推論の長さ、自身の認識ミスに影響されます。
VQSは判断単位を小さくします。計算や関係の組み合わせは固定プログラムに任せ、モデルは視覚的な事実の確認に集中します。報告された人手評価では、VQSの答えの94%が正しいと判定されました。一方、多数決の正答率は76%でした。自己進化中に作られたラベルを調べると、多数決ラベルの24%、モデル判定ラベルの18%が誤りでした。合成データを増やすだけでなく、教師信号を検証する仕組みが重要であることを示しています。
実験結果と意味
10種類のベンチマークで、VQSは2B、4B、8B規模のQwen3-VLを最大3.18ポイント改善し、各規模で最も強い自己進化ベースラインを上回りました。3回の学習ラウンドを重ねると、2Bモデルの改善幅は3.84ポイントに達しました。単発のデータ選別ではなく、反復学習に適した方法であることがうかがえます。
VQSが示すのは、マルチモーダル自己学習の役割分担です。モデルは画像を理解して構造を提案し、固定プログラムは検証可能な生成と計算を担い、モデルは必要な事実だけを確認します。解析自体の誤りを完全に除くものではありませんが、誤りを小さく監査しやすい単位に分解できます。人手ラベルが限られる視覚質問応答では、このプログラム制約型の検証が有力な方向になりそうです。
コメント
ログイン状態を確認中…
コメントを読み込み中…