記事一覧へ戻る
マルチモーダル

OneSearch-VL、証拠グラフで画像・動画の深層リサーチを統合

読了目安 3 分

導入

1枚の画像について答えることと、複数の画像や動画を対象に調査型の回答を作ることは、同じ視覚理解タスクではありません。後者では、画面内の手掛かりを探し、登場する対象を特定し、外部検索で情報を補い、検索結果を特定の視覚証拠と結び付けたうえで、回答を組み立てる必要があります。OneSearch-VLは、この一連の流れを統一的に扱うマルチモーダルエージェントを目指します。

中核となるVGEG

提案の中心は、Visually Grounded Evidence Graph、すなわち「視覚グラウンデッド証拠グラフ」(VGEG)です。このグラフは最終回答だけを記録するのではなく、画像や動画内の局所的な視覚アンカー、そこから特定されるエンティティと関係、外部ソースが支える事実、そして回答を作るための操作を結び付けます。

マルチモーダル検索では、関連しそうな情報を取得できても、それが画面内のどの対象や場面に対応するのかが不明確になることがあります。さらに、視覚入力を十分に使わず、言語的な先入観や検索結果だけで、もっともらしい結論を生成する可能性もあります。VGEGはこうした依存関係を明示し、データ構築、プロセス監督、細粒度評価に共通の参照枠を与えます。

学習データと評価設計

研究チームはVGEGを利用したデータエンジンを構築し、複数画像・動画の質問を作成して検証するとともに、専門家の軌跡を選別しました。その成果として、次の学習データを用意しています。

  • 教師あり微調整向けのOneSearch-VL-SFT-110K
  • 強化学習向けのOneSearch-VL-RL-10K

また、VGEGのアノテーションからEvidence-aware Visual-Grounded Rubric(EVGR)報酬を導出しました。この報酬は、答えが合っているかだけでなく、主張を対応する証拠まで追跡できるか、モデルが実際に視覚情報を利用しているかを重視します。

評価では、OneSearch-MI-BenchとOneSearch-Video-Benchを構築し、VGEGに含まれる研究操作に沿って問題を整理しました。そのため、失敗が視覚位置特定、エンティティの関連付け、検索、証拠の統合、回答生成のどこで起きたのかを、総合点だけより詳しく確認できます。

結果と意味

提供された素材によれば、OneSearch-VL-8Bは2つの新ベンチマークで、ツール利用可能なQwen3-VL-8Bに対してそれぞれ20.2ポイントと17.6ポイントの改善を示しました。さらに、7つの画像ベンチマークとVideoDRでも大きな向上が報告されています。重要なのは、単に回答の流暢さを高めるのではなく、証拠の連鎖に沿って調査を進めることを学習目標にした点です。

画像、複数画像、動画では必要な視覚操作が異なりますが、グラウンディング、外部情報の取得、事実の統合という流れは共通しています。VGEGのような中間表現は、異なるモダリティ間の依存関係を保ち、エラー分析を具体化する手掛かりになり得ます。

一方、現時点の素材だけでは、検索ツールの違い、ノイズの多いオープンドメイン情報、より長い動画への対応までは判断できません。公開されたコードとデータ、そして今後の再現実験によって、実運用での汎化能力を確認する必要があります。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
OmniConfess、多モーダルモデルが幻覚を生む根拠をトークン単位で追跡
マルチモーダル
cctest.ai
マルチモーダル

OmniConfess、多モーダルモデルが幻覚を生む根拠をトークン単位で追跡

OmniConfessは再学習を必要とせず、テキスト・画像・音声・動画の各証拠チャネルが回答のどのトークンを支えているかを調べ、信頼性の低い主張を修正する推論時手法です。

続きを読む
CCTest · Blog
Kandinsky 6.0 Video、映像・音声・リップシンクを同時生成
マルチモーダル
cctest.ai
マルチモーダル

Kandinsky 6.0 Video、映像・音声・リップシンクを同時生成

Kandinsky 6.0 Videoは、テキストまたは画像から、44 kHz音声とリップシンクを備えた約5秒の動画を生成するモデル群です。動画ストリームと音声ストリームを双方向に接続するCrossDiTにより、映像と音の時間的・意味的な整合を狙います。

続きを読む