記事一覧へ戻る
モデル評価

動画 LLM は本当に見ているのか:VDG が示す高精度と視覚理解のズレ

読了目安 3 分

導入

動画大規模言語モデルの評価では、ベンチマークで高い正答率を出せば「動画を理解している」と見なされがちだ。しかし、論文「Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks」は、この前提に疑問を投げかける。著者は、2B から 78B パラメータまで、10 種類のアーキテクチャ系統にまたがる 20 モデルを調査し、正答率と視覚的な根拠づけは別物になり得ることを示した。

主要ポイント

  • VDG という診断指標:Visual Dependency Gap は、元動画を入力した場合と黒画面を入力した場合の、設問ごとの正答差を測る。動画を消しても答えられるなら、その設問は本当に視覚理解を問うていない可能性がある。
  • 高精度は視覚依存を保証しない:MVBench での対応のある McNemar 検定では、元動画条件ではモデル差が有意だった一方、黒画面条件では有意な差が見られなかった。つまり、一部の正答は映像そのものではなく、言語的な事前知識やデータセットの偏りから得られている可能性がある。
  • タスク種別で依存度が異なる:属性認識は強く視覚に依存する一方、時間推論は言語のみのベースラインに近づく。動画ベンチマーク内の「時間理解」タスクが、必ずしも時系列情報の利用を強制していないことを示唆する。
  • 時間順序よりフレーム多様性が効く:黒画面、単一フレーム、シャッフルフレーム、元動画という診断段階を用いた結果、視覚的な利得の大部分は多様なフレームを見ることから生じた。16 のオープンウェイトモデルでは、正しい時間順序の追加効果は精度面でほぼゼロだった。
  • サンプリングの粗さだけでは説明できない:0.5 から 24 FPS までの消融実験により、単にフレーム取得が疎だから時系列を使えない、という説明は主要因ではないとされた。
  • 圧縮は問題を隠すことがある:H.264 実験では、全体の精度が安定して見えても、設問単位では正答から誤答、誤答から正答への双方向の反転が起きることが示された。

意義と影響

この研究は、動画 LLM の進歩を否定するものではない。むしろ、評価方法に関する警告である。リーダーボード上の精度だけでは、モデルが本当に動画を使ったのか、それとも設問のパターンや言語的手がかりを利用したのかは分からない。

VDG の利点は、監査方法が明快な点にある。視覚情報を取り除き、同じ質問に対する結果を比較する。性能低下が大きければ視覚依存が強く、低下が小さければ、設問設計や選択肢分布、言語的ショートカットを見直す必要がある。

開発者にとっては、モデルが視覚証拠を使っているのか、単にベンチマークの癖を学んでいるのかを区別する手がかりになる。評価設計者にとっては、単一フレーム、フレームの並べ替え、言語推測だけでは解けない動画タスクを増やす必要性を示している。

さらに、この診断は API 経由の 4 モデルにも適用され、VDG は 0.025 から 0.315 の範囲だった。問題はオープンウェイトモデルに限られない。動画マルチモーダルモデルが教育、コンテンツ解析、監視、エージェント用途へ広がるほど、視覚的に根拠づけられた能力を測る評価は重要になる。

出典:arXiv

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
UrbanGround:実スケール都市でマルチモーダルエージェントの空間能力を検証
モデル評価
cctest.ai
モデル評価

UrbanGround:実スケール都市でマルチモーダルエージェントの空間能力を検証

UrbanGroundは、香港全域の3D地理空間データからインタラクティブな都市サンドボックスを構築し、局所的な視覚理解が長距離ナビゲーションに結び付くかを検証する。現在のMLLMは近距離の認識には強い一方、探索が長くなると方向維持や修正に課題を残す。

続きを読む
CCTest · Blog
評価結果は実際に何を証明できるのか
モデル評価
cctest.ai
モデル評価

評価結果は実際に何を証明できるのか

Inspect Evalsを特定コミットに固定して調査した結果、実行可能な評価コードだけでは、指標に結び付いた過去の主張まで再現できないことが示された。機械的に対象となった124ユニットのうち110件は、証拠または意味づけの不足により、決定的な推論へ進む前に停止した。

続きを読む
CCTest · Blog
Video-IFBench、動画マルチモーダルモデルの指示追従を検証
モデル評価
cctest.ai
モデル評価

Video-IFBench、動画マルチモーダルモデルの指示追従を検証

Video-IFBenchは、動画を正しく理解できるかだけでなく、視覚・音声・意味・形式・条件分岐を含む複雑な指示を守れるかを評価する。20以上の近年のMLLMを対象にした評価では、動画における指示追従の難しさが示された。

続きを読む