記事一覧へ戻る
モデル評価

ActiveVision:マルチモーダルAIに「能動的観察」を問う新ベンチマーク

読了目安 3 分

導入

人間の視覚は、写真を一枚見るような単発処理ではありません。私たちは仮説を立て、気になる場所をもう一度見て、証拠を集め、判断を修正します。南カリフォルニア大学を含む研究者らが発表した ActiveVision は、この「能動的観察」をマルチモーダル大規模言語モデル(MLLM)で測るためのベンチマークです。

従来の視覚言語ベンチマークの多くは、画像を一枚提示して質問に答えさせる形式でした。しかし現実の視覚タスクでは、全体をざっと見るだけでは不十分なことが多く、細部の確認や比較、仮説に基づく再探索が必要になります。

重要なポイント

  • 評価対象は静的認識ではなく観察のループ:ActiveVision は 3カテゴリ・17タスクで構成され、1回の画像説明だけでは解けないよう設計されています。
  • 最先端モデルでも苦戦:論文によると、評価対象の中で最も高い成績を出した GPT-5.5 でも、最高の公開推論努力設定で解けた項目は 10.6% にとどまり、17タスク中11タスクでゼロ点でした。Claude Fable 5 も、推論やコーディングのベンチマークで強いにもかかわらず、3.5%にとどまったとされています。
  • 人間との差は非常に大きい:3名の人間参加者は平均96.1%を達成しており、課題が単に不可能なのではなく、現在のモデルが特定の視覚能力を欠いている可能性を示しています。
  • コード実行も万能ではない:モデルに視覚処理コードを書かせて実行させても、差は大きく残りました。実画像ではコードが不安定になり、その失敗を検出するにも能動的な視覚確認が必要になるためです。

意義と影響

ActiveVision が示しているのは、モデルが流暢に画像を説明できることと、必要な証拠を探しながら観察できることは別だという点です。複雑な画像検査、ロボティクス、文書理解、視覚検索などでは、「何が写っているか」だけでなく、「次にどこを見るべきか」を判断する能力が重要になります。

この結果は、今後のマルチモーダルAI開発にも示唆を与えます。単に言語推論を強くしたり、視覚エンコーダを大きくしたりするだけでは、閉ループの知覚推論は十分に実現できないかもしれません。知覚と推論を結び直すアーキテクチャや訓練目標が必要になる、というのが論文の主張です。

ActiveVision は機械視覚知能のすべてを定義するものではありません。しかし、次世代の評価が「何を見たか」だけでなく「どのように見たか」を問う方向へ進むべきだと示す、重要な試金石と言えます。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
LLMは変化するユーザー意図をなぜ見失うのか
モデル評価
cctest.ai
モデル評価

LLMは変化するユーザー意図をなぜ見失うのか

新しい論文は、単発タスクで高い性能を示すLLMでも、実際の対話で変化し続けるユーザー意図を追跡できるとは限らないと指摘する。著者らは既存の静的ベンチマークを動的な多ターン対話へ変換する評価枠組みを提案した。

続きを読む
CCTest · Blog
Tencent WorkBuddy Bench:コーディングエージェントを実務目線で測る新ベンチマーク
モデル評価
cctest.ai
モデル評価

Tencent WorkBuddy Bench:コーディングエージェントを実務目線で測る新ベンチマーク

Tencent WorkBuddy Bench は、コード、Web、オフィス業務、セキュリティの4領域でコーディングエージェントを評価するベンチマークです。公開・再現可能でありながら、タスク構築によってデータ汚染への耐性を高めている点が特徴です。

続きを読む
CCTest · Blog
空間認知を「描いて答える」評価へ:ProVisE の狙い
モデル評価
cctest.ai
モデル評価

空間認知を「描いて答える」評価へ:ProVisE の狙い

ProVisE は、空間推論タスクを文字や座標だけで評価することの限界に注目する。画像生成モデルにピクセル上で印を付けたり線を描かせたりし、その視覚的回答を既存ベンチマークの採点形式へ変換する枠組みだ。

続きを読む