記事一覧へ戻る
モデル評価

WorldAuditBench、マルチモーダルエージェントの3D世界監査を評価

読了目安 3 分

はじめに

仮想世界で活動するエージェントには、目の前の画像を説明するだけでは不十分です。どこへ移動するか、どの場所を詳しく調べるか、そして異常の疑いをどのように確認するかを決める必要があります。WorldAuditBenchは、マルチモーダルエージェントを3D世界の監査員として扱い、この一連の能力を評価します。

何を測るのか

ベンチマークは、Unreal Engine 5とThree.jsで構築された13のインタラクティブ環境に、213件の異常タスクを収録しています。異常は5つのファミリーに分かれ、空中に浮く物体、通り抜けられる壁、周囲の状況と一致しない物体などが例として挙げられます。エージェントは固定された探索予算の中で、移動し、観察し、証拠を集めたうえで異常を特定しなければなりません。

この課題には、主に二つの能力が必要です。

  • 行動と探索:移動経路を考え、調査の順番を選び、限られた行動で重要な領域を効率的に確認する。
  • 視覚推論と検証:不自然な手掛かりを見つけ、視点を変えたり近づいたりして、本当に異常かどうかを確かめる。

比較された二つの方式

一つ目は、視覚・言語・行動モデル(VLA)が先に環境を探索し、その後、視覚・言語モデル(VLM)が異常を判定するパイプラインです。ナビゲーションと解釈を分離する構成と言えます。二つ目は、VLMが視覚推論をもとに次の行動を直接選ぶエンドツーエンド方式です。観察、移動、検証を一つのループに近づける狙いがあります。

5つの先端モデルを評価したところ、両方式の成功率は6.6〜42.3%でした。一方、人間の成績は83.4%です。これは、画像を説明する能力があっても、体系的に探索したり、不確実な場所を再確認したり、結論を支える十分な証拠を集めたりできるとは限らないことを示します。

意義と今後の課題

WorldAuditBenchの重要性は、「異常を見た」ことと「異常を見つけた」ことを区別した点にあります。認識精度だけでなく、探索効率、証拠収集、観察に基づく行動選択を同じ枠組みで評価できます。これは、具身エージェント、ワールドモデル、インタラクティブAIにとって現実的なストレステストになります。

今後のシステムには、不確実性を考慮した探索計画、仮説を検証するための行動、複数の観察をつなぐ推論が求められます。単に視覚認識を強化するだけでは、人間との差を縮めにくいでしょう。核心にあるのは、動くことと考えることを3D環境の中で結合する問題です。

Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
MaLiang-Harness、実行可能コードを視覚的な完成度へつなぐ
モデル評価
cctest.ai
モデル評価

MaLiang-Harness、実行可能コードを視覚的な完成度へつなぐ

MaLiang-Harnessは、画像・動画生成における「コードは動くが、見た目が要求どおりではない」という問題をP2Vギャップとして整理します。プログラム、レンダリング結果、修正履歴を結び付け、生成を継続的な検査と修正のプロセスに変えます。

続きを読む