記事一覧へ戻る
ロボティクス・フィジカルAI

VABench、マルチモーダルモデルの身体的な空間知能を検証

読了目安 3 分

はじめに

実世界で動作するロボットに必要なのは、物体の位置を言い当てる能力だけではない。対象が遮られていたり、現在の視点では情報が足りなかったり、シーンの配置が変わったりした場合、システムは何が不足しているのかを判断し、自ら視点を選んで証拠を集め、異なる画像を共通の空間座標に対応付けなければならない。そのうえで、推論結果を正確な動作に変換し、実行結果に応じて計画を修正する必要がある。VABenchは、この一連の流れを評価するために設計された。

評価の仕組み

VABenchでは、汎用マルチモーダル大規模モデルがRGBの視覚デモンストレーションから手順の文脈を学ぶ。モデルはカメラの視点を選択し、メートル単位のデカルト座標で目標を指定し、実行フィードバックを見て次の指示を修正する。物体の真の姿勢、オラクル軌跡、学習済みの専用アクションヘッドは与えられない。実際の動作は、モデルが指定した目標だけを実行する固定のモデル非依存コントローラが担う。

ベンチマークには、11種類の単腕タスクと3種類の双腕タスクからなる14の基礎タスクファミリーが含まれる。さらに、未知の幾何形状・レイアウトを用いた7種類の変形と、5個の物体を扱う長期構成タスクも用意されている。各基礎タスクでは、物理的に検証された同じ20個のシードを使い、12の主要モデル条件を3回ずつ独立実行する。最終成功率だけでなく、9種類の軌跡レベルの行動指標とサブタスクの進捗も報告される。

主な結果

  • 局所的な視覚認識が、そのまま具身能力になるわけではない。注釈付きの実行では、最良モデルの対象位置特定は100.0%、空間関係の理解は78.9%だったが、3回のマクロ平均タスク成功率は53.93%±3.17%だった。
  • 能動的な知覚には大きな効果がある。ある条件をそろえた比較では、受動的な複数視点観察の成功率27.86%に対し、モデルがカメラを制御できる場合は57.50%まで上昇した。多くの画像を見ること以上に、適切な証拠を選ぶことが重要だと考えられる。
  • 未知の幾何形状への転移は不安定である。保持されたレイアウトでは、タスク成功率が30ポイント以上下がる場合があり、既知の空間パターンへの依存がうかがえる。
  • 長期的な構成タスクはさらに難しい。モデルは部分的な進捗を示したものの、厳密な長期エピソードを最後まで完了したモデルはなかった。

意義と今後

VABenchは、空間知能を静的な画像質問応答から切り離し、証拠の取得、座標の統一、メートル精度の制御、失敗後の修正まで含めて評価する。これは、学習時とは異なる環境で物体をつかみ、配置し、複数の物体を組み合わせるという、実際のロボット操作の難しさに近い。

この結果は、具身モデルの改善が画像説明能力やモデル規模の拡大だけでは不十分であることも示している。今後は、より堅牢な能動視覚方策、信頼できる空間表現、実行結果から計画を更新する制御機構が必要になる。VABenchは、最終成功率だけでは分からない、認識・推論・動作精度・失敗回復のどこで問題が起きたのかを分析する材料を提供する。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Vantora、1億ドルを調達し産業向け専用フィジカルAIに注力
ロボティクス・フィジカルAI
cctest.ai

Vantora、1億ドルを調達し産業向け専用フィジカルAIに注力

UP.Labsから社名を変更したVantoraが、Silversmithから1億ドルを調達した。産業企業向けにフィジカルAIのスタートアップを構築し、顧客企業が自社事業へ取り込めるモデルへ転換する。

続きを読む
CCTest · Blog
GPT-Policy:文脈から学習する適応型ロボット
ロボティクス・フィジカルAI
cctest.ai

GPT-Policy:文脈から学習する適応型ロボット

GPT-Policyは、視覚言語モデル、文脈コンパイラ、制約付きコントローラを組み合わせ、勾配更新なしでロボットが実演やフィードバックから新しいタスクに適応することを目指す。実ロボット実験では、人間の動画実演がタスク達成を改善し、接触を伴う作業では動作に対応した参照情報がさらに有効だった。

続きを読む
CCTest · Blog
小型AIモデルが戦場のドローンに自律性を与える
ロボティクス・フィジカルAI
cctest.ai

小型AIモデルが戦場のドローンに自律性を与える

NATO関連プログラムに参加するScaleout Systemsは、軽量な画像認識モデルをドローンや前線の計算機に実装し、中央サーバーとの常時接続なしで目標を識別できる仕組みを開発している。ALMA計画では、自律的な目標発見から攻撃任務までのデモも行われた。

続きを読む