記事一覧へ戻る
モデル評価

UrbanGround:実スケール都市でマルチモーダルエージェントの空間能力を検証

読了目安 3 分

導入

街の画像を正しく説明できることと、街の中で目的地へ移動できることは同じではない。具身エージェントには、視点が変化しても空間情報を保持し、曖昧な指示の下で次の行動を選び、誤りが起きたときに自ら修正する能力が必要になる。UrbanGroundは、この知覚と行動の隔たりを都市規模で調べるための評価環境である。

香港を動的な実験場に

UrbanGroundは、香港全域をカバーする3D地理空間データを基に、物理的な制約を持つ実スケールの都市レプリカを構築する。エージェントは第一人称視点で3D都市に入り、周囲を観察しながら移動できる。インタラクティブマップも利用できるが、重要なのは、観察、行動、再観察を繰り返す閉ループにある。

静止画像や短い固定ルートだけを扱うベンチマークとは異なり、同環境ではMLLMエージェントを接続し、視覚的グラウンディング、空間質問応答、ナビゲーション、探索、計画、適応を評価できる。時間帯や天候、道路閉鎖、歩行者の移動といった条件も試せるため、現実の都市に近い不確実性を扱える。ウェブ版とネイティブ版、評価コード、タスクも提供され、新しい都市型の具身タスクを構築できる。

主な知見

  • 局所認識は全体的な能力を保証しない。 現在のMLLMは、街路上の物体や環境の手掛かりを認識し、近距離の空間推論を行える場合が多い。
  • 長い経路では誤差が蓄積する。 目的地が遠くなり、指示が明示的でなくなるほど、方向感覚と経路維持が不安定になる。
  • 自己修正が十分ではない。 新しい観察を得ても、誤った前提を認識して行動を立て直せないことがある。
  • 動的な環境はさらに難しい。 通行可能な経路の変化や歩行者の動きは、計画と歩行者を考慮した移動の両方を試す。

意義

UrbanGroundの意義は、空間エージェンシーを一つの成功率で測るのではなく、段階的な能力として調べられる点にある。まず局所シーンを正しく位置付け、次に近距離の行動へ結び付け、最終的には変化する都市の中で長期目標を維持しなければならない。この構成により、視覚認識、位置推定、地図利用、状態追跡、計画、制御のどこに問題があるのかを分けて考えやすくなる。

示される課題は、より強い視覚モデルだけでは解決しない可能性がある。安定した方向表現、継続的な状態更新、不確実性を考慮した計画、そして能動的な誤り訂正が必要だ。単独では正しい行動を複数選べても、それらが時間を越えてつながらなければ、都市規模の目標は達成できない。

今後の具身AI評価では、現在見えているものを説明できるかだけでなく、移動しながら有用な空間モデルを維持できるかが重要になる。UrbanGroundは、その検証に向けた現実感のある共通基盤を提供する。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
評価結果は実際に何を証明できるのか
モデル評価
cctest.ai
モデル評価

評価結果は実際に何を証明できるのか

Inspect Evalsを特定コミットに固定して調査した結果、実行可能な評価コードだけでは、指標に結び付いた過去の主張まで再現できないことが示された。機械的に対象となった124ユニットのうち110件は、証拠または意味づけの不足により、決定的な推論へ進む前に停止した。

続きを読む
CCTest · Blog
Video-IFBench、動画マルチモーダルモデルの指示追従を検証
モデル評価
cctest.ai
モデル評価

Video-IFBench、動画マルチモーダルモデルの指示追従を検証

Video-IFBenchは、動画を正しく理解できるかだけでなく、視覚・音声・意味・形式・条件分岐を含む複雑な指示を守れるかを評価する。20以上の近年のMLLMを対象にした評価では、動画における指示追従の難しさが示された。

続きを読む