返回文章列表
模型评测

UrbanGround:让多模态智能体在真实尺度城市中接受空间能力检验

阅读约 3 分钟

导语

让模型“看懂”街景并不等于让它真正会在城市中行动。对于具身智能体而言,关键问题是:当视角不断变化、目的地逐渐变远、道路状况发生变化时,早先获得的局部信息能否持续支持后续决策。UrbanGround 正是围绕这一问题设计的城市级评测沙盒。

把香港变成可交互的实验场

UrbanGround 基于覆盖香港全域的三维地理数据,构建了一个具有真实尺度和物理约束的城市复刻环境。智能体可以从第一人称视角进入场景,观察周围环境、移动探索,并通过交互地图辅助导航。与只展示静态街景或预先切分路线的测试不同,该平台强调感知、规划与行动之间的闭环:模型必须根据当前观察决定下一步,并在行动后重新评估环境。

平台支持连接多模态大语言模型,研究者可据此测试视觉定位、空间问答、导航、探索、规划和环境适应等任务。实验条件还可以加入不同时间、天气、道路封闭以及行人移动,让评测更接近开放城市中的不确定性。UrbanGround 同时提供网页和原生版本,以及相应的任务和评估代码,便于构建新的城市具身任务。

核心发现

  • 局部能力不等于全局能力。 当前 MLLM 通常能够识别街景中的物体和环境线索,也能完成一定程度的短距离空间推理。
  • 长程导航会放大微小错误。 随着目的地变远、指令变得不明确,模型的方向判断和路线保持能力下降,局部正确决策难以连贯起来。
  • 纠错机制仍不可靠。 智能体在持续探索中容易积累偏差,却未必能通过新的观察及时发现并修正。
  • 动态交通环境更具挑战。 道路可用性变化和行人运动会进一步考验模型的路线调整与行人感知能力。

意义与影响

UrbanGround 的价值不只是增加一个三维导航场景,而是把“空间智能”拆解为可观察的能力成长过程:先判断局部场景,再完成近距离行动,最后应对跨区域、动态且不完全明确的目标。这样的设计有助于区分视觉识别、定位、地图使用、长期记忆和行动控制等不同瓶颈,也提醒研究者不要仅凭单步成功率判断智能体是否具备城市级能力。

从更长远的角度看,可靠的城市智能体需要的不只是更强的视觉编码器,还包括稳定的方向表示、持续的状态更新、面向不确定性的规划,以及能够主动纠错的闭环策略。UrbanGround 为这些问题提供了统一的实验入口,也为后续比较不同模型和方法提供了更具现实感的基准。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
评测结果究竟能证明什么?一项对 Inspect Evals 的可复现性审计
模型评测
cctest.ai
模型评测

评测结果究竟能证明什么?一项对 Inspect Evals 的可复现性审计

一项基于固定代码提交版本的审计发现,评测脚本能够定义计算过程,却未必足以支撑与指标绑定的历史性结论。研究对 124 个 Inspect Evals 单元进行盘点,其中 110 个在进入确定性推断前就因证据或语义问题停止。

阅读全文