返回文章列表
模型评测

WorldAuditBench:让多模态智能体在3D世界里寻找“穿帮”

阅读约 2 分钟

导语

在虚拟环境中,智能体不仅要“看懂”场景,还要知道应该走向哪里、靠近什么位置,并通过新的观察确认自己的判断。WorldAuditBench关注的正是这一容易被忽视的能力:让多模态智能体像审计员一样,在交互式3D世界中主动搜寻环境漏洞。

这项基准测试什么

研究团队构建了一个包含213项任务的评测基准,覆盖13个由Unreal Engine 5和Three.js制作的交互式环境。任务涉及五类异常,示例包括悬浮在空中的物体、可以穿过的墙,以及与周围场景不协调的物体。智能体不能只根据单张图片作答,而需要在有限探索预算下移动、观察、调查,最后指出异常。

这使问题同时包含两个环节:

  • 行动与搜索:规划移动路线,决定观察顺序,并尽量用较少的行动覆盖有价值的区域。
  • 视觉推理与验证:从多模态观测中发现可疑线索,再通过靠近、换角度或继续探索判断它是否确实异常。

两种审计路线

论文比较了两种方法。第一种是先使用视觉-语言-行动模型(VLA)探索环境,再交给视觉-语言模型(VLM)识别异常,将导航和判断拆成两个阶段。第二种是端到端VLM智能体,由视觉推理结果直接指导下一步行动,尝试把观察、决策和验证连成闭环。

在五个前沿模型的测试中,两类方案的成功率介于6.6%和42.3%之间,远低于人类的83.4%。这一差距说明,模型即使能够描述眼前画面,也未必能建立系统的搜索策略,更不一定会主动收集足以支撑结论的证据。

意义与影响

WorldAuditBench的价值不只是增加了一个3D测试集。它把“看见异常”和“找到异常”明确区分开来,也把智能体的行动效率、证据收集和视觉判断放到了同一个评测框架中。对于具身智能、世界模型和交互式代理研究而言,这提供了一个更接近真实使用场景的压力测试。

从结果看,下一步改进不能只依赖更强的图像理解能力。模型还需要学习如何制定探索计划、根据不确定性调整路线,并在发现可疑现象后进行针对性复核。换言之,3D世界审计暴露的是行动与推理之间的耦合难题,而不是单纯的目标识别问题。

Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章