返回文章列表
模型评测

SceneActBench:让VLM智能体在看见的3D场景中真正行动

阅读约 3 分钟

导语

多模态模型正在从“描述世界”走向“操作世界”。过去,视觉语言模型(VLM)在 3D 场景中的能力评估,常集中在文字问答、物体识别,或对单个对象的简单操作上。但真正的智能体应用往往要求模型在复杂、多物体、空间关系密集的 3D 环境里做出动作。SceneActBench 正是为这一缺口设计的新基准:它要回答的问题不是模型能不能说出场景里有什么,而是能不能根据看到的场景完成正确的 3D 行动。

核心要点

  • 评估对象从“回答”转向“行动”:SceneActBench 不以自然语言答案作为主要结果,而是让智能体在 3D 环境中执行任务,并根据最终输出进行评分。
  • 统一的智能体-环境循环:五类 3D 任务都在同一套固定流程下运行,减少因交互机制不同带来的比较偏差。
  • 输入形式贴近真实感知:智能体可以接收 PNG 图像或从视频中采样的帧;在适用任务中,还会提供相应 3D 资产。
  • 采用隐藏真值与几何指标:每个最终结果会与隐藏的标准答案比较,并使用任务相关的几何度量来评估,而不是依赖表面文本匹配。
  • 规模适中但覆盖多样:基准由 210 个源实例构建,形成 520 个任务案例,其中包括成对输入条件。

主要发现

论文在 11 种专有 VLM 配置上进行了测试。结果显示,整体分数分布在 38.6 到 50.2 之间,没有任何一个模型能在所有任务上稳定表现优异。这说明,即便当前 VLM 已经具备较强的图像理解和语言推理能力,将这些能力转化为可靠的 3D 场景行动仍然困难。

这一结果也提示,3D 智能体的瓶颈可能并不只是“看不懂图像”。模型还需要把视觉线索转化为空间结构理解,进一步规划操作步骤,并在多物体关系中保持一致性。任一环节出错,都可能导致最终动作失败。

意义与影响

SceneActBench 的价值在于,它把评测焦点推进到了更接近具身智能和工具使用智能体的层面。对于研究者而言,这类基准可以帮助定位失败发生在感知、空间推理、动作规划还是工具调用阶段。对于产业应用而言,它提醒我们:把 VLM 接入 3D 工具链,并不等于模型已经具备可靠的场景操作能力。

随着 AI 智能体进入机器人、设计、仿真、游戏和数字孪生等领域,能否在复杂 3D 环境中“看见并行动”会成为重要能力。SceneActBench 提供了一个更严格的测试框架,也揭示了现有模型距离通用 3D 行动智能仍有不小差距。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章