返回文章列表
模型评测

空间智能评测的新思路:让生成模型“画出答案”

阅读约 3 分钟

导语

空间智能是多模态模型走向真实世界交互的关键能力。对人类来说,很多空间问题并不需要先转成一串坐标或文字描述:指出一个区域、画一条路径、圈出目标,往往比“用语言解释位置关系”更自然。

论文《Show, Don't Tell》关注的正是这种评测接口错位。现有空间推理基准大多要求模型输出坐标、选项或文本答案,这对文本型视觉语言模型较友好,却不一定适合图像生成模型。后者本来可以直接把空间判断外化到像素里,却经常被迫用不擅长的格式作答。

核心要点

  • ProVisE:把“画出来”的答案变成可评分结果
    研究提出 ProVisE(Protocolized Visual Evaluation),一个与具体基准无关的评测框架。它先为任务设计受约束的视觉回答协议,让图像生成模型按照规则在图像中标记、绘制或生成答案;随后再把这些视觉输出解析成原始基准所需的结构化预测,并沿用原指标评分。

  • 缓解图像生成模型的回答接口不匹配
    许多空间任务本质上发生在连续视觉场景中,例如位置、区域、路径和相对关系。若强行要求模型输出精确坐标或离散文本,评测结果可能混入“表达方式不合适”的误差。ProVisE 试图让不同类型模型在同一任务语义下被比较,而不是被同一种输出格式限制。

  • SpatialGen-Bench 提供诊断集
    作者还引入了 SpatialGen-Bench,包含 470 个样本、14 个空间子任务,覆盖四个能力层级和多种回答形式。该数据集更像一个诊断工具,用来观察模型在不同空间表达方式下的强弱项。

  • 文本回答与视觉回答呈现互补
    论文评测了 31 个文本与图像回答系统,并在六个外部空间基准上验证了协议构建流程。结果显示,图像生成模型在空间状态可以直接画在像素上的任务中表现有竞争力;而文本输出的 VLM 在组合式推理任务上仍然更强。论文还提到,GPT Image 2 能解决 GPT-5.4 未答对的 37% 空间案例,体现了两类接口的互补性。

意义与影响

这项工作的重要性不只在于提出了一个新 benchmark,而在于提醒评测设计者:模型能力和回答接口是绑定在一起的。如果空间理解任务天然适合“指、圈、画”,那么只看文本输出可能低估图像生成模型,也可能误判模型真正的空间认知水平。

对具身智能、视觉代理和机器人场景来说,这一点尤其关键。真实世界任务中的空间决策常常表现为动作、轨迹或区域选择,而不是一句完整描述。让模型用像素表达空间判断,再把结果转为可量化指标,可能成为连接生成式视觉能力与实际交互能力的一种过渡评测方式。

当然,ProVisE 也不意味着图像回答会取代文本推理。论文结果反而表明,两种接口揭示的是不同能力面:视觉答案更适合直接外化空间状态,文本 VLM 更擅长复杂组合推理。未来更合理的空间智能评测,可能需要同时允许模型“说清楚”和“画出来”。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章