返回文章列表
模型评测

ActiveVision:给多模态大模型的一场“主动观察”考试

阅读约 2 分钟

导语

人类看世界并不是“一眼定终身”。我们会先形成猜测,再把视线投向关键区域,继续验证、排除和修正判断。来自南加州大学等机构的研究者提出 ActiveVision,试图把这种“主动观察”能力变成可测量的基准测试,用来评估今天的多模态大语言模型(MLLM)是否真的具备闭环视觉推理能力。

这项工作之所以值得关注,是因为现有视觉语言评测往往更像静态问答:给模型一张图,要求它描述、识别或推理。但许多真实任务并不只是“看见”目标,而是需要连续观察、局部检查、根据中间结论调整关注点。

核心要点

  • 评测对象是主动观察,而非静态识别:ActiveVision 包含 3 大类、17 项任务,设计目标是迫使模型反复感知视觉信息,而不是依靠一次性图像概括完成回答。
  • 前沿模型表现大幅落后于人类:论文报告称,最高分模型 GPT-5.5 在最高公开推理强度设置下仅解决 10.6% 的题目,并在 17 项任务中的 11 项得分为零。Claude Fable 5 虽然在许多推理和代码榜单上表现强,但在该基准中只达到 3.5%。相比之下,三名人类参与者平均达到 96.1%。
  • 写代码也不能完全补足缺口:研究者还考察了模型编写并运行视觉代码的情况。结果显示,在真实图像上,这类代码并不总是可靠;更关键的是,发现代码失败、重新检查图像,本身也需要主动感知能力。

意义与影响

ActiveVision 把一个长期存在但难以量化的问题摆到台面上:多模态模型是否真的会“看”,还是只是在一次输入上生成合理文本?如果模型缺少根据假设重新获取视觉证据的能力,那么在复杂场景理解、视觉检索、机器人操作、自动化质检等任务中就可能出现脆弱性。

这也提示未来模型设计不能只追求更强的语言推理或更大的视觉编码器。研究者认为,需要新的架构和训练目标,让感知与推理形成闭环:模型不仅要回答“图里有什么”,还要能决定“接下来该看哪里、如何验证当前判断”。

当然,ActiveVision 仍是一个基准测试,它能揭示能力短板,但不等同于完整定义了机器视觉智能。不过它给评测方向提供了重要信号:下一阶段的多模态评估,可能要从静态看图问答,转向更接近人类观察过程的交互式、迭代式任务。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章