返回文章列表
模型评测

See2Think:多模态模型真的在“看图思考”吗?

阅读约 3 分钟

导语

多模态大模型越来越常在推理过程中使用草图、框选、标注、工具调用或中间图像。表面上看,这像是模型在“边看边想”:先把问题转化为可视化状态,再基于视觉证据继续推理。但一个更难的问题是:这些中间视觉状态真的被模型用于决策了吗?还是只是生成了一段看似合理的过程,最终答案仍主要来自文本线索或语言先验?

论文 See2Think: Do Multimodal Models Really Use Intermediate Visual States? 正是围绕这一问题提出评测框架。它不只看最终答对与否,而是试图拆解多模态模型从“想做什么视觉操作”、到“图像是否被正确渲染”、再到“后续推理是否吸收视觉反馈”的完整链条。

核心要点

  • 评测对象从结果转向过程:See2Think 包含 See2ThinkBench 与 Visual Action-of-Thought(VAoT)。前者提供任务,后者记录文本思考、视觉动作、渲染状态和后续推理,使研究者能观察模型到底如何使用中间图像。
  • 任务强调视觉依赖:See2ThinkBench 包含 1200 道开放式问题,覆盖 12 个任务类别,涉及 2D 结构、3D 场景和真实世界推理。其设计重点是减少仅凭文本即可作答的样本,从而更直接地检验视觉推理能力。
  • 没有一种推理环境全面胜出:论文评估了代表性的闭源与开源多模态模型,结果显示视觉推理表现高度依赖模型和推理设置;不同任务下,最优配置并不固定。
  • 瓶颈不只在“会不会想”:过程分析显示,模型往往能够选择相关视觉操作,例如知道该画图、标注或调用某类视觉步骤。但真正困难的是把这些操作忠实地渲染成可用的中间视觉状态。
  • 依赖视觉状态是可被干预验证的:在任务相关的损坏反馈条件下,模型准确率下降超过 10 个百分点,说明部分模型行为确实会受到中间视觉状态影响。不过,较高的反馈吸收度并不一定自动转化为更高准确率。

意义与影响

See2Think 的价值在于把“多模态推理”从一个最终分数问题,推进到可诊断的过程问题。过去的基准往往只问模型最后答对了吗,但这不足以区分三种情况:模型真正基于视觉证据推理、模型走了错误的视觉步骤却猜对、或模型完全依赖文本捷径。

对于模型研发者而言,这项工作提示改进方向可能不只是更强的语言推理,还包括更可靠的中间图像生成、渲染和反馈利用机制。对于评测体系而言,它也提醒我们:如果模型宣称具备“可视化思考”或“工具增强推理”能力,评测就应覆盖动作选择、视觉状态质量和后续使用,而不能只看最终答案。

简言之,See2Think 把多模态模型的“看图思考”从展示效果拉回到了可验证的行为分析。它不否认中间视觉状态的潜力,但指出当前系统仍存在明显短板:会选择视觉操作,不代表能可靠画对;会读取反馈,也不代表一定推理更准。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
SecRespond:把 AI 安全智能体放进“失陷之后”的真实考场
模型评测
cctest.ai
模型评测

SecRespond:把 AI 安全智能体放进“失陷之后”的真实考场

SecRespond 是一个面向事后入侵响应的 AI Agent 评测基准,关注模型在主机已被攻陷后的取证、风险识别与修复规划能力。论文显示,当前前沿模型能较好处理告警暴露的问题,但对静默入侵和完整修复方案仍明显不足。

阅读全文