See2Think:多模态模型真的在“看图思考”吗?
导语
多模态大模型越来越常在推理过程中使用草图、框选、标注、工具调用或中间图像。表面上看,这像是模型在“边看边想”:先把问题转化为可视化状态,再基于视觉证据继续推理。但一个更难的问题是:这些中间视觉状态真的被模型用于决策了吗?还是只是生成了一段看似合理的过程,最终答案仍主要来自文本线索或语言先验?
论文 See2Think: Do Multimodal Models Really Use Intermediate Visual States? 正是围绕这一问题提出评测框架。它不只看最终答对与否,而是试图拆解多模态模型从“想做什么视觉操作”、到“图像是否被正确渲染”、再到“后续推理是否吸收视觉反馈”的完整链条。
核心要点
- 评测对象从结果转向过程:See2Think 包含 See2ThinkBench 与 Visual Action-of-Thought(VAoT)。前者提供任务,后者记录文本思考、视觉动作、渲染状态和后续推理,使研究者能观察模型到底如何使用中间图像。
- 任务强调视觉依赖:See2ThinkBench 包含 1200 道开放式问题,覆盖 12 个任务类别,涉及 2D 结构、3D 场景和真实世界推理。其设计重点是减少仅凭文本即可作答的样本,从而更直接地检验视觉推理能力。
- 没有一种推理环境全面胜出:论文评估了代表性的闭源与开源多模态模型,结果显示视觉推理表现高度依赖模型和推理设置;不同任务下,最优配置并不固定。
- 瓶颈不只在“会不会想”:过程分析显示,模型往往能够选择相关视觉操作,例如知道该画图、标注或调用某类视觉步骤。但真正困难的是把这些操作忠实地渲染成可用的中间视觉状态。
- 依赖视觉状态是可被干预验证的:在任务相关的损坏反馈条件下,模型准确率下降超过 10 个百分点,说明部分模型行为确实会受到中间视觉状态影响。不过,较高的反馈吸收度并不一定自动转化为更高准确率。
意义与影响
See2Think 的价值在于把“多模态推理”从一个最终分数问题,推进到可诊断的过程问题。过去的基准往往只问模型最后答对了吗,但这不足以区分三种情况:模型真正基于视觉证据推理、模型走了错误的视觉步骤却猜对、或模型完全依赖文本捷径。
对于模型研发者而言,这项工作提示改进方向可能不只是更强的语言推理,还包括更可靠的中间图像生成、渲染和反馈利用机制。对于评测体系而言,它也提醒我们:如果模型宣称具备“可视化思考”或“工具增强推理”能力,评测就应覆盖动作选择、视觉状态质量和后续使用,而不能只看最终答案。
简言之,See2Think 把多模态模型的“看图思考”从展示效果拉回到了可验证的行为分析。它不否认中间视觉状态的潜力,但指出当前系统仍存在明显短板:会选择视觉操作,不代表能可靠画对;会读取反馈,也不代表一定推理更准。
评论
正在确认登录状态……
正在加载评论……