返回文章列表
多模态

Evidence-RL:让视觉语言模型真正“看证据”再回答

阅读约 3 分钟

导语

视觉语言模型越来越擅长回答图像相关问题,但“答对”并不总等于“看懂”。在许多视觉问答场景中,模型可能根据语言中的常见搭配、训练集里的统计偏差,或图像中与问题无关的背景线索给出答案。论文 Evidence-RL: Towards Evidence-intensive Visual Reasoning 试图解决的正是这个问题:如何在训练阶段促使模型把答案建立在具体、局部、可验证的视觉证据之上。

作者提出的核心方法是 Counterfactual Evidence Disentanglement(CED)。它不是简单要求模型“多看图”,也不是只用注意力热区来近似判断模型是否关注图像,而是通过反事实干预检查:如果把支持答案的对象级证据区域中和掉,模型对原答案的支持是否会显著下降?

核心要点

  • 问题定义更聚焦:论文关注的是视觉语言模型的 grounding,即答案是否真正依赖图像中的局部证据,而不是依赖语言先验、数据集捷径或无关视觉上下文。
  • CED 做训练期证据审计:对于模型生成的每个回答,CED 会识别对象中心的 Evidence Region,并对该区域进行中和处理,再观察答案支持度的变化。
  • 与非证据区域对照:仅仅遮掉某个区域导致置信度下降并不充分。CED 会把证据区域与匹配的非证据区域进行比较,从而判断下降是否更可能来自真正的证据路径。
  • 结合 GRPO 奖励机制:该信号被纳入 GRPO 后训练框架中。模型不仅要回答正确,还要因为依赖合适的视觉证据而获得奖励,减少走捷径获得高分的机会。
  • 低标注与低部署成本:CED 使用弱对象级 proposals,不需要为每个问题额外标注证据区域;同时它只用于训练期审计,推理时不引入额外开销。

意义与影响

这项工作的价值在于,它把多模态推理中的“可信依据”问题从结果层面推进到因果依赖层面。过去很多方法通过全局扰动、图像遮挡或注意力代理指标鼓励模型使用视觉信息,但这些信号未必能证明模型的某个答案确实由关键局部证据支持。CED 的反事实设计更接近一个审计流程:如果移除证据会削弱答案,而移除相似的非证据区域不会产生同等影响,那么模型的回答才更可能是建立在正确视觉路径上。

这对细粒度视觉问答、图表理解、场景推理等任务都有现实意义。尤其是在高风险或高精度需求场景中,系统不能只追求最终准确率,还需要知道模型是否“因正确理由而正确”。论文称,Evidence-RL 在九个公开基准和四类骨干模型上超过既有基于强化学习的后训练方法,并通过针对性分析验证了对象中心信号的有效性。

当然,从摘要看,这项方法仍依赖弱对象级候选区域的质量;如果 proposal 本身漏检或误检,证据审计也可能受到影响。但总体而言,Evidence-RL 提供了一条清晰思路:未来的多模态模型训练,不应只奖励正确答案,还应奖励可由图像证据支撑的正确答案。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
图像对话不该只会等指令:让 AI 主动推荐下一步编辑
多模态
cctest.ai
多模态

图像对话不该只会等指令:让 AI 主动推荐下一步编辑

一项来自真实图像创作产品的数据研究指出,多轮图像编辑中的“下一步建议”必须看懂当前画面,而不能只依赖聊天文本。论文提出三阶段框架,通过人工意图构建、用户点击反馈强化学习和视觉校验器,显著提升了建议的可用性与一致性。

阅读全文