返回文章列表
多模态

VAD:把多模态蒸馏中的“视觉证据”从教师偏好里分离出来

阅读约 3 分钟

导语

多模态模型蒸馏常见做法是让一个拥有更多视觉信息的“教师”去监督“学生”。在 on-policy distillation(OPD)中,学生先生成自己的推理轨迹,教师再对这些轨迹给出下一 token 层面的纠正。这种设置适合传递细粒度视觉能力,但也带来一个隐蔽问题:教师的纠正并不一定全都来自图像。

论文 VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation 关注的正是这一点。作者认为,教师输出混合了三类因素:视觉证据、语言先验,以及教师模型自身的偏好或习惯。若学生无差别学习全部纠正,可能会把非视觉因素也当成视觉知识吸收。

核心要点

  • 问题不是“蒸馏多强”,而是“蒸馏什么”:以往方法往往关注哪些位置更值得蒸馏,或怎样给视觉相关 token 加权。VAD 则进一步追问:某个纠正是否真的由视觉证据支撑。
  • 采用反事实视角估计视觉归因:在每个学生生成的前缀处,VAD 使用同一个固定教师模型,分别在“相关视觉证据存在”和“相关视觉证据被移除”的条件下评估输出。
  • 用居中 log 概率差构造视觉方向:两种条件下候选 token 概率的变化,被定义为一个带符号的代理方向,用来表示视觉证据是在支持还是反驳某些 token。
  • 重构学生锚定的训练目标:VAD 将原始教师纠正投影到这个视觉代理方向上,保留与视觉干预一致的成分,并把无法由该代理解释的残差分离出去。训练时,重构后的目标成为主要监督信号,特权教师只提供较弱的正则化。
  • 实验覆盖细粒度视觉任务:论文报告称,在六个细粒度视觉基准以及 4B、9B 两种模型规模上,VAD 优于直接特权视角蒸馏和 visual-advantage weighting 等方法。

意义与影响

VAD 的价值在于把多模态蒸馏从“模仿强教师”推进到“识别可归因证据”。在视觉问答、细粒度识别等任务中,模型犯错往往不是因为不会说,而是因为没有把视觉细节用于答案选择。若教师纠正里混入过多语言常识或模型偏好,学生可能得到看似有效、实则不够可解释的监督。

通过比较证据存在与移除后的差异,VAD 提供了一种更接近因果干预的训练信号:视觉证据支持什么、反驳什么,都能在 token 层面被拆出来。论文中的 token 级分析和受控目标分析也显示,与代理方向一致的成分更集中于任务相关的视觉纠正,尤其在证据反驳错误答案时,能带来更强的目标转移。

这项工作并不是发布一个新的多模态大模型,而是提出一种改进训练信号质量的方法。对正在构建视觉语言模型、希望提升细粒度视觉推理能力的团队来说,它提示了一个重要方向:更好的蒸馏不只是让学生更像教师,而是让学生学习那些真正由视觉证据支持的部分。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章