返回文章列表
模型评测

VLM评测的新陷阱:图片不提供信息,却能改变模型判断

阅读约 3 分钟

导语

视觉语言模型(VLM)正在被用于图像描述、内容审核和数据标注,甚至被当作人工评审者使用。问题在于:当任务明确要求模型只依据文字作答时,一张“无关图片”是否真的无关?来自Technion团队的研究给出了一个值得警惕的答案——图片不一定提供有效证据,却足以让模型改变判断。

MIST如何测试模型

研究者提出了MIST(Misleading-Image Stress Test),包含200个英语句子。每个句子围绕一个既可以按字面理解、也可以按隐喻理解的短语展开,并设置三种输入条件:

  • 匹配图片:展示句子某一种含义对应的画面;
  • 误导图片:展示相反含义对应的画面;
  • 无图片:只提供文字。

评测指南要求标签必须由句子本身决定,因此三种条件原则上应得到相同答案。研究团队测试了13个VLM评审者,并将结果与人工标注进行比较。

图片在改变什么

结果并没有显示模型稳定地“看图选义”。匹配图片让20.5%的标签发生变化,误导图片也让19.4%的标签发生变化,两者几乎相当,而且都高于保留图片、但删除“忽略图片”指令时产生的11.6%变化率。更关键的是,在两种图片导致不同答案的样本中,只有37%的变化朝向图片所展示的含义。

换句话说,模型并不是简单地被图片内容牵着走。图片是否存在,似乎比图片究竟展示了什么更能扰动判断。与此同时,无图、匹配图和误导图条件下,模型与人工标注的一致性没有明显改善。

研究还比较了通过和未通过另一项替代性测试(alt-test)的模型。前者受影响较小,后者波动更大,但这种现象在两组中都存在。这表明,即使模型整体表现更可靠,也不能据此假设它会严格遵守“忽略无关模态”的要求。

对评测的意义

这项工作提醒我们,VLM评测中的“模型能力”与“实验配置”很难完全分离。输入中多出一张图片、改变图片与文字的排列,甚至只调整提示语,都可能改变最终标签。若研究者仅报告某一套固定配置下的准确率或人工替代性结论,就可能把配置造成的稳定性问题误认为模型本身的能力差异。

更稳妥的做法,是在评测中加入模态缺失、相关图片、冲突图片和无关图片等对照条件,并同时报告答案一致性与对人工标签的符合程度。对于实际部署,也不能只验证模型“答得对不对”,还要检查它是否依据了任务允许的证据。

MIST的核心启示并非“VLM一定会被图片误导”,而是:当图片按规范不应发挥作用时,它仍可能成为输入配置中的扰动源。评测模型能否替代人类时,测到的可能不仅是模型,也包括整个交互环境。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
AutoDataBench:把“数据智能”从自动科研中单独测出来
模型评测
cctest.ai
模型评测

AutoDataBench:把“数据智能”从自动科研中单独测出来

AutoDataBench 提出一个受控测试平台,将训练框架、超参数和算力等因素固定下来,专门评估智能体诊断、组织和构造训练数据的能力。研究还考察模型能否预测数据干预的效果,以及基准测试轨迹能否反过来成为训练数据。

阅读全文