返回文章列表
模型评测

报告在场时,医疗视觉语言模型真的还在看影像吗?

阅读约 3 分钟

导语

医疗视觉语言模型可以同时读取医学影像、问题和放射科报告。当报告已经包含了问题所需的答案时,模型即使不认真分析影像,也可能生成看似正确的回答。如何区分“看到了影像”与“复述了报告”,成为评估这类模型的重要问题。

一篇发表于 Hugging Face Daily Papers 的研究提出了 ModaLens,用成对图像替换的方法测量模型对影像的敏感度。它关注的不是模型答案是否改变,而是:在问题和报告完全不变时,仅替换影像,模型的回答会不会随之变化。

核心方法

研究以 MedGemma-27B 为主要测试对象,使用 MIMIC-CXR 中来自293名患者的3199个配对案例。每个案例包含14个问题,其中13个针对具体影像征象,另有一个综合问题。研究者保留原问题与报告,再将影像替换为另一项检查中的图像,且多数情况下来自同一患者,以降低患者身份和整体病史差异带来的干扰。

测试分别在“提供报告”和“不提供报告”两种条件下进行,并记录模型生成答案是否发生变化。研究还考察了连续答案分数的变化,而不仅仅是二元答案是否翻转。

主要结果

  • 在明确要求模型作答的提示下,有报告时,影像被替换后答案变化率为4.26%。
  • 无报告时,答案变化率升至20.94%,成对差异为16.7个百分点;以患者为聚类单位计算的95%置信区间为15.6至17.7个百分点。
  • 原始提示配合小写首个输出词的读取方式,也得到相同方向的结果:有报告时为4.70%,无报告时为17.07%。
  • 即使二元预测没有改变,影像替换仍可能改变模型的连续答案分数,说明单看最终标签可能低估影像影响。
  • 这一方向在另外两种模型谱系中得到重复,但摘要没有提供其具体数值。

如何理解

结果表明,在本实验协议下,报告的存在会降低模型对影像替换的敏感度。一个合理解释是,报告为模型提供了足够强的语言线索,使其可以围绕既有文本完成回答,而不必充分利用当前输入的影像。这并不等于模型“完全不看图”,也不能直接推出模型在临床任务中必然不可靠。

研究还有一个关键限制:用于评估的标签来自放射科报告。因此,实验更准确地测量了“影像变化是否影响模型输出”,而不是模型是否做出了视觉上正确的医学判断。不同提示格式、输出解析方式和模型架构也可能影响敏感度数值。

ModaLens 的价值在于把“模型是否使用视觉证据”转化为可重复的审计问题。对医疗AI而言,未来评估不应只看最终准确率,还应检查模型在报告、问题和影像之间到底依赖了什么证据。只有在影像被系统替换、文本条件被严格控制,并结合独立视觉标注后,才能更接近对真实视觉推理能力的判断。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章