SpanCalib-VLM:让视觉语言模型的幻觉检测更准,也更可信
导语
视觉语言模型能够根据图像生成自然语言回答,但回答中的某些词语、短语或事实可能并没有得到图像支持。对这类幻觉进行检测时,系统不能只回答“有没有错”,还需要定位具体的错误文本片段,并判断自己的置信度是否可靠。SpanCalib-VLM 关注的正是这一更细粒度的问题。
核心方法
论文提出的是一个由两类模型组成的混合系统:
- 生成式视觉语言模型:使用微调后的 Qwen3.5-4B-SHROOM-SFT,擅长从完整回答中找出可能存在幻觉的文本跨度,但推理速度较慢,而且容易给出过于自信的判断。
- 多模态序列标注器:以 XLM-RoBERTa-Large 处理文本,并通过交叉注意力融合 SigLIP 视觉编码器的信息。该模块以确定性的方式对文本序列进行标注,通常具有更好的置信度校准和更低的推理延迟,但可能漏掉一部分幻觉跨度。
两者的分工并不是简单投票。生成式模型先提出候选幻觉片段,序列标注器再利用自身的概率输出对这些候选进行重新评分。论文将这一策略称为 Union-Calibrated Fusion。它试图保留生成模型较高的召回能力,同时借助判别式模型抑制过度自信,并改善最终概率与真实结果之间的一致性。
评测结果怎么看
在 SHROOM-Visions 英文评测集上,作者报告该集成系统的 Pearson 校准相关性为 0.41,整体 IoU 为 0.39,整体检测准确率为 70.7%。对于没有幻觉的回答,clean-response IoU 达到 0.91。这里的结果同时反映出两个特点:系统在干净回答上的判断较稳定,但在更复杂的整体检测任务中,跨度边界定位和置信度校准仍有提升空间。
这些指标也说明,幻觉检测并非单一的分类问题。IoU 关注预测片段与标注片段的重叠程度,校准相关性则关注分数是否能反映判断可靠性。一个模型即使找到了较多错误,也可能因为分数过于激进而不适合用于后续筛选或人工复核。
意义与局限
SpanCalib-VLM 的价值在于把“发现更多候选”和“给出更可信分数”拆分给不同模型完成,为视觉语言模型评测提供了一种模块化思路。对于需要自动标记风险回答、排序人工审核样本或比较不同模型可靠性的场景,校准后的跨度级信号可能比单个整体分数更有用。
不过,当前结果来自 SHROOM-Visions 英文评测集,素材没有提供跨语言、不同图像类型或不同模型规模下的表现。因此,该方案能否稳定迁移到更广泛的应用环境,仍需要进一步实验验证。作者已公开模型权重和代码,这为复现实验以及研究生成式与判别式检测器的组合方式提供了基础。
评论
正在确认登录状态……
正在加载评论……