VLM不只要会回答,还要知道哪些部分不能回答
导语
一个成熟的视觉语言模型(VLM)不应把“回答所有问题”当作唯一目标。面对图像和文本请求,它还需要判断:问题是否建立在错误前提上,所需信息是否真的出现在图像中,答案是否原则上无法确定,要求的操作是否可行,以及请求是否存在安全风险。
现实中的难点往往不在于整道题都能答或都不能答,而在于一个问题同时包含两类内容。例如,用户可能一边询问图中物体的颜色,一边要求模型推断图中人物未展示的隐私信息。此时,模型理想的行为不是笼统拒绝,也不是照单全收,而是回答可验证的部分,并明确说明其余部分为何不能回答。
KoNA测什么
论文提出KoNA基准,用于评估视觉语言模型的“选择性非服从”能力。它覆盖五类场景:
- 错误前提:问题把并不存在或未经证实的事实当成前提,模型应予以纠正;
- 视觉不可访问:请求的信息没有出现在图像中,模型不应凭空补全;
- 普遍未知:即使依靠图像,也无法可靠得出答案的问题;
- 任务不可行:要求模型执行超出其能力或当前输入条件的操作;
- 安全风险:请求涉及不应直接协助的内容。
KoNA的设计不只评估单一问题层面的拒答,还把同一触发因素嵌入包含正常内容的复合问题,并配套完全可回答的问题作为对照。这样的配对可以区分两种常被混淆的错误:模型没有拒绝不该回答的部分,或模型因为遇到风险内容而把整道题都拒绝。
主要发现
论文对多种开放和闭源VLM进行评估后发现,模型在识别“应该拒绝、纠正还是暂缓回答”方面仍不稳定。问题一旦从单一请求变成复合请求,错误更加明显:模型可能顺着错误前提继续推理,也可能对不可见信息作出猜测;另一种情况则是采取“一刀切”的拒答,连同本来可以回答的内容也一并回避。
研究团队进一步使用KoNA中的选择性非服从样本,以及完全可回答样本,对小型开放模型进行监督微调和GRPO训练。结果显示,训练后模型的非服从准确率有明显改善,同时在完全可回答任务和一般基准上的能力大体得到保持。这说明拒答训练的目标不应只是提高拒答频率,而应提高拒答边界的精度。
意义与影响
KoNA提出的核心问题,对多模态助手、视觉问答系统和具备工具调用能力的智能体都很重要。真正可靠的系统需要把回答、纠错、说明信息不可得和安全拒绝组合在同一条响应中,而不是把“安全”简化成全答或全拒。
从评测角度看,复合问题更接近真实使用场景,也能暴露传统整体标签指标遗漏的细节。后续模型训练或许需要更多组件级标注,并同时衡量拒答正确性、可回答部分的覆盖率以及解释是否与证据相符。对开发者而言,这类基准也提醒我们:提升模型能力不仅是让它知道更多,更是让它清楚知道自己何时不该声称知道。
评论
正在确认登录状态……
正在加载评论……