视觉语言模型如何用程序验证实现更可靠的自我进化
导语
让视觉语言模型从无标注图像中“自我进化”,关键不只是生成更多问题,还要为这些问题提供可信标签。现有流程通常让模型多次作答后采用多数投票,或直接交给模型评审。但这两种方式都可能把错误答案当成监督信号,模型越训练,错误也可能被反复放大。
来自 MBZUAI 的研究团队提出了 VQS(Verifiable QA Generation for Self-Evolving Models),试图把答案验证从“判断哪个回答最好”改造成“核对几个明确事实”。论文已发布于 Hugging Face Daily Papers,并开源了实现代码。
核心方法:先结构化,再计算
VQS 不让模型直接围绕图像生成问题和答案,而是分成三个步骤:
- 解析图像:模型先把图像转换为结构化记录,例如场景图、图表表格或示意图中的关系图。
- 程序生成问答:固定程序从这些记录中组合问题,并依据记录中的字段计算答案。计算过程不依赖模型临场“猜测”。
- 逐条核验事实:视觉语言模型只检查程序实际使用的短事实,例如某个对象是否存在、某个数值是否对应某一行,而不是对完整答案进行开放式评判。
经过核验的事实还会反过来筛选解析器的训练目标。这样,图像解析模块也能利用无标注数据持续改进,形成从视觉理解、结构化表达,到可验证问答的闭环。
为什么这种设计更稳
多数投票的前提是“多数答案更可能正确”,但当模型共享相似的视觉偏差时,多个错误答案也可能一致。模型评审则容易受到表述方式、推理长度或自身判断偏差影响。VQS 将复杂的端到端判断拆成若干局部声明,使验证任务更短、更明确;同时,固定程序负责可机械执行的组合与计算,减少语言模型在算术、关系推导和答案格式上的不确定性。
论文中的人工评估显示,VQS 生成答案的正确率为 94%,而多数投票方法为 76%。研究还报告,在自进化过程中,多数投票标签有 24% 被人工判定为错误,模型评审标签的错误率也达到 18%。这些结果说明,训练数据的验证机制可能比单纯扩大合成数据规模更重要。
实验表现与意义
在十项基准测试上,VQS 为 2B、4B 和 8B 规模的 Qwen3-VL 带来了最高 3.18 个百分点的提升,并在每个规模上超过最强的自进化基线。经过三轮训练后,2B 模型的累计提升达到 3.84 个百分点,表明改进并非只来自一次性的数据筛选。
更广泛地看,VQS 提供了一种适用于多模态自训练的思路:让模型负责感知和提出候选结构,让程序负责可验证的生成与计算,再让模型以细粒度方式检查视觉事实。它并不能消除解析错误,也不意味着所有自动生成标签都可靠,但把错误暴露在更小的验证单元中,有助于降低错误监督信号对后续训练的影响。对于缺少人工标注、又需要持续扩展视觉问答能力的场景,这种“程序约束加局部核验”的路线值得继续观察。
评论
正在确认登录状态……
正在加载评论……