返回文章列表
AI 智能体

VeriHarness:让智能体学会验证长期任务的答案

阅读约 3 分钟

导语

当大语言模型开始处理跨越多个步骤、需要操作环境和持续决策的长期任务时,评价结果会变得比生成结果本身更困难。一次任务可能包含许多局部正确但彼此冲突的判断,最终产物也可能表面完整,却遗漏了关键要求。VeriHarness关注的正是这个问题:在测试阶段没有参考答案和评分标准的情况下,如何利用固定的基础模型提高验证能力。

核心思路:不要把共识直接当成正确

论文首先考察多次采样得到的不同任务轨迹。研究者观察到,分歧有时并非噪声,而是暴露了值得保留的正确替代方案;相反,多次运行形成的共识也可能共同掩盖错误。基于这一点,VeriHarness没有简单采用多数投票,而是把验证过程拆成两条路径:

  • 分歧解决:识别不同运行之间相互冲突的主张,再借助环境中的文件、工具或其他可观察证据逐项核查。
  • 共识挑战:即使多个运行给出相同结论,也主动测试这些共享主张,并搜索被遗漏的要求、边界条件或任务步骤。
  • 证据支持的修订:验证结果不仅用于选择最佳轨迹,还会反馈给智能体,指导它修订最终产物。

换言之,VeriHarness将原本用于生成答案的模型置于一个更完整的“验证工作台”中。工作台提供工作空间、证据工具和可重复使用的验证技能,使验证不再只是对最终文本做一次快速打分,而成为围绕任务环境展开的探查、比较与修改过程。

实验结果与边界

论文在五个长期工作区基准、两种前沿模型上比较了不同方法。摘要显示,VeriHarness在被评估的基线中取得了最高的选择得分;加入基于证据的修订后,相对于单次运行,Gemini 3.5 Flash平均提升6.2个百分点,Claude Opus 4.8平均提升6.4个百分点。研究还报告称,验证技能可以从失败反馈中自我改进,说明验证流程并非只能依靠人工一次性设计。

不过,这一结论也应谨慎解读。素材中的讨论指出,同一模型多次采样产生的分歧可能更多反映解码噪声,而不一定是独立的不确定性;如果验证器与生成器共享模型家族和训练分布,它们也可能共享相同盲点。因此,未来评估除了关注选择准确率,还应检验不同模型、提示和工具路径下的独立性,并重点衡量对对抗性错误的漏检率。

意义与影响

VeriHarness的价值不只是增加一次“审稿”步骤,而是把验证设计成一个有工具、有证据、有反馈闭环的智能体系统。对于软件操作、研究辅助和复杂工作流等长期任务,这种机制可能比单纯扩大采样次数更实用:它既尝试保留少数运行中的正确信息,也主动追问多数答案是否遗漏了什么。更重要的是,论文把验证技能视为可以通过失败反馈持续改进的对象,为未来构建更可靠的智能体提供了一个可扩展方向。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
LLM智能体会偏爱某些来源:搜索结果中的“来源偏见”如何形成
AI 智能体
cctest.ai
AI 智能体

LLM智能体会偏爱某些来源:搜索结果中的“来源偏见”如何形成

一项覆盖12个智能体模型、购物、酒店和学术检索三类场景的研究发现,LLM可能因为来源标签而偏爱某些选项,即使这些选项并不是最符合用户要求的选择。隐藏来源、补充缺失信息或在提示词中纠正预设,可以减弱这种偏好。

阅读全文