让智能体基准回答“不会”还是“不知道”?知识门控任务构造协议提出新方法
导语
评估智能体时,一个常被忽略的问题是:任务失败究竟源于模型“不会做”,还是根本“不知道该依据什么做”?现实中的专业工作往往依赖组织内部约定、私有表格、领域规则或特殊操作方式,而这些信息通常不会出现在公开语料中。如果基准测试没有控制知识是否可用,最终得分就很难解释。
题为《Ignorance or Incompetence? Constructing Knowledge-Gated, Verifiable Tasks for LLM Agents》的研究,提出了一套知识门控任务构造协议,试图把知识缺失与能力不足拆分开来。
核心方法
- 分离任务与知识:任务指令和一个紧凑的知识工件分别提供。工件可以包含私有约定、参考表以及供智能体使用的实用操作符。
- 保持对照公平:在“提供工件”和“隐藏工件”两种条件下,任务指令保持字节级一致,避免通过改写提示词制造差异。
- 检查信息泄漏:研究者记录构建过程并进行泄漏审计,降低公开语料、任务文本或其他渠道提前暴露答案的可能性。
- 要求可验证结果:结构化任务使用确定性求解器和规则语料提供精确答案;无法由单一程序判定的输出,则采用明确到标准层级的评分标准。
- 进行多次校准:研究以五次试验检验任务是否表现出稳定的知识门控效应,而不是依据单次运行下的偶然差异作结论。
实验观察
在十五项校准任务中,一个前沿智能体配置在提供知识工件时取得68.0%的通过率,而隐藏工件时通过率为0%。研究还报告了一个反例:当提供一份看似合理但实际错误的工件时,某项任务在五次试验中仍然全部失败。这说明“给了上下文”并不自动等于任务可解,工件本身的正确性和适用性同样重要。
按照研究者设定的五次经验知识门控筛选标准,最终保留了七项任务。需要注意的是,这些结果主要验证协议能否构造出可检验的知识依赖任务,并没有证明入选任务一定能提升模型后训练效果。
意义与局限
这项工作的价值在于为智能体评估增加了更清晰的因果对照。若智能体只在获得特定知识后成功,改进方向可能是检索、上下文注入或知识管理;若即使提供知识仍无法完成,问题则更可能涉及规划、工具使用、执行可靠性或指令遵循能力。相比笼统地把所有失败归因于“模型能力不足”,这种拆分更接近真实部署中的调试需求。
不过,协议仍有边界。研究使用的是配置相对的校准结果,且任务数量有限;所谓“知识门控”依赖具体智能体配置、工件设计和判定标准。公开发布的只是部分任务套件与配套工具,后续还需要在更广泛的模型、真实业务日志和长期任务中检验其稳定性。总体而言,这项研究不是一个新的智能体模型,而是一套帮助评估者更准确解释失败原因的测试设计框架。
评论
正在确认登录状态……
正在加载评论……