返回文章列表
模型评测

Harbor:把智能体评测从“各自搭环境”推进到统一基础设施

阅读约 3 分钟

导语

随着语言模型逐渐具备浏览网页、操作终端、调用工具和完成多步任务的能力,评测对象已经从“模型能否回答问题”转向“智能体能否在真实环境中完成工作”。但现有智能体基准往往各自拥有环境、接口和运行方式,研究者需要为不同项目重复进行适配,结果也容易受到代理框架、工具配置和执行流程的影响。

arXiv 上的一项新工作提出 Harbor Adapters 和 Harbor-Index,试图从基础设施与测试集合两方面缓解这一问题。

核心要点

  • 统一接入大量基准。 Harbor Adapters 已将 80 多个智能体基准接入统一评测基础设施,使不同代理能够在相对一致的接口下运行。作者通过代码审查和一致性实验验证适配结果,重点关注移植后是否仍保持原基准的任务语义与难度。
  • 进行跨模型、跨基准测试。 研究覆盖 54 个基准和 8 个处于不同能力层级的模型。每个模型既使用 Terminus-2,也使用三个原生运行框架之一进行测试,从而观察模型能力与代理执行框架之间的差异,并分析失败模式。
  • 推出精选测试集。 Harbor-Index 从适配后的任务库中筛选出 82 个任务,覆盖 29 个基准。筛选过程结合难度过滤、人工与 AI 审核,以及发现问题后的审计和修复循环,目标是在控制运行成本的同时保留任务的多样性与挑战性。
  • 高通过率并不容易。 在这套精选集合上,没有任何已评估的模型—框架配置达到 30% 通过率;表现最好的 GPT-5.5 与 Codex 组合为 28.0%。这一结果说明,面对需要连续规划、环境交互和工具使用的任务,当前系统仍存在明显短板。

意义与影响

Harbor 的价值不只是增加一个排行榜,而是把智能体评测中容易被忽视的“工程层”显性化。统一适配器能够降低接入新基准的成本,也让研究者更容易区分:失败究竟来自模型推理能力、代理框架、工具调用,还是环境配置。对开发者而言,Harbor-Index 还提供了一个规模较小、但难度和覆盖面经过筛选的回归测试集合,有助于在模型或工具链迭代后快速检查能力变化。

当然,适配器并不能自动消除所有评测偏差。不同基准的任务目标、环境约束和成功判定仍可能不同;有限任务集也不能代表智能体在全部真实场景中的表现。因此,Harbor 更适合作为可复现评测的基础设施和补充工具,而不是单一的能力结论来源。研究团队公开适配器、结果、分析和 Harbor-Index,则为后续复核、扩展与改进提供了基础。

来源:arXiv

评论

正在确认登录状态……

正在加载评论……

相关文章