Nvidia的研究表明:真正决定AI智能体表现的,可能是Harness
导语
在讨论AI智能体时,行业往往首先比较底层模型的参数、榜单和推理能力。但Nvidia最新研究给出了一个值得重视的提醒:当任务需要连续做出大量决策时,决定结果的未必只是模型本身,包裹模型运行的Harness同样可能是主角。
Harness可以理解为模型外部的软件控制层。它负责管理上下文和记忆,提供工具、运行时、技能库与反馈机制,并规定智能体在遇到困难时如何继续行动。裸模型更像一个会思考的核心,而Harness决定它能否稳定地把思考转化为长期行动。
核心要点
- Nvidia研究人员为Claude Opus 5设计了定制Harness,并在ARC-AGI-3交互推理基准上取得100%的成绩。该基准包含没有明确说明的二维游戏,模型需要自行摸索规则并完成任务。
- 在不使用这套Harness时,Opus 5的成绩为30%,但这仍是测试模型中的最高成绩。这个对比说明,模型能力重要,却不是系统性能的全部。
- Nvidia特别加入了一个监督智能体。它类似“负责人”,会在主智能体陷入错误方向、反复探索或接近死路时进行提醒和纠偏。
- 长程任务对记忆、上下文压缩、反馈循环和任务分解要求更高。此前针对文档编辑的研究也显示,即使是前沿模型,连续执行任务仍可能积累大量错误。
为什么这很重要
单轮问答中的模型差距,未必能直接预测智能体在数小时甚至数天任务中的表现。智能体需要记住做过什么、判断哪些路径失败、适时调用工具,还要避免为了完成目标而删除文件、破坏数据库或采取不安全行动。缺少这些控制层,强大的模型也可能在长链路中逐渐偏离目标。
这项研究还改变了AI系统的成本与采购逻辑。Databricks此前的研究指出,同一个模型搭配不同Harness,成本可能出现显著差异。换言之,企业不能只问“使用哪个模型”,还需要问“使用什么样的运行框架、记忆策略和监督机制”。
Nvidia使用的AVO是研究人员自建的Harness,并非一款新产品。Nvidia更广泛的布局,是通过Nemo等项目提供构建智能体栈的组件。其主张是,开放Harness能让开发者同时掌控模型外围的工具、运行时、基础设施和安全规则。
因此,智能体竞争可能正在从单纯的模型竞赛转向系统工程竞赛。未来的差异化能力,不仅来自更强的“脑”,也来自更可靠的记忆、更有效的监督和更透明的控制接口。对于开发者而言,优化Harness或许是提升准确率、降低成本并减少失控风险的直接路径。
评论
正在确认登录状态……
正在加载评论……