当智能体开始变慢:用“每Token Elo”衡量测试时策略
导语
当大语言模型从“一次作答”变成会反复修改、调用工具、尝试不同路径的智能体,如何衡量测试时计算的价值,变成了一个比最终得分更复杂的问题。简单比较固定预算下的成功率,往往无法说明模型究竟是更会分配计算,还是只是生成了更多候选答案。
一篇发表于 Hugging Face Daily Papers 的研究提出了 Elo-per-token 分析方法,试图把智能体在长轨迹中的进步过程记录下来,并回答一个关键问题:智能体投入更多Token后,性能提升的速度何时开始放缓?
核心方法:把进步曲线转化为Elo
研究聚焦于能够提供连续中间评分的开放式任务。对于一条智能体轨迹,研究者会在每个Token预算点记录截至当前找到的最佳解,而不是只看会话结束时的结果。这样,模型在修改方案、探索备选解或使用工具时产生的阶段性进步,都能进入分析。
由于不同任务的原始分数尺度并不一致,研究者进一步使用 Bradley-Terry 模型,把任务内部的解排序汇总为跨任务可比较的Elo评级。最终得到的是一条“计算预算—Elo”曲线,而不仅是一个单点成绩。
研究的主要观察包括:
- 独立采样可以作为理论上可刻画的参照,其Elo会随计算量的对数近似线性增长。
- 智能体在早期阶段通常能比独立采样更高效地把Token转化为Elo,说明修订、工具使用和搜索策略确实能带来额外收益。
- 随着单次会话预算扩大,智能体的边际收益逐步下降,并最终可能低于独立采样参考线。
- 研究者将智能体边际Elo收益与独立采样参考相等时对应的预算,定义为“扩展拐点”,以便比较不同系统何时开始进入低效区间。
实验范围与对照
论文将这一方法应用于四个通用智能体和四个开放式基准,单次会话最长达到1亿Token;同时还在受控的单任务环境中,考察了三个由反馈驱动的LLM优化框架。这样的设计覆盖了通用智能体和较为可控的优化流程,有助于区分系统本身的策略差异与任务难度差异。
研究还将智能体曲线与AtCoder启发式竞赛中表现突出的历史人类选手进行对比。结果显示,人类选手在共享任务上随竞赛时间推移仍能实现超线性进步。这并不意味着人类始终优于智能体,而是提示人类会从反馈中持续学习、改变策略,智能体在测试阶段的停滞并非问题的必然上限。
意义与影响
这项工作的重要价值,在于把“给模型更多计算”从一个笼统的扩展口号,转化为可测量的效率曲线。未来评估智能体时,除了最终成功率,还应关注每个额外Token带来的增益、搜索是否有效,以及系统何时进入边际收益快速下滑的阶段。
对智能体开发者而言,拐点可以帮助决定何时停止当前会话、何时切换策略,或是否应采用并行采样、反馈学习和更好的路由机制。对评测者而言,Elo-per-token提供了一种跨任务比较测试时策略的思路。更值得注意的是,智能体“变慢”可能并不只是需要更大预算,而是暴露出持续学习、反馈利用和策略重组能力的不足。
评论
正在确认登录状态……
正在加载评论……