Chain-of-Experience:让大模型在推理时从经验中持续改进
导语
传统大模型评测通常把一次提示到一次回答视为完整过程,重点衡量模型“当下会不会做”。但在人类解决问题时,第一次尝试往往只是起点:我们会根据结果复盘、修正策略,再继续尝试。论文《Chain-of-Experience for Continual LLM Improvement》关注的正是这一差异,并将测试时基于经验的迭代改进定义为 Chain-of-Experience(CoE)。
核心要点
- 把推理变成反馈循环。 CoE 不要求模型在部署前重新训练,而是在推理阶段保存由多轮交互产生的经验痕迹,并将其用于后续尝试。反馈可以来自模型自身的评估,也可以来自外部环境。
- 反馈来源具有多样性。 研究考察了模型自反馈、答案正确性信号,以及编程任务中的公开测试通过率等机制。它们提供的信息并不完全相同,因此能够从不同角度帮助模型修正答案或策略。
- 覆盖多类任务与模型。 实验涉及数学、代码和知识领域,并在 8 个大语言模型上展开,包括摘要中列出的 GPT-5、Gemini-2.5 Pro 和 Claude-4.5 Sonnet。
- 迭代经验通常有效。 与不使用反馈的测试时基线相比,CoE 在不同任务和模型上总体表现更好。摘要报告的总体提升为 5.6%,API 成本降低 19%;同时,CoE 获得了更高的准确率/token。
- 组合反馈更有潜力。 模型反馈与正确性等环境信号结合后,可以带来额外收益。研究还观察到,模型基础能力越强,利用经验继续提升的能力往往也越强;多数收益出现在较早的迭代阶段。
意义与局限
CoE 的价值在于重新定义了测试时扩展:增加计算量不只是让模型生成更多候选答案,也可以让它记住此前的尝试,并依据结果调整下一步行动。这为数学求解、代码修复以及需要外部验证的知识任务提供了一种统一框架。尤其在能够获得明确环境信号的场景中,模型可以把“失败”转化为后续推理的输入,而不是简单丢弃。
研究还指出,模型在较弱或带有噪声的反馈下仍保持一定稳健性。不过,这并不意味着任意反馈都可靠,也不能据此推断 CoE 在所有任务上都能稳定提升。摘要没有展开具体实验配置、迭代次数和成本计算方式,因此相关数字应理解为论文整体实验的报告结果,而非普遍适用的部署保证。未来关键问题包括:如何筛选高价值经验、何时停止迭代,以及如何避免错误反馈在循环中被反复放大。
如果这些问题得到解决,大模型评测或许需要从“单轮准确率”进一步转向“经过交互后能否持续变好”,而 CoE 提供了一个值得关注的测量与系统设计视角。
评论
正在确认登录状态……
正在加载评论……