Agon:让两个模型互相竞争,给推理过程“隐式打分”
导语
当前推理模型的训练很大程度依赖“可验证奖励”:答案对就给奖励,答案错就扣分。GRPO 等方法已经证明这条路线有效,但它也留下一个关键盲点——训练信号通常只看最终答案,而不真正评价中间推理轨迹。对于难题,模型可能学会生成更长的思考文本,却未必学会更可靠的推理策略。
Agon 试图换一种方式解决这个问题:不去人工标注“好推理”,也不额外训练奖励模型,而是让两个模型在同一道题上互相竞争,把对手变成自己的隐式评分器。
核心要点
- 从“看答案”转向“赢过对手”:Agon 中两个模型都尝试解决同一问题。它们交替扮演不同角色:一个先写出草稿,另一个在阅读草稿后继续求解。奖励不只来自题目是否做对,还来自是否能比对手解得更好。
- 推理质量被间接检验:如果一个模型的草稿只是冗长铺陈、缺少有效思路,那么看过草稿的对手仍可能超过它。要获胜,模型必须产生真正有帮助、难以被轻易反超的推理过程。
- 不需要过程监督标签:论文强调,Agon 不依赖人类标注的推理步骤,也不引入独立奖励模型。推理轨迹的价值通过竞争关系被隐式体现。
- 对手会同步变强:与单模型强化学习相比,Agon 的两个模型都在优化。随着训练推进,每个模型面对的竞争者也会变得更强,从而形成动态难度。
- 推理阶段保持训练形态:部署时,系统仍采用两阶段级联:一个模型先起草,另一个模型读取草稿后给出最终答案。
实验与影响
论文称,在 DeepMath hard split 上,使用 Qwen3 的 Agon 将 GRPO 的 pass@1 提升到约两倍;相比同一基础模型上未训练的 Mixture-of-Agents 方案,其增益约为后者的八倍。作者还表示,这一相对排序在竞争编程代码任务以及 Qwen3.5、Gemma 4 等模型家族上也能复现。
这项工作的重要性在于,它把“过程监督”的问题转化成了“竞争机制设计”的问题。过去,要让模型学会更好的推理,常见思路是收集高质量思维链、训练过程奖励模型,或用人工偏好进行评估;Agon 则尝试利用模型之间的差异性,让训练系统自己产生更强的评判压力。
当然,这也带来新的成本与工程问题:训练和推理都需要成对模型协作,延迟与算力开销可能高于单模型方案;两个模型需要能力接近且行为不同,如何稳定选择搭档也会影响效果。论文提到,目前模型之间仍以文本交流,下一步方向是让它们在潜在空间中共同推理。
如果这一思路继续成立,未来的推理模型训练可能不再只是“单个模型对着标准答案练习”,而更像是一场持续升级的辩论或竞赛。
评论
正在确认登录状态……
正在加载评论……