返回文章列表
强化学习

推理模型为何越自我训练越差?R-Quest从问题质量入手延续自我进化

阅读约 3 分钟

导语

让模型自己出题、自己解题,再用结果反复训练,是构建推理能力的一条重要路径。问题在于,这种闭环并不会天然产生高质量数据:训练轮次增加后,模型可能越来越擅长重复自己熟悉的模式,甚至把错误问题当成有效样本继续学习,最终导致性能下滑。

题为《Questioning the Questions: Sustaining Self-Evolution in Reasoning Models》的研究,专门分析了这一现象,并提出R-Quest,试图回答一个关键问题:如果训练数据主要来自模型自身,如何避免“越学越窄”?

两类被忽视的问题

研究将自我生成题目的质量风险归纳为两种。

  • 无效问题逐轮增加。 有些题目本身存在逻辑缺陷、条件不足或无法合理作答。传统的答案一致性过滤并不能完全解决这一问题,反而可能让某些无效题更容易进入训练集。换言之,只看多个答案是否一致,并不等于确认题目本身成立。
  • 数学问题出现隐性重复。 许多去重方法依赖词汇或表面文本相似度,因此可能把换了一种说法、换了一组表达方式、但数学结构完全相同的题目当作新题。随着训练继续,这种“变体重复”会累积,最终造成问题多样性坍缩。

这两个问题共同指向一个事实:自我进化的瓶颈不只是求解器能力,也在于出题器持续提供了什么样的练习材料。

R-Quest如何修正闭环

R-Quest没有只依赖最终答案筛选数据,而是把“题目是否有效”和“题目是否新颖”作为额外反馈信号。

首先,研究者训练求解器识别并拒绝无效问题。之后,这类判断被用于调整出题器的奖励,同时过滤求解器训练数据,降低错误题目在闭环中的传播概率。

其次,为了识别难以通过词面去重发现的重复题目,R-Quest使用一个冻结的基础模型比较采样题目对,并提供新颖性反馈。冻结模型的作用是充当相对稳定的参照,帮助系统判断两道题是否只是不同表述下的同一数学任务。

实验信号与意义

根据论文摘要,R-Quest在两个模型家族的12项基准测试上,覆盖数学推理、通用领域推理和代码生成,取得了最高的平均表现。更重要的是,在10轮自我进化中,它仍能保持稳定收益,并在最后一轮达到峰值;相较R-Zero,最终成绩高出17.32分。

这项工作的价值不只是提出一个新流程,更在于重新定义了自我训练中的数据质量标准。对会自动生成训练数据的推理系统而言,“答案看起来一致”远远不够,还必须检查问题是否成立、是否真正提供了新的能力挑战。

从更广的角度看,R-Quest说明自我进化需要配套的质量控制机制:有效性负责阻止错误信号进入系统,新颖性负责避免训练分布不断收缩。未来,如何更准确地判断任务难度、信息增益与跨领域重复,可能仍是让模型长期自我改进的关键。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
NeMo-DCR:用增量同步把万亿参数智能体强化学习权重更新提速约35倍
强化学习
cctest.ai
强化学习

NeMo-DCR:用增量同步把万亿参数智能体强化学习权重更新提速约35倍

NeMo-DCR 面向训练集群与 rollout 集群之间的权重同步,只传输发生变化的参数,并保证接收端与完整检查点加载结果逐位一致。在 1 万亿参数、3% 元素变化的测试中,同步时间从 87.5 分钟降至 2.5 分钟。

阅读全文