返回文章列表
强化学习

让推理模型学会适时停下:效率奖励如何改善拒答能力

阅读约 3 分钟

大型推理模型正在从“能不能答对”走向“是否应该回答”。一篇发表于 arXiv 的研究指出,当前模型在信息不完整、无法唯一确定答案的任务上,仍常常继续生成冗长的思维链,试图从不足的线索中推导结果。这不仅降低了拒答的可靠性,也浪费了推理时的计算资源。

人类与模型的差异

研究者将模型行为与一项人类研究结果进行比较。人类在面对不可回答任务时,通常会控制推理投入:当判断出题目缺少必要信息,思考成本不会无限增加。相比之下,大型推理模型在不可回答提示上的思维链反而可能比可回答提示更长。模型似乎把“继续思考”当成默认策略,而不是先判断任务是否具备求解条件。

这一差异揭示了拒答能力的另一面:它不只是输出一句“无法回答”,还包括尽早识别信息缺口,并避免在无解问题上持续消耗计算预算。

用奖励机制鼓励高效判断

为改善这一问题,研究团队借鉴“资源理性”视角,将有限的推理成本纳入训练目标,并设计了一种新的 GRPO 奖励。该奖励鼓励模型先判断任务是否包含解决问题所需的信息,同时避免为了追求答案而生成不必要的长思维链。

研究者在多个 4B 参数规模的大型推理模型上进行微调,重点观察三类结果:

  • 模型在信息不足任务上的拒答表现;
  • 对可回答任务的正常作答能力是否受到影响;
  • 解决任务时生成的思维链长度与推理效率。

结果显示,经过训练后,模型的拒答表现平均提升 12.8%,同时仍能保留回答可解任务的能力。更值得注意的是,模型生成的思维链平均缩短 44%,说明更好的拒答并不需要更多推理,关键在于更早识别“这个问题是否有足够信息可解”。

对推理系统的启示

这项工作把“拒答”与“效率”联系起来。对于部署在有限算力环境中的模型,避免在欠规格任务上反复推理,可以降低延迟和推理成本;对于用户而言,及时指出信息不足,也比提供貌似严谨但缺乏依据的答案更可靠。

不过,素材仅说明该方法在研究者测试的多个 4B 模型上取得了上述平均结果,并未提供更广泛模型规模、任务类型或真实应用场景中的结论。因此,这项工作更适合被理解为一种训练方向:让模型在开始深度推理前,先评估问题是否具备可回答性。未来的关键仍在于,如何区分真正不可解的问题与只是需要更多推理的问题,并在拒答谨慎与回答覆盖率之间取得平衡。

arXiv

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
小米公开强化学习直播:MiMo-V2.6如何把训练变成一场可观测的算力实验
强化学习
cctest.ai
强化学习

小米公开强化学习直播:MiMo-V2.6如何把训练变成一场可观测的算力实验

小米为MiMo-V2.6的Flash和Pro模型开放了强化学习训练页面,奖励曲线、训练步数、费用和硬件故障均可实时查看。更值得关注的是,小米试图从训练规模、环境数量和评分计算三个方向扩展Agent强化学习。

阅读全文