返回文章列表
强化学习

When2Think:让推理模型学会判断何时该思考

阅读约 2 分钟

大型推理模型正在把更多计算预算投入“思考”过程,但一个明显问题也随之出现:面对简单题目,它们可能生成冗长而没有必要的推理;面对真正困难的题目,又可能在推理深度不足时过早给出答案。如何把有限计算分配给最需要它的实例,成为提升推理效率的关键。

从统一压缩转向按题目分配计算

微软团队提出的 When2Think,将高效推理定义为实例自适应的计算分配问题。它不是简单地对所有回答施加统一长度惩罚,也不是使用固定规则把输入分流到不同模型,而是希望模型自己学习:哪些问题适合直接回答,哪些问题值得启动更长的推理流程。论文将前者称为 System 1(NoThink),后者称为 System 2(Think)。

核心组件是实例级难度感知控制(IDAC)。该机制利用预先计算的参考统计信息,包括不同实例上的准确率和 token 使用情况,对训练奖励进行塑形。直观而言,容易解决且无需长推理的问题会得到更强的效率导向,而难题则不会因为统一的长度约束而被迫缩短思考。这样,长度控制不再只是“越短越好”,而是与题目难度和结果质量绑定。

不依赖在线参考模型的训练方式

When2Think 还结合了基于验证器的奖励,以及批次级标准化优势。根据论文摘要,这套设计支持稳定的、无需评论家模型的优化过程,也不需要在训练期间持续查询在线参考模型或额外训练奖励模型。其目标是在降低训练和推理控制复杂度的同时,让模型形成更灵活的思考策略。

实验结果与意义

在数学基准测试中,When2Think 展现出较好的准确率—效率权衡。相较基础模型,它在 AIME24 上的 Pass@3 提升 10.0%,token 使用量减少 27.9%;在 AIME25 上取得 40.0% Pass@3,并优于论文所比较的压缩和仅路由基线。

这些结果说明,推理效率优化未必只能依靠缩短所有答案,关键还在于避免对简单题过度计算,同时保护困难题所需的推理预算。需要注意的是,现有素材主要披露了数学基准和总体方法,尚未提供更完整的跨领域测试、成本明细或泛化分析。因此,When2Think 的实际适用范围仍需更多实验验证。但从方法方向看,它把“是否思考”与“思考多久”统一为一个可学习的决策问题,为混合推理模型的后训练提供了新的思路。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
小米公开强化学习直播:MiMo-V2.6如何把训练变成一场可观测的算力实验
强化学习
cctest.ai
强化学习

小米公开强化学习直播:MiMo-V2.6如何把训练变成一场可观测的算力实验

小米为MiMo-V2.6的Flash和Pro模型开放了强化学习训练页面,奖励曲线、训练步数、费用和硬件故障均可实时查看。更值得关注的是,小米试图从训练规模、环境数量和评分计算三个方向扩展Agent强化学习。

阅读全文