进化策略为何能覆盖更多推理路径?一项对比 GRPO 的研究
一篇新研究系统分析了进化策略在大语言模型推理后训练中的优化行为。结果显示,ES 在提升 Pass@1 的同时,还能保留更广泛的解题路径,并在 Pass@K 上超过 GRPO。
阅读全文一篇新研究系统分析了进化策略在大语言模型推理后训练中的优化行为。结果显示,ES 在提升 Pass@1 的同时,还能保留更广泛的解题路径,并在 Pass@K 上超过 GRPO。
阅读全文TTPO提出一种无需人工标签的测试时训练方法:把多数投票结果当作弱监督信号,同时区别对待认同与不认同该结果的推理轨迹。研究显示,这种非对称优化能够降低伪标签错误带来的风险。
阅读全文WarpSAC 的核心观点是:离策略强化学习的最佳训练策略取决于数据供给,而不是简单追求更多稳定化机制。研究据此提出面向不同数据 regime 的 SAC 变体,并在 CPU 与 GPU 并行训练中取得改进。
阅读全文Co-RL提出一种协作式多智能体强化学习框架,让多个不共享参数的模型通过彼此反馈获得奖励。在没有人工标注或可验证真值的情况下,模型仍能提升文本与多模态推理表现。
阅读全文Agent Lightning v1.0提出“框架原生智能体强化学习”范式,让部署时负责工具调用、上下文管理和流程控制的智能体框架直接参与模型后训练。实验显示,仅用6000个训练样本和有限算力,Qwen3.5-9B在SWE-bench Verified上的成绩从41.8%提升至56.4%。
阅读全文Hugging Face Daily Papers 收录的 DAPD 论文指出,在线自蒸馏中的性能退化并不只是训练技巧问题,而是教师与学生在可见信息上的不对称所致。论文提出双锚定策略蒸馏,用两层锚点缓解“特权幻觉”。
阅读全文SAF-OPD 关注一个训练大模型时常见但容易被低估的问题:可验证奖励强化学习与在线蒸馏各有优势,简单相加却可能让训练提前失去探索能力。论文提出的 SAF 通过调节教师信号的强度与时机,在数学推理和代码生成任务中带来更稳定的收益。
阅读全文南京大学团队提出 CSCR,试图修正长 CoT 强化学习中“把同一奖励平均分给所有 token”的粗粒度做法。论文指出,某些看似变化很大的 token 往往只是表层表达敏感,并不一定承载真正的推理价值。
阅读全文Rubric-based RL 正成为提升大模型开放式任务能力的重要路径,但它并不只是“探索不够”这么简单。论文提出 CriPO,通过在策略自身内部构造教师信号,同时处理未探索标准与被压制标准。
阅读全文这篇论文试图解决一个关键瓶颈:开放式写作、摘要等任务很难像数学和代码那样给出确定奖励。作者提出 RLSVR,通过任务转换构造“自可验证”奖励,让模型在无需人工偏好或额外裁判模型的情况下进行自我改进。
阅读全文NVIDIA 相关研究者提出 Molt,一个强调轻量、可读和可改造的 PyTorch 原生训练框架,目标是降低智能体强化学习研究中的工程摩擦。它用统一的异步训练循环支持多模态与 MoE 策略,并在匹配协议下与 Megatron 系栈表现相当。
阅读全文Qwen 相关团队提出 Skill Self-Play,用可验证的 agent 技能作为中间层,试图同时解决开放任务多样性与反馈可靠性之间的矛盾。该框架让出题者、解题者和技能控制器在强化学习循环中共同演化。
阅读全文这篇论文提出,RLVR 提升大模型推理能力时,权重奇异值谱几乎没有被重写,真正承载新能力的是输入与输出奇异向量框架的变化。基于这一观察,作者构建了固定谱的 ISO 优化栈,覆盖离线模型合并与在线训练优化。
阅读全文异步强化学习能提升吞吐,但 rollout 与训练之间的策略滞后会放大更新风险。SAT 试图把 PPO 的裁剪区间与样本陈旧度对齐,让高不匹配样本获得更保守的更新约束。
阅读全文GEPO 是对 GRPO 的轻量改造,核心不是简单压高熵或保低熵,而是按 prompt 分组的熵状态,去做更细粒度的优势项塑形。它试图解决混合任务训练中,不同题型探索需求不一致、导致统一熵控制失灵的问题。
阅读全文这篇论文尝试把传统的“裁判式”反馈,升级为更高带宽的“教练式”经验知识。它的目标不是只给一个分数,而是把评估中的细粒度判断转化为可迁移的学习信号。
阅读全文这篇论文提出 Distilled Reinforcement Learning,将教师模型的细粒度偏好引入 LLM 后训练的策略梯度更新中,试图同时避开传统 RL 奖励稀疏和在线蒸馏盲目模仿的问题。
阅读全文SVR-R1 试图把推理时常见的自我检查,前移到强化学习训练循环中。它让视觉语言模型先回答、再给出 Yes/No 自判,并在否定时触发重新思考。
阅读全文这篇论文提出 Contrastive Policy Optimization(CPO),尝试解决 RLVR 中把熵当作优势塑形信号时无法区分“有益不确定性”和“有害混乱”的问题。它通过比较参考引导生成与普通生成的 token 级分布差异,为训练提供更接近正确性的信号。
阅读全文这篇论文把 Muon 从大规模预训练场景拉到稀疏奖励的智能体强化学习后训练中,发现它并非“换上就有效”,而是在特定优势估计方法和学习率设置下显著优于 AdamW。
阅读全文