OPD²:用“差分信号”改进大模型在线策略蒸馏
NAVER AI Lab 提出的 On-Policy Delta Distillation(OPD²)不再直接模仿教师模型完整输出,而是学习推理调优前后产生的能力增量。论文称,这一设计在数学、科学与代码推理任务上稳定优于传统在线策略蒸馏。
阅读全文NAVER AI Lab 提出的 On-Policy Delta Distillation(OPD²)不再直接模仿教师模型完整输出,而是学习推理调优前后产生的能力增量。论文称,这一设计在数学、科学与代码推理任务上稳定优于传统在线策略蒸馏。
阅读全文LongStraw 试图填补“百万级上下文推理”和“短上下文 RL 后训练”之间的断层。它通过拆分提示处理与响应分支回放,让长轨迹强化学习在固定 GPU 预算下具备更高执行可行性。
阅读全文Ring-Zero 关注“零 RL”在 1T 参数规模上的训练规律:不依赖人工标注,而是用可验证奖励激发模型的链式推理能力。论文称,大规模不仅提高了样本效率和性能上限,也带来了自检、并行推理等更复杂的行为。
阅读全文一篇 arXiv 论文系统分析了 On-Policy Distillation 在大模型后训练中的角色与风险。研究认为,OPD 更像是探索催化剂,其成败取决于教师信号是否可靠。
阅读全文这篇 arXiv 论文提出 GFlowRL,用批内蒙特卡洛估计取代 GFlowNet 训练中的辅助分区函数网络,试图让分布匹配式 RL 更稳定地用于大模型后训练。
阅读全文这篇 arXiv 论文讨论了一个常被“总 FLOPs”掩盖的问题:在固定后训练预算下,算力究竟该投向更大模型、更多更新、更多 rollout 搜索,还是更强的奖励反馈?作者提出了面向 GRPO 的 FLOP 记账框架,并用 LoRA 适配的 Qwen2.5 策略模型做了条件性对比。
阅读全文一篇 arXiv 新论文提出 Lighthouse RL,用训练中发现的高质量电路配置作为重置点,引导强化学习更快探索有希望的设计区域。该方法面向模拟电路尺寸优化,强调样本效率、泛化能力和黑盒优化成本控制。
阅读全文一篇 arXiv 新论文提出,将李雅普诺夫特征指数作为物理信息密集奖励,用于训练强化学习智能体稳定垂直运动下的倒立摆。实验中,智能体不仅找到了经典 Kapitza 摆式的振荡稳定方式,还进一步将支点运动阻尼到严格直立状态。
阅读全文一篇新提交至 arXiv 的论文提出 TRACE,用冻结参考模型估计状态价值,并把最终答案信号转化为工具调用级别的奖励。它试图缓解长程智能体强化学习中“只看成败”的稀疏奖励问题。
阅读全文一篇 arXiv 新论文提出 SIVA-RL,用“干预后的实际效果”而不是“干预类型”来指导视觉对齐。该方法旨在减少视觉语言模型答对却未真正看图的情况。
阅读全文DAGR 试图解决目标条件强化学习中的一个常见盲点:目标编码通常不依赖当前状态,难以提示智能体“还差什么”。论文显示,它在导航任务上带来改进,但在操控和 puzzle 类任务中并未稳定超越基线。
阅读全文