返回文章列表
强化学习

MiMo-V2.6如何把强化学习扩展成模型自我提升基础设施

阅读约 2 分钟

导语

强化学习正在成为大模型获得更强推理与执行能力的重要训练方式,但把它扩展到长上下文、多模态和多任务场景,并不只是增加算力。MiMo-V2.6系列技术报告的重点,正是围绕规模化强化学习建立一套完整的训练、环境和评估基础设施。

核心要点

  • 从三条路径扩大RL规模。 其一是扩大批次并提升吞吐:异步训练每步可消耗1568个样本和约27亿至37亿个token,支持最长约100万token的上下文。其二是增加环境的多样性与复杂度,覆盖代码、通用任务、视觉和网络安全场景,并结合多种智能体运行框架。其三是提高评分器的计算投入,通过按组执行的智能体式评分,为长链路任务提供更细致的奖励信号。
  • 先做多模态中期训练。 在强化学习开始前,团队使用广泛的多模态语料进行mid-training,为后续探索提供更大的能力空间;同时在预训练得到的hybrid-SWA架构上完善基础设施。
  • 把稳定性和反奖励投机放在核心位置。 报告提到冻结MoE路由器,以降低大规模训练中的不稳定因素,并构建多层防线,避免模型通过迎合评分规则而非真正完成任务来获得奖励。评分机制还会引导模型采用更短、更节省token的解决方案。
  • 统一多任务智能体训练链路。 相关系统包括统一轨迹表示、高并发多框架rollout、控制面与数据面解耦,以及训练和推理一致性设计。这些组件面向的是混合任务场景,而不是单一基准上的局部优化。

意义与影响

MiMo-V2.6的价值不只在于报告了更大的训练规模,也在于把强化学习视为一项系统工程:模型、环境、采样、评分和训练稳定性必须协同设计。尤其是长上下文与长周期任务,奖励信号本身可能成为瓶颈;智能体式分组评分提供了一种增加评估计算、改善反馈质量的思路。

不过,现有材料主要介绍方法、基础设施和开放计划,并未在摘要中给出完整的模型对比结果。因此,更稳妥的解读是:MiMo-V2.6展示了规模化RL的工程路线,而不是仅凭这些信息断言其在所有任务上已经取得领先。团队表示将开放训练动态、强化学习环境和框架,这有助于研究者复现流程,并进一步观察大规模RL是否能够稳定带来自我改进。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
NeMo-DCR:用增量同步把万亿参数智能体强化学习权重更新提速约35倍
强化学习
cctest.ai
强化学习

NeMo-DCR:用增量同步把万亿参数智能体强化学习权重更新提速约35倍

NeMo-DCR 面向训练集群与 rollout 集群之间的权重同步,只传输发生变化的参数,并保证接收端与完整检查点加载结果逐位一致。在 1 万亿参数、3% 元素变化的测试中,同步时间从 87.5 分钟降至 2.5 分钟。

阅读全文