小米公开强化学习直播:MiMo-V2.6如何把训练变成一场可观测的算力实验
导语:训练过程也开始直播
小米近期为MiMo-V2.6的Flash和Pro两款模型开放了强化学习训练页面。与常见的开源权重、代码或数据不同,这次公开的是训练过程本身:外界可以看到模型运行了多少步、奖励曲线如何变化、当前消耗了多少资金,甚至能看到部分计算节点出现显卡故障。
从已公开的信息看,两款模型尚处于训练早期。以Pro模型开始训练后的约36小时计算,累计成本已超过108万美元,平均每小时约3万美元。这个数字并不代表后续费用会以相同速度增长,但它直观展示了大规模Agent强化学习对算力和基础设施的需求。
三个方向扩展强化学习
小米将这套训练思路概括为三个Scaling方向:
- 扩大训练计算量。 每个训练Step大约处理20亿Token,使用1568个Prompt,每个Prompt生成16条Rollout。同一任务被多次尝试后,系统可以比较不同轨迹的结果,从而获得更丰富的训练信号。
- 扩大环境与执行框架。 MiMo-V2.6采用Multi-task Agentic RL,把代码、通用任务、视觉和聊天等任务混合到同一轮训练中。不同任务可以运行在各自的Harness中,例如代码Agent能够调用终端、修改文件、运行测试并根据报错继续行动。
- 扩大评分计算量。 对复杂Agent任务而言,最终成功或失败往往不足以说明每一步行为的价值。小米提到Agentic In-group Credit Assignment,目标是结合同一Prompt下的多条轨迹,对哪些行动更有效进行更细致的归因。具体算法目前尚未公开。
这套系统还采用Fully Async机制。任务生成、环境执行、奖励计算和模型更新不必严格等待彼此完成,而是可以同时处于不同阶段,以减少大规模训练中的空转。
目前表现如何
公开曲线显示,Pro的dynsam/avg@n指标从约0.565升至0.614,Flash则从约0.514升至0.603。最新公开的DeepSWE v1.1离线评测中,Pro和Flash分别为62.24和60.77;作为对照,DeepSeek-Flash v1.1为74.2%。由于训练仍在早期,且Pro完成一个Step所需时间更长,当前结果不能视为最终排名。
意义与局限
小米这次尝试的价值,不只是展示了一个模型的训练进度,更在于把强化学习系统拆成可观察的工程环节:经验如何生成、任务如何进入环境、奖励如何计算,以及算力究竟消耗在哪里。它也说明,Agent强化学习的Scaling并非简单增加参数,而是同时扩展轨迹数量、环境多样性和评价能力。
不过,公开费用和曲线并不能直接证明模型已经取得领先。奖励指标与真实任务能力之间仍需更多独立评测验证,信用分配方法的细节也有待披露。最终能否把高昂的交互成本转化为稳定的泛化能力,仍是这场实验最值得关注的结果。
来源:量子位
评论
正在确认登录状态……
正在加载评论……