返回文章列表
强化学习

小米 MiMo-V2.6:规模化 Agentic RL 的工程化路线

阅读约 2 分钟

导语

大模型后训练正在从“让模型回答得更好”,转向“让模型在环境中完成更长、更复杂的任务”。小米 MiMo 团队发布的 MiMo-V2.6 技术报告,展示了一套规模化 Agentic RL(智能体强化学习)方案:通过同时扩大 Rollout、任务环境、Agent Harness 和 Grader Compute,建立更密集的反馈闭环。

核心要点

  • 训练规模显著扩大。 MiMo-V2.6-Pro 总参数量为 1.02T、激活参数 42B;Flash 总参数量为 310B、激活参数 15B,均采用 MoE 架构。一次 RL Step 采样 1568 个 Prompt,每个 Prompt 生成 16 条轨迹,累计约 27 亿至 37 亿 Token,最长上下文达到 100 万 Token。
  • 成本主要来自长程交互。 Pro 的 RL 后训练成本约 260 万美元,Flash 约 90 万美元。Pro 的成本中,Rollout 和参数训练各约占四成以上,Grader 也占到 12.7%;Flash 的 Grader 成本比例达到 14.2%。
  • 奖励不再只看测试是否通过。 小米引入分组奖励合成和分组优势重分配,让模型在通过测试后继续比较代码质量、修改范围、边界处理和工程副作用,并对明显冗长的成功轨迹施加长度惩罚。
  • 专门防范 Reward Hacking。 环境会清理日志、缓存和残留修复,限制网络访问,并用 Hack Agent 主动寻找作弊路径。正式训练中,确认存在奖励投机的轨迹会被清零,相关比例被控制在 2% 以下。
  • 基础设施成为关键瓶颈。 小米采用持久化 Host Actor、分布式重数据存储、动态 Sample Mixer 和可卸载 KV Cache,以承受大规模并发 Rollout。实验还发现,MoE Router 在 RL 中容易快速漂移,因此最终冻结 Router 参数。

意义与局限

MiMo-V2.6 的价值不只是公布了模型规模,而是把 Agent RL 展示成一项系统工程。训练效果取决于任务是否足够丰富、评分器是否能识别“看似成功但质量较差”的解法,以及基础设施能否处理长轨迹、异构任务和故障恢复。多 Harness 训练后,模型在训练期间未见过的 Codex、Claude Code 和 mini-swe-agent 上也出现提升,说明部分能力并非完全依赖单一工具链。

不过,这仍不是完全自主的递归自我改进。模型依然在人工设计的环境、奖励和验证规则中学习,评分器本身也成为新的计算成本与可靠性风险。小米报告称,经过 30 次更新后,模型在未参与训练的 DeepSWE v1.1 上取得明显提升,但如何进一步降低成本、避免奖励投机,并验证能力能否稳定迁移到真实生产环境,仍是规模化 Agent RL 需要解决的问题。

来源:InfoQ 中文

评论

正在确认登录状态……

正在加载评论……

相关文章