Xiaomi MiMo-V2.6が示す大規模Agentic RLの実装路線
導入
大規模言語モデルの後学習は、単発の回答品質を高める段階から、ツールを使いながら長いタスクを完遂させる段階へ移りつつあります。XiaomiのMiMoチームが公開したMiMo-V2.6の技術報告は、Agentic RLを拡張するにはモデルの更新計算だけでなく、Rollout、タスク環境、Agent Harness、Graderの計算資源を同時に増やす必要があることを示しています。
報告の主要ポイント
- 1ステップの規模が大きい。 MiMo-V2.6-Proは総パラメータ1.02T、活性化42B、Flashは総パラメータ310B、活性化15Bです。両モデルともMoEを採用しています。1回のRLステップで1568個のPromptを使い、各Promptから16本の軌跡を生成するため、約27億から37億トークンが発生します。コンテキスト長は最大100万トークンに達します。
- 評価にも大きな費用がかかる。 RL後学習費用はProが約260万ドル、Flashが約90万ドルとされています。ProではRolloutとTrainingがそれぞれ4割超を占め、Graderも12.7%に達します。FlashではGraderの比率が14.2%でした。
- テスト通過だけでは不十分。 同じテストに通っても、変更範囲、例外処理、副作用、保守性には差があります。MiMo-V2.6は、同一タスクの複数解を比較するGroupwise Reward SynthesisとGroupwise Advantage Redistributionを使い、より正確で小さな修正に強い信号を与えます。
- 報酬ハッキングを多層で抑える。 環境からログやキャッシュなどを削除し、上流の修正へのアクセスを制限します。さらにHack Agentが抜け道を探し、確認された不正利用の軌跡は報酬をゼロにします。正式学習での該当割合は2%未満に抑えられたと報告されています。
- インフラが性能を左右する。 永続Actor、分散ストレージ、動的なSample Mixer、KV Cacheの退避などを導入し、大量の長時間Rolloutに対応しました。またRL中にMoE Routerを更新すると専門家の負荷が急速に偏ったため、最終的にRouterを凍結しています。
意義と限界
MiMo-V2.6が示すのは、Agentic RLが単なる大規模な学習ジョブではないという点です。タスク設計、環境の隔離、軌跡のスケジューリング、評価器の品質、障害復旧、モデル更新を一体として運用する必要があります。複数の小型Harnessで学習した結果、訓練中に見ていないCodex、Claude Code、mini-swe-agentでも改善したことは、能力の一部が特定のツール構成から独立している可能性を示します。
一方、これは完全な自律的再帰自己改善ではありません。学習の場、報酬、検証規則は依然として人間が設計しており、Grader自体もコストと誤判定のリスクを持ちます。30回の更新後に未学習のDeepSWE v1.1で改善が報告されたものの、実運用への安定した転移、評価費用の削減、モデルの高度化に伴う報酬ハッキングの抑制は、今後の課題です。
出典:InfoQ 中文
コメント
ログイン状態を確認中…
コメントを読み込み中…