記事一覧へ戻る
強化学習

Xiaomi MiMo-V2.6が示す大規模Agentic RLの実装路線

読了目安 3 分

導入

大規模言語モデルの後学習は、単発の回答品質を高める段階から、ツールを使いながら長いタスクを完遂させる段階へ移りつつあります。XiaomiのMiMoチームが公開したMiMo-V2.6の技術報告は、Agentic RLを拡張するにはモデルの更新計算だけでなく、Rollout、タスク環境、Agent Harness、Graderの計算資源を同時に増やす必要があることを示しています。

報告の主要ポイント

  • 1ステップの規模が大きい。 MiMo-V2.6-Proは総パラメータ1.02T、活性化42B、Flashは総パラメータ310B、活性化15Bです。両モデルともMoEを採用しています。1回のRLステップで1568個のPromptを使い、各Promptから16本の軌跡を生成するため、約27億から37億トークンが発生します。コンテキスト長は最大100万トークンに達します。
  • 評価にも大きな費用がかかる。 RL後学習費用はProが約260万ドル、Flashが約90万ドルとされています。ProではRolloutとTrainingがそれぞれ4割超を占め、Graderも12.7%に達します。FlashではGraderの比率が14.2%でした。
  • テスト通過だけでは不十分。 同じテストに通っても、変更範囲、例外処理、副作用、保守性には差があります。MiMo-V2.6は、同一タスクの複数解を比較するGroupwise Reward SynthesisとGroupwise Advantage Redistributionを使い、より正確で小さな修正に強い信号を与えます。
  • 報酬ハッキングを多層で抑える。 環境からログやキャッシュなどを削除し、上流の修正へのアクセスを制限します。さらにHack Agentが抜け道を探し、確認された不正利用の軌跡は報酬をゼロにします。正式学習での該当割合は2%未満に抑えられたと報告されています。
  • インフラが性能を左右する。 永続Actor、分散ストレージ、動的なSample Mixer、KV Cacheの退避などを導入し、大量の長時間Rolloutに対応しました。またRL中にMoE Routerを更新すると専門家の負荷が急速に偏ったため、最終的にRouterを凍結しています。

意義と限界

MiMo-V2.6が示すのは、Agentic RLが単なる大規模な学習ジョブではないという点です。タスク設計、環境の隔離、軌跡のスケジューリング、評価器の品質、障害復旧、モデル更新を一体として運用する必要があります。複数の小型Harnessで学習した結果、訓練中に見ていないCodex、Claude Code、mini-swe-agentでも改善したことは、能力の一部が特定のツール構成から独立している可能性を示します。

一方、これは完全な自律的再帰自己改善ではありません。学習の場、報酬、検証規則は依然として人間が設計しており、Grader自体もコストと誤判定のリスクを持ちます。30回の更新後に未学習のDeepSWE v1.1で改善が報告されたものの、実運用への安定した転移、評価費用の削減、モデルの高度化に伴う報酬ハッキングの抑制は、今後の課題です。

出典:InfoQ 中文

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
SRD、事後の経験をRLVRの事前予測へ蒸留
強化学習
cctest.ai
強化学習

SRD、事後の経験をRLVRの事前予測へ蒸留

Self-Retrospection Distillation(SRD)は、エージェントがタスクを終えた後の軌跡を使い、行動前に予測すべき落とし穴を学習させる手法です。グループ内の報酬が均一になりやすい強化学習でも、軌跡に残る情報を学習信号として活用します。

続きを読む
CCTest · Blog
推論モデルはなぜ自己学習で劣化するのか――R-Questが問題生成を見直す
強化学習
cctest.ai
強化学習

推論モデルはなぜ自己学習で劣化するのか――R-Questが問題生成を見直す

推論モデルが自ら作る問題は学習データになり得る一方、無効な問題や数学的に同じ問題の反復が性能低下を招く。R-Questは有効性と新規性のフィードバックでこの循環を修正する。

続きを読む