記事一覧へ戻る
強化学習

Muon はいつエージェント強化学習に効くのか:鍵は最適化器だけではない

読了目安 3 分

導入

Muon は大規模事前学習で AdamW と競合し得る最適化器として注目されている。しかし、強化学習による後段学習、特に長い行動系列と疎な報酬を扱うエージェント RL で本当に有効なのかは明確ではなかった。この論文「When Does Muon Help Agentic Reinforcement Learning?」は、その問いに対して条件付きの答えを提示している。

研究では、ALFWorld を実験環境とし、Qwen2.5-0.5B-Instruct を用いて vanilla Muon と AdamW を比較している。重要なのは、Muon を万能な AdamW 代替として扱っていない点だ。著者らは、方策最適化器、優位性推定器、学習率を一体として考える必要があると示唆している。

主なポイント

  • GiGPO では大きな改善が観測された。 Group-in-Group Policy Optimization の設定で、Muon を隠れ層の重み行列のみに適用すると、最終ウィンドウの検証成功率は AdamW の 0.290 から 0.546 へ上昇した。相対的には 88% の改善である。高い学習率の AdamW 対照では更新後の成功が維持されなかったため、単に AdamW の学習率を上げればよいという結果ではない。

  • 優位性推定器によって効果は変わる。 学習率 3e-5 では、Muon は GRPO の成功率を 0.161 から 0.268 に改善した。一方、GraphGPO では後半の性能が飽和に近づくため、終盤の差は小さくなる。これは、最適化器の比較を信用割り当ての仕組みから切り離せないことを示している。

  • 学習率も結論を左右する。 1e-5 の設定では、GraphGPO と Muon の組み合わせが成功率 0.901 に到達し、正規化検証 AUC も 0.399 から 0.556 に向上した。また、成功率 0.5 と 0.75 の閾値に到達するまでの更新回数が、それぞれ 30 回、60 回早くなった。

意義と影響

この研究の意義は、エージェント RL の後段学習において、最適化器の選択を再び重要な設計要素として位置づけた点にある。近年の議論は報酬設計、サンプリング、優位性推定に集中しがちだが、本論文は最適化器も学習安定性やサンプル効率に影響し得ることを示している。

ただし、結論は慎重に読むべきである。実験は単一シードの比較であり、主に ALFWorld と Qwen2.5-0.5B-Instruct の組み合わせに基づいている。著者らも、多シード検証とタスク横断の評価を今後の課題として明記している。

実務的には、Muon は「入れ替えれば必ず良くなる」部品ではなく、適切な優位性推定器と学習率と組み合わせたときに価値を発揮する可能性がある、という読み方が妥当だ。エージェント RL の後段学習を改善したい研究者にとって、最適化器・推定器・学習率を同時に調整する必要性を示す結果と言える。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
CPO:エントロピーを超える正しさ認識型 RLVR の提案
強化学習
cctest.ai
強化学習

CPO:エントロピーを超える正しさ認識型 RLVR の提案

この論文は、RLVR におけるエントロピー中心の advantage shaping の限界を指摘し、Contrastive Policy Optimization(CPO)を提案している。参照誘導生成と通常生成の token レベルの分布差を使い、より正しさに近い学習信号を作る点が特徴だ。

続きを読む
CCTest · Blog
OPD²:推論チューニングで増えた能力だけを蒸留する新手法
強化学習
cctest.ai
強化学習

OPD²:推論チューニングで増えた能力だけを蒸留する新手法

NAVER AI Lab の OPD² は、教師モデルの出力分布をそのまま模倣するのではなく、推論チューニング後の教師とベースモデルの差分を蒸留信号として使う。論文では、数学・科学・コード推論で従来の on-policy distillation を上回ると報告されている。

続きを読む