記事一覧へ戻る
強化学習

進化戦略はなぜGRPOより多様な推論経路を保てるのか

読了目安 3 分

導入

大規模言語モデルの推論能力を評価するとき、Pass@1とPass@Kは異なる側面を表す。Pass@1は最初の回答が正しいかを測る一方、Pass@Kは複数回サンプリングした中に少なくとも一つ正解があるかを評価する。GRPOは単発の正答率を高めるうえで有効だが、高い報酬を得た経路に学習が集中すると、モデルが試せる推論方法の幅が狭くなる可能性がある。

論文「Understanding Evolution Strategies for LLM Reasoning」は、進化戦略(Evolution Strategies、ES)をGRPOと比較し、ESが単なる省メモリ版にすぎないのか、それとも独自の最適化原理を持つのかを調べた。結論は後者に近い。

主な発見

  • ESは推論のカバレッジを広げる。 理論分析と実験の双方から、ESは複数の解答経路を保ちやすいことが示された。繰り返しサンプリングする設定では、この幅広さが高いPass@Kにつながる。
  • 検証器を考慮した多様性が重要になる。 研究では、ESの集団を検証器に通した後のJensen-Shannon多様性を分析している。この指標が高いほど、Pass@Kが高くなる傾向が理論的に示された。単なる文章表現の違いではなく、検証によって価値が認められ得る解答候補の多様性が焦点となる。
  • GRPOではエントロピー崩壊が起こり得る。 GRPOは最適化の過程で出力分布を集中させる傾向を示した。これは有力な解答パターンを素早く選ぶ助けになる一方、別の解法を探索する余地を減らす可能性がある。ESはPass@1を改善しつつ、Pass@KでもGRPOを上回った。
  • 両者は組み合わせられる。 研究は、まずGRPO、続いてESを適用する順次学習戦略を提案した。単発の正答率を高めるGRPOと、解答範囲を広げるESの長所を両立させる狙いである。
  • 大きなパラメータ変化は全面的な機能変化を意味しない。 ESではモデル全体に大きなパラメータドリフトが生じても、性能向上への寄与は一部の大きな更新に集中していた。この機能的スパース性は、広範なパラメータ移動が必ずしも広範な行動変化を意味しないことを示す。保留タスクの評価でも、ドリフトが必ずしも壊滅的忘却につながるわけではなかった。
  • モデル規模に応じた集団設計が必要になる。 より大きなモデルでは、ESの集団サイズを小さくする必要がある可能性が示された。小規模モデルの設定をそのまま流用できるとは限らない。

意義と影響

この研究は、ESをGRPOの低メモリ代替手段という位置づけから引き上げる。ESの特徴は、複数の有望な推論方向を残しながら最適化できる点にある。数学やコードなど検証可能な課題では、最初の回答が正しいことだけでなく、複数回の試行で正解へ到達できることもシステムの実用性能を左右する。

また、推論後学習をPass@1だけで判断する危険性も示された。最も確率の高い回答が改善していても、代替経路が失われていれば推論の境界は縮小しているかもしれない。今後はPass@K、出力エントロピー、検証器を通した多様性を併せて監視し、タスクが求める探索性と安定性に応じてGRPOとESを使い分けることが重要になる。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
正解ラベルなしで推論を改善するTTPO、合意と不一致を使い分けるテスト時学習
強化学習
cctest.ai
強化学習

正解ラベルなしで推論を改善するTTPO、合意と不一致を使い分けるテスト時学習

TTPOは、多数決による疑似ラベルをそのまま正解扱いせず、同意する推論と反対する推論に異なる学習処理を適用する。これにより、誤った多数決が教師信号全体を汚染するリスクを抑える。

続きを読む
CCTest · Blog
Co-RL、多様なAI群の協調で教師なし推論を実現
強化学習
cctest.ai
強化学習

Co-RL、多様なAI群の協調で教師なし推論を実現

Co-RLは、パラメータを共有しない複数モデルが互いのフィードバックから報酬を得て学習する強化学習の枠組みです。正解ラベルなしでも、テキストとマルチモーダルの推論性能を高め、自己評価型RLの崩壊リスクを抑えます。

続きを読む