記事一覧へ戻る
強化学習

RLVRは推論の中身ではなく、入口で解法の多様性を狭める

読了目安 3 分

導入

検証可能な報酬を使う強化学習、いわゆるRLVRは、1回のサンプルで正解する確率を高める有力な手法だ。一方で、モデルが選ぶ推論経路の幅を狭める可能性がある。似た経路ばかりを繰り返すようになれば、テスト時にサンプル数を増やしても、新しい解法を得る効果は小さくなる。

今回の研究は、この縮小が推論のどこで起きるのかを調べた。モデルが有効な解法群にアクセスできなくなったのか、それともその解法に入った後の計算に失敗するのか。Countdown課題を使った分析では、主な問題は後段の実行ではなく、最初の計算への入口にあると結論づけている。

主な発見

  • 解法カバレッジが縮小する。 解法を最初のオペランドと演算子で定義される入口のグループに分け、Qwen2.5-3BのPPOとQwen2.5-3B-InstructのGRPOを比較したところ、カバレッジは最大67%低下した。すべてのチェックポイントで解けた問題でも、カバーされる解法群は半分程度まで減少した。
  • 変化は推論の初期に集中する。 最初の算術操作より前のトークン尤度の変化は、後段の推論中より11~16倍大きかった。RLVRは計算能力全体よりも、どの経路を最初に選ぶかを強く変えている。
  • 後続の実行能力は残る。 モデルがあまり選ばなかった入口の接頭辞だけを与えると、PPOでは低アクセスの解法群の完了率が0.018から0.212に上昇した。入口に誘導されれば、モデルはその後の手順を実行できることを示している。
  • 入口を狙った介入が有効だ。 一般的なプロンプトでは多様性を十分に戻せなかったが、後段レイヤーのパラメータを初期チェックポイントと補間すると、pass@1を維持したまま解法カバレッジが37%向上した。
  • 必然的な副作用ではない。 6つの数学ベンチマークと7B・14Bモデルで初期ステップのエントロピー低下が確認された一方、SFTベースラインは2倍以上のカバレッジを維持した。SFT、DPO、RLVRを段階的に行う構成でも、初期エントロピーは保たれた。

意義と今後

この研究は、「RLVRは探索を減らす」という問題を、入口でのアクセス障害として具体化した。モデルが代替解法を忘れたとは限らない。学習によって、成功しやすい少数の開始点へ強く偏り、別の経路を始める確率が下がっているのである。

この点はテスト時スケーリングに直結する。推論の初手で分岐が潰れていれば、サンプル数や計算予算を増やしても、似た軌跡の反復になりやすい。今後はpass@1だけでなく、初期ステップのエントロピーや入口グループのカバレッジを訓練・評価に組み込む必要があるだろう。

ただし、実験の中心はCountdownと数学ベンチマークである。コード生成、自由形式の推論、マルチモーダル課題でも同じ現象が起きるかは、今後の検証に委ねられる。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
オンポリシー蒸留は本当に蒸留しているのか?教師なし適応への転換
強化学習
cctest.ai
強化学習

オンポリシー蒸留は本当に蒸留しているのか?教師なし適応への転換

新たな分析は、オンポリシー蒸留の性能向上が教師モデルの知識移転よりも、低確率トークンの抑制から生じている可能性を示した。この知見をもとに、教師を使わない On-Policy Self-Adaptation が提案されている。

続きを読む
CCTest · Blog
J-Zero:挑戦者・解答者・判定者を共進化させる仕組み
強化学習
cctest.ai
強化学習

J-Zero:挑戦者・解答者・判定者を共進化させる仕組み

KAIST AI が提案する J-Zero は、人手によるラベル付きデータに依存せず、課題生成、問題解答、評価の3役を同時に適応させる枠組みです。検証可能な課題だけでなく、評価が難しい課題にも対応することを目指します。

続きを読む