記事一覧へ戻る
強化学習

オンライン方策蒸留のスケーリング:小さな教師で大規模モデルを導く

読了目安 3 分

導入

強化学習によって大規模言語モデルの推論能力を引き出せても、その能力が別のモデルへ自動的に移るとは限りません。教師と学生の規模、初期能力、そして監督信号の与え方が結果を左右します。論文「Scaling Properties of Same-Family On-Policy Distillation」は、この問題をオンライン方策蒸留(OPD)の観点から調べています。OPDでは、学生が自分で応答を生成し、その出力に対して教師方策から token 単位の reverse KL 監督を受けます。

著者らは同一モデル系列を使い、弱い教師から強い学生への移転、同じ基盤モデル間の移転、強い教師から弱い学生への移転を比較しました。インタラクティブなプロジェクトページには、学習軌跡の再生やピーク性能のグリッドが用意されています。また、Qwen2.5 の 0.5B から 14B までを含む 311 個のチェックポイントも公開されています。

主な発見

  • 初期段階には規則的な有効移転領域がある。 研究では、学生方策と初期方策の reverse KL divergence の平方根を、学習に伴う方策の変化量として測定しました。初期段階では、検証用 gold score がこの変化量に対しておおむね線形に上昇します。一定範囲の更新であれば、性能向上の軌跡を比較的予測しやすいことを示します。
  • 弱い教師でも強い学生を生み出せる。 観測されたすべての弱教師・強学生の組み合わせで、学生のピーク gold score は教師自身のスコアを上回りました。教師は学生の能力上限ではなく、有用な行動へ向かう方向を与える存在として働く可能性があります。
  • 教師の大型化には限界がある。 教師を大きくすると学生のピークスコアは改善しますが、その効果は教師規模が学生規模に近づくあたりまでです。それ以上のパラメータ追加が、同じ割合の利益を保証するわけではありません。
  • 教師のスコアだけでは価値を測れない。 gold score が同程度の教師を比べると、より小さい教師のほうが効率よく移転できるケースがありました。評価スコアに加えて、教師の方策構造と学生との規模関係を見る必要があります。
  • 複数の訓練条件も検討している。 学生・教師の規模や教師スコアに対するピーク性能と移転速度の変化をべき乗則で近似し、OPD の変種、弱から強へのブートストラップ、オンライン監督の比率も分析しています。

意義と注意点

この研究は、蒸留を単なるモデル圧縮ではなく、教師資源をどう配分するかというスケーリング問題として捉え直します。常に最大の教師を選ぶのではなく、教師と学生の規模、教師の能力、そして監督信号の効率を組み合わせて設計する必要があります。小型の RL 専門モデルを先に作り、それを使って大きな学生を導くという構成は、訓練コストを抑える選択肢になり得ます。

一方、結果は特定のモデル系列と OPD 設定に基づいています。異なるアーキテクチャ、タスク、報酬設計、モデル系列間の移転でも同じべき乗則が成立するかは、今後の検証課題です。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
LLM強化学習の学習・推論ミスマッチをCISで補正
強化学習
cctest.ai
強化学習

LLM強化学習の学習・推論ミスマッチをCISで補正

RLVRでは、ロールアウトを生成する推論エンジンと勾配を計算する学習エンジンが、同じトークンに異なる確率を割り当てることがあります。新手法CISは、トークンの信頼度を考慮した重要度サンプリングで、この差による更新誤差を抑えます。

続きを読む