記事一覧へ戻る
強化学習

オンポリシー蒸留は本当に蒸留しているのか?教師なし適応への転換

読了目安 3 分

導入

オンポリシー蒸留(On-Policy Distillation、OPD)は、強化学習と教師あり学習の中間に位置する手法として注目されている。学生モデルがまず自分で軌跡を生成し、教師モデルが各トークンに対して学習信号を与えるため、結果レベルの疎な報酬しか使わない RLVR よりも、密度の高い指導ができると考えられてきた。

しかし、この方法には分布のずれがある。軌跡を生成するのは教師ではなく学生なので、教師は自分の方策から外れたデータを評価することになる。その評価はどれほど信頼できるのか。また、学生の改善は教師の知識によるものなのか、それとも目的関数が生む単純な効果なのか。論文「Does On-Policy Distillation Really Distill?」は、この疑問を訓練中の信号と更新位置から検証している。

主な発見

  • 教師信号には大きなノイズがある。 OPD 中の教師による監督を定量的に調べた結果、ノイズは無視できない規模で存在し、教師の規模が大きくなるほど増える傾向が報告された。
  • 学生はノイズにあまり左右されない。 ノイズを残した場合と除去した場合で、最終的な学生方策は近い性能に収束した。教師の細かな判断が改善の主因だという見方に疑問を投げかける結果である。
  • 更新は低確率トークンに集中する。 学習の中心は学生の log 確率が低いトークンにあり、広範な模倣というより、出現確率の低い分布の裾を抑える動きに見える。
  • 教師なしでも近い効果が得られる。 教師のアドバンテージを使わず、単一の固定された負のアドバンテージを使っても、同程度の性能に達したとされる。

蒸留から自己適応へ

この分析をもとに、研究者は On-Policy Self-Adaptation(OPSA)を提案した。OPSA は教師モデルを参照せず、学生自身の不確実性、すなわちトークン分布のエントロピーから更新の強さを決める。エントロピーが高い位置には強い学習信号を与え、裾のトークンを抑えながら、確率の高いヘッド側へ確率質量をより均等に再配分する。

Qwen3-1.7B を基準にした報告では、AIME24 の Avg@32 が 35.41 ポイント向上し、相対的には 263% の増加となった。また、報告された三つのベンチマークすべてで Pass@32 が二倍を超えた。これらの結果は、OPD の利益の一部が教師の知識移転ではなく、低確率出力の構造的な修正から得られるという解釈を支持している。

意義と注意点

この研究は、教師モデルが常に不要だと断定しているわけではない。むしろ、OPD に含まれる「知識の移転」と「トークン更新がもたらす最適化上の偏り」を分けて考える必要性を示している。もし裾のトークンを抑えることが主要なメカニズムなら、高価な教師推論や複雑なアドバンテージ推定を省ける場合がある。モデル自身の不確実性が、より安価な学習信号になり得るからだ。

一方、今回利用できる素材は論文の要約とページ情報が中心である。ノイズの定義、詳細なアブレーション、タスク範囲、訓練の安定性、他手法との完全な比較については、論文本文で確認する必要がある。したがって OPSA は有望な仮説と訓練方向として捉えるべきであり、教師蒸留の価値を全面的に否定する結論ではない。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
J-Zero:挑戦者・解答者・判定者を共進化させる仕組み
強化学習
cctest.ai
強化学習

J-Zero:挑戦者・解答者・判定者を共進化させる仕組み

KAIST AI が提案する J-Zero は、人手によるラベル付きデータに依存せず、課題生成、問題解答、評価の3役を同時に適応させる枠組みです。検証可能な課題だけでなく、評価が難しい課題にも対応することを目指します。

続きを読む
CCTest · Blog
正解ラベルなしで推論を改善するTTPO、合意と不一致を使い分けるテスト時学習
強化学習
cctest.ai
強化学習

正解ラベルなしで推論を改善するTTPO、合意と不一致を使い分けるテスト時学習

TTPOは、多数決による疑似ラベルをそのまま正解扱いせず、同意する推論と反対する推論に異なる学習処理を適用する。これにより、誤った多数決が教師信号全体を汚染するリスクを抑える。

続きを読む