記事一覧へ戻る
強化学習

DAPD:方策蒸留における「特権情報の錯覚」をどう抑えるか

読了目安 3 分

導入

言語モデルのポストトレーニングでは、オンポリシー自己蒸留(OPSD)が広く使われるようになっています。より強い教師、あるいは追加情報を与えられた参照方策から学ばせることで、学生モデルの性能を高めるという考え方です。しかし DAPD の論文は、この設計に潜む落とし穴を指摘します。教師が訓練時に見ている情報を、学生が推論時には見られない場合、学生は再現不能な判断規則まで学んでしまう可能性があります。

著者らはこの現象を privilege illusion(特権情報の錯覚) と呼びます。学生は、あたかも訓練時の特権情報が推論時にも残っているかのように振る舞いますが、実際にはその情報は存在しません。その結果、蒸留が性能向上ではなく劣化につながることがあります。

核心ポイント

  • 原因は情報の非対称性:従来の OPSD では、教師や参照方策が特権情報によって強化される一方、学生は推論時の通常コンテキストだけで行動します。DAPD はこのズレを失敗の根本原因とみなします。
  • DAPD は情報条件をそろえて蒸留する:Dual-Anchored Policy Distillation は、特権情報に依存した挙動をそのまま転写するのではなく、比較可能な情報条件のもとで方策を整合させることを目指します。
  • Dual-Path Anchoring(DPA):自己条件付けのブリッジを導入し、参照挙動と rollout 挙動を、情報が対応する二つの経路に沿って合わせます。これにより、推論時の学生が再現できない挙動の混入を抑えます。
  • Dual-Source Anchoring(DSA):参照から rollout だけでなく、rollout から参照への方向にも同じ考えを適用します。正しさの監督を保ちながら、特権的な参照ガイダンスへの依存を弱める狙いです。
  • スケールをまたいだ改善:論文では、Qwen3-4B において OPSD を平均 2.00 ポイント上回ったと報告されています。また、4B で +2.69、32B で +2.78 の改善も示されています。

意義と影響

DAPD の重要性は、蒸留を単なる出力分布の模倣としてではなく、「どの情報条件でその出力が生まれたか」まで含めて捉えた点にあります。教師の回答が優れていても、その判断が学生の推論時には利用できない情報に依存していれば、模倣は有効な学習信号とは限りません。

これは、強化学習、rollout、自己改善、合成データを組み合わせる最近の LLM 後処理パイプラインにとって重要な示唆です。教師を強くする追加情報は、同時に教師と学生の条件差を広げる可能性があります。DAPD の二重アンカリングは、その差を制御し、学生が実際に使える条件の範囲で学習させる試みだと言えます。

一方で、今後の焦点も明確です。教師と学生が同じ方策の異なる情報条件ではなく、異なるアーキテクチャやモデルファミリーである場合にも同じ効果が得られるのか。Hugging Face 上の議論でもこの点が問われ、著者は現在の DAPD はオンポリシー自己蒸留を主対象としていると説明しました。また、OLMo での予備実験では Qwen と似た傾向が見られたとも述べています。

総じて DAPD は、後処理学習における蒸留の前提を見直す研究です。強い教師を用意するだけでは不十分であり、学生が実際に持つ情報との整合性を保つことが、信頼できる蒸留には不可欠になります。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
SAF-OPD:強化学習とオンポリシー蒸留を安定に組み合わせる
強化学習
cctest.ai
強化学習

SAF-OPD:強化学習とオンポリシー蒸留を安定に組み合わせる

SAF-OPD は、検証可能な報酬による強化学習とオンポリシー蒸留を固定係数で混ぜると、探索が失われる可能性がある点に注目する。教師信号の大きさと投入タイミングを調整し、より安定した後学習を目指す手法だ。

続きを読む
CCTest · Blog
長い CoT の強化学習では、すべての Token に同じ信用を与えるべきではない
強化学習
cctest.ai
強化学習

長い CoT の強化学習では、すべての Token に同じ信用を与えるべきではない

南京大学の論文は、RLVR における token 単位の信用割り当てを再検討している。大きな尤度変化は、推論上の重要性ではなく、表層表現の置き換えやすさを反映している場合が多いという。

続きを読む