記事一覧へ戻る
大規模言語モデル

SPOT:推論モデル蒸留を「結果で校正」する新手法

読了目安 3 分

導入

On-Policy Distillation(OPD)は、推論能力を持つ大規模言語モデルを小さな学生モデルへ移すための有力な方法です。学生モデルが自分で生成した軌跡に対して、より強い教師モデルが密な監督信号を与えるため、実際の生成分布に近い形で学習できます。

しかし、標準的な OPD には課題があります。reverse-KL に基づく訓練では、教師モデルが局所的に高い確率を与えた次トークンへ学生モデルが強く寄せられ、他にも妥当な継続候補がある場合に、それらを十分に保持できないことがあります。推論タスクでは、局所的に最も高確率な選択が必ずしも最終的な正解につながるとは限りません。

論文 SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation は、この問題に対し、「どこを調べるか」と「何を蒸留するか」を分けずに扱う枠組みを提案しています。

主要ポイント

  • OPD の弱点:教師の密な監督は有効だが、標準的な反向 KL 学習では、複数の妥当な推論経路を狭めてしまう可能性がある。
  • エントロピーだけでは判断できない:教師エントロピーが高くても、不確実性が少数の有力候補に集中しているのか、長いテールに分散しているのかは分からない。また、学生モデルがすでにそれらの候補を表現できているかも分からない。
  • 三段階の設計:SPOT は acquisition、exploration、exploitation の流れで構成される。
  • 疎なプロービング:acquisition では、正規化された教師エントロピー、少数 top-k 候補が捉える確率質量、学生と教師の分布差を組み合わせ、限られた予算を情報量の高い位置に割り当てる。
  • 結果で校正する蒸留目標:exploration では、教師が提案した候補を起点に学生モデルが続きを生成し、それを verifier が評価する。exploitation では、その結果を使って、教師分布に anchored しつつ下流結果の良い候補を重視する KL 正則化付きターゲットを作る。

意義と影響

SPOT の重要性は、蒸留を単なる「教師の局所模倣」から「将来の結果を考慮した模倣」へ進める点にあります。推論では、ある時点のトークン確率だけでは最終的な成功を十分に予測できません。SPOT は、計算量を抑えるためにすべての位置を深く調べるのではなく、価値の高い分岐点だけを選んで未来の結果を確認します。

報告された実験では、3 種類の学生モデル規模と複数の推論ベンチマークにおいて、SPOT は OPD に対して macro Avg@8/Pass@8 を 0.47–1.48/4.55–5.28 ポイント改善し、EOPD に対しても 0.29–0.68/2.49–3.19 ポイント改善しています。

これは、推論モデルの蒸留では、教師確率をそのまま写すだけでなく、候補が実際に良い解へ進むかを見極めることが重要であることを示しています。検証器のコストをどう管理するかは今後の実用上の焦点ですが、SPOT は小型モデルに推論能力を圧縮するための有望な方向性を示しています。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
解釈可能性は性能の代償ではない?Steerling-8B が示す透明な言語モデルの設計
大規模言語モデル
cctest.ai
大規模言語モデル

解釈可能性は性能の代償ではない?Steerling-8B が示す透明な言語モデルの設計

この技術レポートは、言語モデルの解釈可能性を学習後に付け足すのではなく、学習プロセスそのものに組み込むべきだと主張している。Steerling-8B は生成結果を入力、概念、学習データへ結び付ける試みとして紹介されている。

続きを読む
CCTest · Blog
外部監督なしのオンポリシー自己蒸留:モデル自身の合意から学ぶ U-OPSD
大規模言語モデル
cctest.ai
大規模言語モデル

外部監督なしのオンポリシー自己蒸留:モデル自身の合意から学ぶ U-OPSD

本論文は、モデル自身の複数生成結果から擬似解を作り、それとの不一致を学習信号にする U-OPSD を提案する。真値ラベルや強い教師モデルを使わずに、数学推論ベンチマークで基盤モデルを安定して上回った点が特徴だ。

続きを読む
CCTest · Blog
Skaling Law:モデル規模とデータ量を再び結び直す新しいスケーリング則
大規模言語モデル
cctest.ai
大規模言語モデル

Skaling Law:モデル規模とデータ量を再び結び直す新しいスケーリング則

Skaling law は、モデル容量と学習データの相互作用を単一の指数で表し、従来のニューラルスケーリング則が極端な条件で外しやすい問題を補正しようとする研究です。

続きを読む