記事一覧へ戻る
強化学習

CriPO:自己蒸留で Rubric ベースRLの失われた信号を補う

読了目安 3 分

導入

オープンエンドなタスクで大規模言語モデルを改善するには、単一の報酬だけでは評価が粗くなりがちです。そこで注目されているのが Rubric-based RL です。回答を複数の評価基準に分解し、正確性や網羅性、専門領域で必要な条件などを個別に扱うことで、より細かな学習信号を与えようとします。

しかし、この論文は「評価基準を増やせば、その分だけ学習できる」とは限らないと指摘します。ある基準を満たす rollout が一つもなければ、その基準は最適化信号を持ちません。さらに、基準を満たす回答が存在していても、最終的なスカラー報酬の集約によって advantage が非正になり、その有用な振る舞いが強化されない場合があります。著者らは前者を Unexplored Criteria、後者を Suppressed Criteria と呼び、両者を扱うために Criterion-Distilled Policy Optimization、略して CriPO を提案しています。

核心ポイント

  • 未探索基準は信号を生まない:どのサンプル回答も特定の基準を満たさない場合、通常のRLではその行動を強化する手がかりがありません。
  • 外部ガイダンスにはずれがある:既存手法の一部は rollout 時に rubric 情報を外部から与え、探索を助けます。しかし推論時に同じガイダンスがない場合、訓練時と推論時の条件がずれ、自回帰生成で誤差が蓄積しやすくなります。
  • 抑制された基準は見落とされやすい:ある回答が一部の基準を満たしていても、全体報酬が低ければ、その基準に関係する token まで弱められる可能性があります。論文では、訓練を通じて57%超のサンプルにこの問題が見られ、平均で1.8個の抑制基準が存在すると報告しています。
  • CriPO は自己蒸留で補正する:未探索基準には criterion-injection self-teacher を用い、局所的な forward-KL 損失で欠けた振る舞いを方策へ注入します。抑制基準には反実仮想的な self-teacher を使い、負の advantage を持つ rollout 内の関連 token を特定して、token レベルの advantage を正に修正します。

意義と影響

CriPO の重要性は、rubric を推論時の外部補助として使うのではなく、訓練中に基準に沿った振る舞いを方策へ内在化しようとする点にあります。LLM の生成では初期の小さなずれが後続 token に波及するため、訓練と推論の条件差を減らすことは実用上も大きな意味を持ちます。

論文によれば、CriPO は医学および科学ベンチマークで既存の Rubric-based RL 手法を一貫して上回り、約2分の1の最適化ステップで同等の性能に到達しました。これは、評価基準そのものを設計するだけでなく、その基準ごとの信号をどのようにモデルへ届けるかが重要であることを示しています。

より広く見ると、この研究はスカラー報酬集約の限界を示しています。多基準の rubric があっても、各基準の局所的な証拠が学習過程で保存されなければ、多基準学習にはなりません。CriPO はその失われがちな信号を、自己蒸留と token レベル補正で回収する試みだと言えます。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
長い CoT の強化学習では、すべての Token に同じ信用を与えるべきではない
強化学習
cctest.ai
強化学習

長い CoT の強化学習では、すべての Token に同じ信用を与えるべきではない

南京大学の論文は、RLVR における token 単位の信用割り当てを再検討している。大きな尤度変化は、推論上の重要性ではなく、表層表現の置き換えやすさを反映している場合が多いという。

続きを読む
CCTest · Blog
SAF-OPD:強化学習とオンポリシー蒸留を安定に組み合わせる
強化学習
cctest.ai
強化学習

SAF-OPD:強化学習とオンポリシー蒸留を安定に組み合わせる

SAF-OPD は、検証可能な報酬による強化学習とオンポリシー蒸留を固定係数で混ぜると、探索が失われる可能性がある点に注目する。教師信号の大きさと投入タイミングを調整し、より安定した後学習を目指す手法だ。

続きを読む
CCTest · Blog
RLSVR:オープンエンドなLLMタスクを自己検証可能なRL環境へ
強化学習
cctest.ai
強化学習

RLSVR:オープンエンドなLLMタスクを自己検証可能なRL環境へ

この論文は、数学やコードでは有効な RLVR を、要約や創作のような正解が一つに定まらないタスクへ拡張しようとする。RLSVR はタスク変換によって、環境内のルールと相互作用から自動的に報酬を得る枠組みを提案している。

続きを読む