BPO、批評器なしで検証可能報酬によるLLM学習を再構成
導入
大規模言語モデルの推論能力を高める手段として、検証可能な報酬を用いる強化学習(RLVR)が注目されています。数学問題のようなタスクでは、モデルが完全な解答を生成した後に正誤を判定できる一方、報酬が系列の最後にしか与えられないという難しさがあります。長いトークン列の各判断に終端報酬をどう反映させるかが、学習の重要な課題になります。
Bellman Policy Optimization(BPO)は、この状況に対して批評器を明示的に使わない方法を提案します。方策ミラー降下(PMD)を出発点とし、ベルマン方程式を使って、終端報酬を伴う自己回帰生成の目的を軌跡レベルへ書き換えます。
主なポイント
- 中間価値の推定を避ける。 通常は、各時点の前缀や状態について価値あるいはアドバンテージを推定します。BPOは完全な生成軌跡を直接扱い、この推定過程を不要にします。
- 理論的な同値性を示す。 論文は、書き換え後の軌跡レベル目的が、元のPMD目的と同じ唯一の最適解を持つことを証明しています。単なる経験的な損失変更ではなく、理論に基づく再定式化です。
- 方策の不一致を補正する。 サンプルを生成した方策と、現在更新している方策は一致しない場合があります。BPOは軌跡目的を近似し、相補的なトークン確率の平滑化比を用いてこの不一致を補正します。
- 数学推論で評価する。 数学推論ベンチマークで有効性を示す実験が報告されています。ただし、提供された情報にはベンチマーク名、モデル規模、性能差の具体値は含まれていません。
意義と影響
終端報酬だけを持つ言語モデル学習では、批評器が各部分系列の価値を学習しなければなりません。しかし、直接の教師信号は生成の最後に到着するため、この価値推定は難しく、追加の推定誤差を生む可能性があります。BPOはベルマン方程式を利用してPMDの目的を完全な軌跡上に表現し、終端報酬からトークン単位の更新へ至る道筋を簡潔に捉えようとします。
実用損失における確率比の設計も特徴的です。BPOは、Group-Relative Policy Optimization(GRPO)で使われる重要度サンプリング比をそのまま用いず、相補的なトークン確率に基づく平滑化比へ置き換えます。長い自己回帰系列で方策間の差を補正しながら、極端な比率の影響を抑える狙いがあると考えられますが、すべての学習条件での挙動までは素材から判断できません。
論文の議論では、別の研究と中核勾配が一致する点にも触れています。BPOはPMDとベルマン方程式から導き、KL項には二値近似と加法的平滑化を使います。異なる導出が近い更新信号につながる点は、RLVRの最適化設計を考えるうえで示唆的です。
BPOは、RLVRにおける批評器なし最適化の理論的な選択肢を示しました。数学推論以外のタスクや異なるモデル規模、サンプリング条件での有効性は、今後の検証課題です。
コメント
ログイン状態を確認中…
コメントを読み込み中…