記事一覧へ戻る
強化学習

GRAFT、異種モデルの推論軌跡を交換してRLVRを改善

読了目安 3 分

概要

検証可能な報酬を使う強化学習、RLVRでは、モデルが生成した回答の正誤を報酬として学習します。GRPOのような手法は、同じ問題に対する複数の回答をグループ化し、報酬の差からアドバンテージを計算して方策を更新します。しかし、限られたロールアウト予算では、グループ内の回答がすべて不正解になることがあります。この場合、正解との比較ができず、報酬に基づく有効な更新信号がほとんど得られません。

論文「Learning Beyond What You Sample」が提案するGRAFTは、この問題を異種モデル間の軌跡交換で解決しようとします。異なるモデルは、同じ問題に対して同じ失敗をするとは限りません。一方のモデルが解けなかった問題を、別のモデルがすでに解いている可能性があります。GRAFTは、この相補性を利用し、固定された強い教師を置かずに相互学習を行います。

主な仕組み

  • 全失敗グループを置換:あるモデルのサンプルがすべて失敗した場合、同じ問題について相手モデルが生成した軌跡を学習に利用します。
  • 成功例と失敗例をともに転送:正解した回答だけでなく、不正解の回答も、相手モデル側で計算されたアドバンテージとともに共有します。これにより、単純な正解のコピーではなく、グループ内の比較情報を維持できます。
  • オフポリシーの差を制御:軌跡を生成したモデルと更新対象のモデルは異なるため、両者の方策分布にはずれがあります。GRAFTは系列レベルの互換性重み付けと、トークンレベルの重要度比率クリッピングを用いて、ずれの大きい軌跡が更新を不安定にすることを抑えます。
  • 保存軌跡にも対応:同時にモデルを訓練しなくても、保存しておいた相手モデルの軌跡から大部分の効果を得られると報告されています。

結果と意義

著者らは、3組の異種モデルと5つの数学推論ベンチマークを用いてGRAFTを評価しました。各モデルのロールアウト予算をGRPOと揃えた比較で、両方のモデルが一貫して改善し、平均向上幅は2.1ポイント、モデル単位の平均性能では最大4.5ポイントに達しました。保存された軌跡を使う設定でも、GRPOに対して平均1.8ポイントの改善が残りました。

この研究の重要な点は、学習に使える経験を単一モデルのサンプリング結果に限定しないことです。能力の異なるモデルを組み合わせれば、探索の重複を減らし、一方が見つけられなかった成功例を別のモデルが活用できます。一方で、異なる方策の軌跡を無条件に混ぜればよいわけではありません。互換性の評価と重要度比率の制御が、安定した更新に不可欠です。

GRAFTは、RLVRにおける失敗サンプルの無駄を減らし、軌跡キャッシュや教師なしの協調強化学習を設計するための具体的な方向性を示しています。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
LLM強化学習の学習・推論ミスマッチをCISで補正
強化学習
cctest.ai
強化学習

LLM強化学習の学習・推論ミスマッチをCISで補正

RLVRでは、ロールアウトを生成する推論エンジンと勾配を計算する学習エンジンが、同じトークンに異なる確率を割り当てることがあります。新手法CISは、トークンの信頼度を考慮した重要度サンプリングで、この差による更新誤差を抑えます。

続きを読む
CCTest · Blog
QwenGyre、超長期エージェント強化学習のGPU待機と軌跡の重複に対応
強化学習
cctest.ai
強化学習

QwenGyre、超長期エージェント強化学習のGPU待機と軌跡の重複に対応

Qwenは、極端に長いタスク向けのオンライン強化学習フレームワーク「QwenGyre」を提案した。ロールアウトと学習の間でGPUを柔軟に再配分し、分岐履歴の再構成や軌跡の重複排除を行う。

続きを読む