GRAFT、異種モデルの推論軌跡を交換してRLVRを改善
概要
検証可能な報酬を使う強化学習、RLVRでは、モデルが生成した回答の正誤を報酬として学習します。GRPOのような手法は、同じ問題に対する複数の回答をグループ化し、報酬の差からアドバンテージを計算して方策を更新します。しかし、限られたロールアウト予算では、グループ内の回答がすべて不正解になることがあります。この場合、正解との比較ができず、報酬に基づく有効な更新信号がほとんど得られません。
論文「Learning Beyond What You Sample」が提案するGRAFTは、この問題を異種モデル間の軌跡交換で解決しようとします。異なるモデルは、同じ問題に対して同じ失敗をするとは限りません。一方のモデルが解けなかった問題を、別のモデルがすでに解いている可能性があります。GRAFTは、この相補性を利用し、固定された強い教師を置かずに相互学習を行います。
主な仕組み
- 全失敗グループを置換:あるモデルのサンプルがすべて失敗した場合、同じ問題について相手モデルが生成した軌跡を学習に利用します。
- 成功例と失敗例をともに転送:正解した回答だけでなく、不正解の回答も、相手モデル側で計算されたアドバンテージとともに共有します。これにより、単純な正解のコピーではなく、グループ内の比較情報を維持できます。
- オフポリシーの差を制御:軌跡を生成したモデルと更新対象のモデルは異なるため、両者の方策分布にはずれがあります。GRAFTは系列レベルの互換性重み付けと、トークンレベルの重要度比率クリッピングを用いて、ずれの大きい軌跡が更新を不安定にすることを抑えます。
- 保存軌跡にも対応:同時にモデルを訓練しなくても、保存しておいた相手モデルの軌跡から大部分の効果を得られると報告されています。
結果と意義
著者らは、3組の異種モデルと5つの数学推論ベンチマークを用いてGRAFTを評価しました。各モデルのロールアウト予算をGRPOと揃えた比較で、両方のモデルが一貫して改善し、平均向上幅は2.1ポイント、モデル単位の平均性能では最大4.5ポイントに達しました。保存された軌跡を使う設定でも、GRPOに対して平均1.8ポイントの改善が残りました。
この研究の重要な点は、学習に使える経験を単一モデルのサンプリング結果に限定しないことです。能力の異なるモデルを組み合わせれば、探索の重複を減らし、一方が見つけられなかった成功例を別のモデルが活用できます。一方で、異なる方策の軌跡を無条件に混ぜればよいわけではありません。互換性の評価と重要度比率の制御が、安定した更新に不可欠です。
GRAFTは、RLVRにおける失敗サンプルの無駄を減らし、軌跡キャッシュや教師なしの協調強化学習を設計するための具体的な方向性を示しています。
コメント
ログイン状態を確認中…
コメントを読み込み中…