SRD、事後の経験をRLVRの事前予測へ蒸留
導入
強化学習では、エージェントが環境との相互作用を終えた後、その結果を報酬として学習に利用します。しかし、複数のロールアウトをグループ内で比較する手法では、すべての軌跡が同じ報酬を得ると差分がなくなり、更新信号も消えてしまいます。全員が失敗したグループでも、失敗したツール呼び出しや不足していた知識が軌跡に現れている可能性があります。全員が成功した場合も、成功に必要な条件を示す情報は残っています。
Self-Retrospection Distillation(SRD)は、この未利用の情報を使うために「前向き学習」という考え方を提案します。完成後の経験を、行動前の予測の教師にする仕組みです。
手法の要点
- まず、エージェントが環境と相互作用する前に、遭遇しそうな落とし穴や難所、不足している知識を予測します。
- ロールアウト終了後、同じポリシーの停止勾配コピーが完全な軌跡を読み、事前予測が現実に照らしてどう修正されるべきかを評価します。
- SRDは、事前の予測と事後に得られた逐次的な分布を補助的な蒸留損失でそろえます。
- 予測は訓練用の目標であり、推論時に追加生成する必要はありません。そのためGRPO、OPSD、RLSDに組み込めます。
重要なのは、最終報酬を別のスコアに置き換えるのではなく、軌跡内部の情報を信用割り当てに利用する点です。報酬が同じでも、どの行動が失敗につながったか、次の実行前に何を確認すべきかを学習できます。
報告された結果
著者はQwen3.5-4Bおよび9Bを使い、数学、コード、検索、ALFWorld、WebShopなど、10種類のツール統合・長期タスクで評価しています。GRPO、OPSD、RLSDにSRDを組み合わせると一貫した改善が得られ、最大の向上幅は24.2ポイントでした。モデル規模に応じて、報酬が均一なグループは37%から98%に達し、報酬のコントラストが乏しい状況ほどSRDの利点が目立つと報告されています。
2B設定では、全失敗グループが98%を占めました。提示された同じロールアウト予算で、GRPO単独の訓練成功率は0.0%でしたが、GRPOにSRDを加えると60.6%に達しました。また、9Bモデルの一部タスクではOPSDが未訓練モデルを下回った一方、SRDを加えることで再び未訓練モデルを上回ったとされています。未知の形式や、より長いツール呼び出し列でも効果が維持されたと報告されています。
意義と残る課題
SRDは失敗軌跡を単なる「報酬のないデータ」と見なさない点に意義があります。報酬は結果を示し、回顧は原因を整理し、前向きな目標はその整理を次の行動前の準備へ変換します。長期タスクでは、最終報酬だけでは多数のツール操作のどこで失敗したか分かりにくいため、この分離は有用になり得ます。
一方、提示された素材だけでは、他の環境や大規模モデルへの一般化までは判断できません。事後評価の質、追加のポリシー実行による計算コスト、誤った回顧が誤解を強化する可能性については、論文と実装を通じた検証が必要です。
コメント
ログイン状態を確認中…
コメントを読み込み中…