記事一覧へ戻る
強化学習

SLCA-GRPO、ツール呼び出し強化学習の信用割り当てを改善

読了目安 3 分

導入

ツール呼び出しエージェントは、単一種類のテキストだけを生成するわけではありません。構造化された関数呼び出しの後に、ユーザー向けの説明や要約を出力するなど、異なる役割のセグメントが一つの軌跡に混在します。この特徴は、GRPOのようなオンポリシー強化学習に固有の問題をもたらします。

標準的な設定では、ロールアウト全体から一つのスカラー型のアドバンテージを計算し、軌跡中のすべてのトークンへ適用します。そのため、要約の品質に関する報酬がツール選択へ流れ込み、逆に実行結果に関する変動が自然言語生成の更新を乱す可能性があります。

この問題に対し、論文はSegment-Locked Credit Assignment(SLCA)を組み込んだSLCA-GRPOを提案しました。さらに、高価な実APIを大量に呼び出さずに探索と訓練を行うため、Schema-Guided LLM Simulator(SGLS)も構築しています。

主な仕組み

  • セグメント別のアドバンテージ:同じロールアウト群の中で、ツール呼び出しと要約を構造的に分けて評価します。
  • 報酬の分離:Hierarchical Rewards(HierR)と組み合わせ、実行に関する利得はツール用トークンへ、選好に関する利得は要約用トークンへ伝えます。
  • 追加ロールアウトを要求しない:中間状態からの新たなサンプリングを必要とせず、既存のグループ単位の訓練枠組みを利用します。
  • スキーマ誘導シミュレーション:SGLSは構造化されたツール環境を提供し、実サービスへの依存と探索コストを抑えます。

実験結果

7B規模のバックボーンでは、SLCA-GRPOは標準GRPO、ToolPO、RLTRより速く収束し、同じ訓練予算で高い性能を示したと報告されています。分布内評価では2.53ポイント、Berkeley Function-Calling Leaderboardでは1.36ポイント、τ²-Benchでは9.15ポイントの向上が示されました。また、三つのQwenバックボーンと分布内外のツール呼び出しベンチマークで、タスク成功率の向上とツール呼び出し回数の減少が報告されています。

意義と今後の論点

この研究の重要な点は、混在した出力を一つの均質な学習対象として扱わないことです。ツールを選ぶ行為と、その結果を説明する行為は同じ軌跡にあっても、評価される信号が異なります。各信号を対応するセグメントへ限定することで、更新方向をより明確にできる可能性があります。

一方で、結果は報酬設計とシミュレーターの再現性に依存します。SGLSが実APIの例外や複雑な多段タスクをどこまで表現できるか、セグメント別報酬が長いタスクでも安定するかは、今後の検証課題です。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
BPO、批評器なしで検証可能報酬によるLLM学習を再構成
強化学習
cctest.ai
強化学習

BPO、批評器なしで検証可能報酬によるLLM学習を再構成

Bellman Policy Optimization(BPO)は、終端報酬を使う自己回帰生成向けの批評器なし方策最適化手法です。方策ミラー降下を軌跡レベルの目的へ変換し、相補的なトークン確率の平滑化比で方策の不一致を補正します。

続きを読む