記事一覧へ戻る
強化学習

SEED:エージェントの軌跡から自己進化するスキルを学ぶ

読了目安 3 分

導入

大規模言語モデルが対話型エージェントとして使われる場面では、単発の回答だけでは不十分です。複数ターンのやり取り、ツール利用、環境からのフィードバックを扱い、長い時間軸の中で意思決定しなければなりません。結果ベースの強化学習は有効な訓練方法ですが、報酬がエピソード終了時にしか得られないことが多く、中間の判断に対する手がかりが不足します。

SEED(SElf-Evolving On-Policy Distillation)は、この問題に対して、完了した軌跡を訓練時の「事後スキル」に変換するアプローチを提案します。固定された教師モデルに頼るのではなく、エージェント自身が過去の軌跡を振り返り、次の学習に使える自然言語の知識として整理します。

核心ポイント

  • 軌跡をスキルに変換:SEED はまず、方策モデルに完了済みの軌跡を分析させ、再利用可能な手順、重要な観察、失敗回避のルールなどを自然言語で生成させます。
  • on-policy な整合性:訓練中は、現在の方策が環境と相互作用して軌跡を集めると同時に、その軌跡を分析する役割も担います。そのため、補助的な監督は現在のデータ分布に近いまま保たれます。
  • 密な token レベル信号:通常の文脈と、スキルを追加した文脈の両方でサンプル済み行動を再評価し、スキルによって生じた確率変化を蒸留信号として利用します。
  • 結果報酬との併用:この蒸留は強化学習を置き換えるものではなく、outcome-based RL と共同で最適化されます。

意義と影響

SEED の特徴は、「振り返り」を継続的に更新される監督信号へ変える点にあります。方策が改善されると、軌跡の質やスキル分析の質も変わり、それがさらに次の意思決定を支援するという循環が生まれます。

長期タスクでは、失敗の原因が一つの小さな判断にあることも多く、最終結果だけでは十分な学習信号になりません。SEED は、成功・失敗の結果だけでなく、「どのような中間判断が有効だったのか」をモデルに学ばせるための仕組みとして位置づけられます。

論文概要によれば、SEED はテキストベースおよび視覚ベースのエージェント課題で性能とサンプル効率を改善し、未見シナリオへの汎化も示しています。今後は、より長いツールチェーンや実環境に近いノイズの多いフィードバックでも、この自己生成スキルが安定した監督として機能するかが焦点になります。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
J-Zero:挑戦者・解答者・判定者を共進化させる仕組み
強化学習
cctest.ai
強化学習

J-Zero:挑戦者・解答者・判定者を共進化させる仕組み

KAIST AI が提案する J-Zero は、人手によるラベル付きデータに依存せず、課題生成、問題解答、評価の3役を同時に適応させる枠組みです。検証可能な課題だけでなく、評価が難しい課題にも対応することを目指します。

続きを読む
CCTest · Blog
正解ラベルなしで推論を改善するTTPO、合意と不一致を使い分けるテスト時学習
強化学習
cctest.ai
強化学習

正解ラベルなしで推論を改善するTTPO、合意と不一致を使い分けるテスト時学習

TTPOは、多数決による疑似ラベルをそのまま正解扱いせず、同意する推論と反対する推論に異なる学習処理を適用する。これにより、誤った多数決が教師信号全体を汚染するリスクを抑える。

続きを読む