X-Tree:再利用可能な経験をAIエージェントの学習資源に変える
はじめに
複数ステップのAIエージェントは、個々の操作を実行できても、一度学んだ手順を別のタスクへ安定して移せるとは限りません。一般的なSFTや強化学習では、軌跡を平坦なアクション列として扱い、各トークンや行動をほぼ同じ粒度で学習します。その結果、「2つの欄を入力して送信する」「場所へ移動して物体を取る」といった手順が、異なるタスクのたびに再学習されます。
X-Treeは、既存の軌跡に潜むこの階層構造を抽出し、学習信号として利用します。名称は再利用可能な経験ツリーを意味します。
トークナイザーのようにスキルを発見する
X-Treeは、LLMにスキル説明を書かせるのではなく、サブワード・トークナイザーに似た統計的なマージを行います。まず、生のアクションを比較可能な形式へ正規化します。例えば、日付入力やボタンのクリックといった操作種別を残し、ページ固有の要素IDや値はスロットとして扱います。これにより、異なるページ上の似た操作を同じ行動類型として扱えます。
次に、隣接する行動区間を、どの程度再利用できるかという観点で評価します。出現頻度に加え、統合後の区間の長さや、成功エピソードでの出現頻度も考慮します。コーパスの重複を減らす利益がコストを上回る場合だけ、区間を統合します。短い操作はサブルーチンとなり、それらがさらに高位の手順を形成します。
例えば、2つの欄への入力と送信を1つのノードにまとめ、前段のナビゲーションと組み合わせることで、日付範囲で表を絞り込む手順として表現できます。この処理はデータの正規化とカウントに基づくため、決定的で監査しやすく、追加のLLM呼び出しも必要ありません。
3つの学習への組み込み
論文では、X-Treeを次の3つの設定に導入しています。
- オフライン強化学習:ツリーの各ノードを学習インスタンスとして扱い、単なる行動列ではなくプログラム単位の経験を学習させます。
- オンラインRLVR:価値のある再利用可能なスキルを実行した場合に、適応的なスキル報酬を与えます。
- オンポリシー自己蒸留:経験ツリーを教師側だけが見られる文脈として利用し、軌跡から高次の構造を抽出します。
LLMが書いたスキルをプロンプトに置くだけの方式とは異なり、X-Treeは繰り返し現れる経験をモデルの学習信号に変換しようとします。
結果と意義
WebArena、ScienceWorld、WebShopを3つのモデル規模で評価した結果、同じデータ量と学習予算の条件で、標準的な訓練方法を上回りました。改善幅は最大で、WebArenaの成功率が4.5ポイント、ScienceWorldが5.8ポイント、WebShopの成功率が4.1ポイントでした。比較分析では、単に文脈を増やしたのではなく、経験ツリーと3種類の統合方法が効果に寄与したとされています。
この研究の重要性は、手作業で設計するプロンプト上のスキルを、エージェントのデータから自動的に発見される学習対象へ変えた点にあります。収集コストの高い軌跡を、データ整理、報酬設計、能力転移に活用する共通の仕組みになり得ます。一方で、動作の正規化が不適切だったり、成功軌跡が十分でなかったりすると効果は制限されます。ページ固有の文脈に強く依存する手順をどう抽象化するかは、今後の課題です。
コメント
ログイン状態を確認中…
コメントを読み込み中…