失敗から学ぶAIエージェント:AEDが5万件のエラー診断データを公開
導入
LLMエージェントの失敗は、最終報酬がゼロだったという一つの結果だけではありません。エージェントが何を観測し、どの行動を選び、環境からどのような応答を受けたのかには、次の学習に使える情報が含まれています。重要なのは、軌跡のどの判断を修正すべきかを特定し、具体的な代替行動が本当に有効かを検証することです。
Agent Error Dataset(AED)は、この課題に焦点を当てたデータセットです。収録されるのは50,228件のエラー・診断ペアで、9,961件の元タスクから作られています。対象はテキストベースの33環境、19種類のハーネス系統、23のポリシーモデルです。診断文だけでなく、元のトレースと実行メタデータも保存されているため、元のロールアウトをもう一度実行しなくても、設定をまたいだ失敗分析や再診断ができます。
AETパイプラインの考え方
研究ではAgentic Error-to-Training(AET)という五段階の流れを使います。まず自然に発生した失敗を集め、観測、行動、環境応答をもとに問題の判断と修正案を生成します。その後、生成された診断を記録済みの証拠と照合します。再実行に対応する環境では、同じ判断時点から、条件をそろえて元の行動と修正案を比較します。最後に、データを診断学習用とエージェントの行動回復用に分けます。
この分離には意味があります。失敗したことを知るだけでは、原因を説明できるとは限りません。また原因を説明できても、次に取るべき行動を選べるとは限りません。AEDは、失敗の理解と行動の修正を別々の学習目標として扱います。
主な結果
- 3,062件の対応する再実行ペアでは、初回の修正案によって検証通過率が18.4%から51.1%へ上がり、32.7ポイント改善しました。
- 独立して凍結した診断データを使い、1,656件の元タスクでQwen3-8Bを微調整したところ、943件のホールドアウトにおける内部教師ラベルとの正確なステップ一致率は、3シード平均で47.2%から63.6%になりました。
- 同じ比較で最も強いプロンプト型の参照手法は54.7%でした。訓練データを四段階で増やすごとに平均一致率も改善しました。
- 単一シードの行動訓練比較では、行動修正だけを学習する方式が、成功例だけを使う方式をWebShop-liteで6.67ポイント上回りました。
意義と注意点
AEDの新しさは、単にサンプル数が多いことだけではありません。失敗軌跡、診断、代替行動、実行検証をつなぐことで、失敗を後学習に利用できる形へ整理しています。ブラウジングやツール利用のように、途中の小さな判断がその後の成否を左右するタスクでは、成功・失敗の二値ラベルより有用な可能性があります。
一方、結果の範囲には注意が必要です。再実行による評価は一部の環境に限られ、診断一致率は論文内の教師ラベルとの比較です。また、WebShop-liteでの行動訓練比較は単一シードによる結果です。未知の環境、長いタスク連鎖、異なるツール群へ安定して移転できるかは、今後の検証課題です。
それでもAEDは、エージェント訓練を成功例の収集だけに依存させず、何が失敗し、どう直せるかを記録して学習する方向を示しています。
コメント
ログイン状態を確認中…
コメントを読み込み中…