記事一覧へ戻る
AIエージェント

失敗から学ぶAIエージェント:AEDが5万件のエラー診断データを公開

読了目安 3 分

導入

LLMエージェントの失敗は、最終報酬がゼロだったという一つの結果だけではありません。エージェントが何を観測し、どの行動を選び、環境からどのような応答を受けたのかには、次の学習に使える情報が含まれています。重要なのは、軌跡のどの判断を修正すべきかを特定し、具体的な代替行動が本当に有効かを検証することです。

Agent Error Dataset(AED)は、この課題に焦点を当てたデータセットです。収録されるのは50,228件のエラー・診断ペアで、9,961件の元タスクから作られています。対象はテキストベースの33環境、19種類のハーネス系統、23のポリシーモデルです。診断文だけでなく、元のトレースと実行メタデータも保存されているため、元のロールアウトをもう一度実行しなくても、設定をまたいだ失敗分析や再診断ができます。

AETパイプラインの考え方

研究ではAgentic Error-to-Training(AET)という五段階の流れを使います。まず自然に発生した失敗を集め、観測、行動、環境応答をもとに問題の判断と修正案を生成します。その後、生成された診断を記録済みの証拠と照合します。再実行に対応する環境では、同じ判断時点から、条件をそろえて元の行動と修正案を比較します。最後に、データを診断学習用とエージェントの行動回復用に分けます。

この分離には意味があります。失敗したことを知るだけでは、原因を説明できるとは限りません。また原因を説明できても、次に取るべき行動を選べるとは限りません。AEDは、失敗の理解と行動の修正を別々の学習目標として扱います。

主な結果

  • 3,062件の対応する再実行ペアでは、初回の修正案によって検証通過率が18.4%から51.1%へ上がり、32.7ポイント改善しました。
  • 独立して凍結した診断データを使い、1,656件の元タスクでQwen3-8Bを微調整したところ、943件のホールドアウトにおける内部教師ラベルとの正確なステップ一致率は、3シード平均で47.2%から63.6%になりました。
  • 同じ比較で最も強いプロンプト型の参照手法は54.7%でした。訓練データを四段階で増やすごとに平均一致率も改善しました。
  • 単一シードの行動訓練比較では、行動修正だけを学習する方式が、成功例だけを使う方式をWebShop-liteで6.67ポイント上回りました。

意義と注意点

AEDの新しさは、単にサンプル数が多いことだけではありません。失敗軌跡、診断、代替行動、実行検証をつなぐことで、失敗を後学習に利用できる形へ整理しています。ブラウジングやツール利用のように、途中の小さな判断がその後の成否を左右するタスクでは、成功・失敗の二値ラベルより有用な可能性があります。

一方、結果の範囲には注意が必要です。再実行による評価は一部の環境に限られ、診断一致率は論文内の教師ラベルとの比較です。また、WebShop-liteでの行動訓練比較は単一シードによる結果です。未知の環境、長いタスク連鎖、異なるツール群へ安定して移転できるかは、今後の検証課題です。

それでもAEDは、エージェント訓練を成功例の収集だけに依存させず、何が失敗し、どう直せるかを記録して学習する方向を示しています。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Omni-IO Skills:汎用エージェントをマルチモーダル化する実行基盤
AIエージェント
cctest.ai
AIエージェント

Omni-IO Skills:汎用エージェントをマルチモーダル化する実行基盤

Omni-IO Skillsは、基盤モデルを再学習する代わりに、既存エージェントの外側へSkillsと実行管理機能を追加する。複数モダリティにまたがる成果物、依存関係、中間資産を一つのワークフローとして扱える。

続きを読む
CCTest · Blog
AsyncLLM、大規模言語モデルを汎用非同期エージェントへ
AIエージェント
cctest.ai
AIエージェント

AsyncLLM、大規模言語モデルを汎用非同期エージェントへ

Yandex Researchは、事前学習済みモデルが観察・推論・行動を同時に進められるオープンソースフレームワークAsyncLLMを公開した。追加のタスク専用学習なしで、Qwen 3.xをストリーミング動画理解やゲーム、監視に適用した例を示している。

続きを読む
CCTest · Blog
Omni-Decision、証拠台帳でオムニモーダルエージェントの計画を再設計
AIエージェント
cctest.ai
AIエージェント

Omni-Decision、証拠台帳でオムニモーダルエージェントの計画を再設計

Omni-Decisionは、増え続ける対話履歴を、確認済み・不足・矛盾する情報を管理する構造化された「証拠台帳」に置き換える。論文は、オムニモーダルエージェントでは知覚だけでなく計画が大きなボトルネックだと示す。

続きを読む