TraceDance、実運用の軌跡からAIエージェントの行動ベンチマークを自動生成
概要
AIエージェントが最終的にタスクを完了しても、実行中の行動が常に適切だったとは限りません。不要なツール呼び出し、重要な制約の見落とし、危険な判断などは、最終結果だけを測る評価では見逃される可能性があります。固定されたタスクと正解を中心に設計された従来のベンチマークでは、実運用後に初めて見つかる細かな行動上の問題を十分に扱えません。TraceDanceは、こうした問題を実際の運用トレースから直接テスト化しようとする研究です。
システムの仕組み
TraceDanceは、コーディングおよび一般的なツール利用のセッションと、開発者が検証したい望ましくない行動を入力として受け取ります。中心となる処理は次の3つです。
- Anchor-and-Confirm:プログラム可能な検索で関連しそうなトレース断片を抽出し、その候補をFlash LLMが個別に確認します。これにより、広い検索による誤検出を抑えます。
- Anchor Synthesis Loop:行動の定義が曖昧な場合、システムが評価仕様を作成し、検索・確認の結果をもとに繰り返し修正します。抽象的な問題を、判定可能な条件へ近づける仕組みです。
- 意思決定点からの継続評価:環境全体を再現したり、唯一の正解を用意したりせず、記録された意思決定点で評価を止めます。モデルに次のターンを生成させ、対象行動専用のルーブリックで判定します。
この方式では、「タスクを終えたか」だけでなく、「その過程でどのように判断したか」を評価できます。最終的に正しい結果へ到達したエージェントでも、途中の問題行動は個別に検出できます。
実験結果
研究では252,557件のセッションを利用し、107個のベンチマークと4,125件の評価事例を作成しました。ベンチマーク構築要求の95.3%が満たされています。抽出事例のサンプルについては、2人の人手評価者が84%で指定された行動の存在を確認しました。また、自動評価器の合否判定は、人手評価者同士の判定一致度と同程度でした。これは自動化を支える材料ですが、人手確認が不要になったことを意味しません。
9つの先端LLMを対象にした平均合格率は26.7%にとどまりました。一般的なタスク能力が高くても、特定の意思決定点で行動規範を安定して守れるとは限らないことを示しています。ただし、この数値は対象ベンチマーク上の行動評価であり、モデル全体の能力順位を表すものではありません。
意義と課題
TraceDanceの重要性は、運用中の問題を定向ベンチマークへ変換し、評価と改善を反復できる点にあります。固定ベンチマークの更新を待たず、実際の失敗や懸念に合わせた回帰テストを作れるため、エージェント評価をより実運用に近づけられます。再帰的自己改善のループにおけるテスト部品になる可能性もあります。
一方、結果は元のトレースの範囲、行動仕様の明確さ、自動評価器の信頼性に左右されます。人手確認率が84%であることからも、検索と仕様生成は完全ではありません。高リスク用途では、追加の人手審査、タスクをまたいだ検証、評価バイアスの分析が必要です。
コメント
ログイン状態を確認中…
コメントを読み込み中…