記事一覧へ戻る
モデル評価

LongRCA Bench、長期エージェントの失敗を「誰が」「いつ」起こしたかで診断

読了目安 3 分

導入

長期にわたって計画し、ツールを呼び出し、複数の役割に作業を引き継ぐエージェントが失敗したとき、通常の評価から分かるのは最終結果が未達だったという事実だけだ。開発者が知りたいのは、どの役割や処理段階が失敗に責任を負うのか、そして後続の失敗を決定づけた最初のステップはどこなのかである。数百の記録を最後から確認するだけでは、結果と原因を取り違えやすい。

LongRCA Benchの設計

LongRCA Benchは、この診断課題に焦点を当てたベンチマークだ。5つの分野から、エラーを人工的に注入していない実際の失敗軌跡1,140件を収録する。軌跡の長さは中央値で145ステップあり、短い実行ログを中心とした従来の評価とは異なる難しさを持つ。

各軌跡には、次の2つの目標について独立した人手評価が付けられている。

  • 責任役割の特定:失敗に主な責任を負う役割、コンポーネント、実行主体を見つける。
  • 最初の決定的根因ステップの特定:後続の失敗を決定的に引き起こした最も早いステップを見つける。

この分離は重要だ。初期の引き継ぎ指示が誤っていても、問題が目に見える形になるのは後のツール操作かもしれない。一方で、途中の異常が発生していても、それだけでは失敗が確定せず、後続の判断によって回復不能になる場合もある。「誰が担当したか」と「どのステップが根因か」は、同じ能力ではない。

RCTAの仕組みと結果

論文はRoot-Cause Trajectory Attribution(RCTA)も提案する。これは追加学習を行わない手法で、まず軌跡を分割した要約からエラー候補となるステップを検索し、その候補を利用可能な過去の引き継ぎ指示までさかのぼって追跡する。長い軌跡全体を一度に調べるのではなく、要約と引き継ぎ情報を使って探索範囲を絞る考え方だ。

同じバックボーン、ベンチマーク事例、評価手順で比較した結果、RCTAは責任役割の正解率51.1%、根因ステップの完全一致率24.1%を記録した。最強のベースラインによる根因ステップ完全一致率は13.2%にとどまる。役割を推定することに比べ、最初の決定的ステップを一点で当てることがはるかに難しいことが分かる。

意義

LongRCA Benchは、エージェント評価を「タスクに成功したか」から「失敗を説明し、原因を追跡できるか」へ広げる。委任、ツール利用、役割間の引き継ぎに依存するシステムでは、成功率だけでなく責任境界とエラーの伝播経路を測る必要がある。

一方、正確な根因ステップの特定率はまだ高いとは言えず、長期軌跡の診断は未解決の課題だ。より良い要約、詳細なテレメトリ、明確な引き継ぎ記録、因果関係を捉える評価方法が今後の研究課題になる。データセットとリーダーボードは公開されている。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
科学AIエージェントは研究を前進させるが、完遂はまだ難しい
モデル評価
cctest.ai
モデル評価

科学AIエージェントは研究を前進させるが、完遂はまだ難しい

FrontierChallengeは、もっともらしい回答ではなく、検証可能な科学ワークフローを最後まで納品できるかを評価する。結果は、部分的な進捗と完全な完了の間に大きな差があることを示した。

続きを読む
CCTest · Blog
SWE Refactor Bench、コーディングエージェントはリポジトリ全体を移行できるか
モデル評価
cctest.ai
モデル評価

SWE Refactor Bench、コーディングエージェントはリポジトリ全体を移行できるか

新たなベンチマークは、局所的なバグ修正ではなく、リポジトリ全体の技術スタック移行能力を測定する。520回の実行で、移行・動作・追加検証をすべて通過したのは5.4%にとどまった。

続きを読む
CCTest · Blog
一度の成功は信頼性ではない:Thinkingboxで業務エージェントを評価する
モデル評価
cctest.ai
モデル評価

一度の成功は信頼性ではない:Thinkingboxで業務エージェントを評価する

Thinkingboxは、妥当な返答やツール呼び出しだけでなく、業務ワークフロー終了時のバックエンド状態まで検証するサンドボックスです。ベンチマークは、偶然の成功と安定した実行能力の間に大きな差があることを示します。

続きを読む