記事一覧へ戻る
モデル評価

ClawProBench:AIエージェントを実行過程から評価する

読了目安 3 分

導入

AIエージェントがファイルを読み書きし、ツールを呼び出し、メッセージを送り、予定を登録し、別のエージェントを起動するようになると、最終回答だけでは能力を十分に測れない。正しい結果に到達していても、根拠のない情報を使ったり、誤ったツール経路を選んだり、安全制御を迂回したりする可能性がある。また、1回だけ成功して次の試行で失敗することもある。ClawProBenchは、評価対象をモデル単体からモデルとランタイムの構成へ広げ、実行トレースを残すことでこの問題に取り組む。

主なポイント

  • 評価単位を拡張した。 失敗を、証拠の取得、ランタイムのルーティング、安全境界、反復実行などに分けて分析する。同じ最終回答でも、経路の安全性や再現性によって評価は変わる。
  • 実際のランタイム機能を対象にする。 OpenClawを基盤とし、ワークスペースツールに加えて、ブラウジング、メモリ、メッセージ、スケジュール、スキル、サブエージェントなどのネイティブ機能を扱う。
  • 2つの評価トラックを持つ。 完全プロファイルは102シナリオで、ライブなワークスペースとネイティブ機能の経路を評価する。凍結ホールドアウトは68シナリオで、閉じた世界のJSON出力契約を採用し、比較の安定性を高める。
  • 過程を含めて採点する。 トレースから正確性、プロセス品質、効率を評価し、安全ゲートを適用する。失敗の証拠も監査用に保持される。
  • 再現性を重視する。 ホールドアウトでは、少なくとも1回成功するpass@k-anyが0.6638だった一方、3回すべて成功する厳格な指標は0.2890だった。

結果と意味

完全プロファイルでは68構成、ホールドアウトでは37構成を評価した。安全性を考慮した平均トレーススコアの最高値は0.7671だった。ワークスペースのライブ課題は0.6415、ネイティブランタイム課題は0.5238で、後者の方が低い。これは、ランタイム固有の状態管理、ツール選択、経路制御が新たな失敗要因になることを示唆する。

両トラックのランキングのSpearman相関は0.1300にとどまった。正確性だけで並べた順位も、プロセス品質、安全ゲート、厳格な反復成功を含めた順位とは大きく異なる。単一の正解率をエージェント能力の代表値とみなすことへの注意が必要だ。

今後への示唆

ClawProBenchの重要性は、ベンチマークの設計方法にある。評価ではモデル名だけでなく、ランタイム、ツール、権限、状態、反復回数まで明示すべきだという主張だ。トレースがあれば、推論、根拠収集、ツール選択、認可のどこで問題が起きたかを調べられる。実運用では、偶然の成功よりも、複数回にわたる安全で一貫した成功の方が重要になる。

ただし、本研究はOpenClaw上で実装された評価であり、結果はそのインターフェースと前提に依存する。異なるランタイムを横断して比較するには、再現可能な環境と共通の安全判定が必要だ。それでも、「正しい答えか」だけでなく、「安全か、効率的か、安定して再現できるか」を問うべきだという方向性は明確である。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
科学AIエージェントは研究を前進させるが、完遂はまだ難しい
モデル評価
cctest.ai
モデル評価

科学AIエージェントは研究を前進させるが、完遂はまだ難しい

FrontierChallengeは、もっともらしい回答ではなく、検証可能な科学ワークフローを最後まで納品できるかを評価する。結果は、部分的な進捗と完全な完了の間に大きな差があることを示した。

続きを読む
CCTest · Blog
SWE Refactor Bench、コーディングエージェントはリポジトリ全体を移行できるか
モデル評価
cctest.ai
モデル評価

SWE Refactor Bench、コーディングエージェントはリポジトリ全体を移行できるか

新たなベンチマークは、局所的なバグ修正ではなく、リポジトリ全体の技術スタック移行能力を測定する。520回の実行で、移行・動作・追加検証をすべて通過したのは5.4%にとどまった。

続きを読む
CCTest · Blog
一度の成功は信頼性ではない:Thinkingboxで業務エージェントを評価する
モデル評価
cctest.ai
モデル評価

一度の成功は信頼性ではない:Thinkingboxで業務エージェントを評価する

Thinkingboxは、妥当な返答やツール呼び出しだけでなく、業務ワークフロー終了時のバックエンド状態まで検証するサンドボックスです。ベンチマークは、偶然の成功と安定した実行能力の間に大きな差があることを示します。

続きを読む