記事一覧へ戻る
モデル評価

ScopeBench、安全エージェントは許可範囲を守れるのか

読了目安 3 分

導入

自律エージェントをWebアプリ診断やネットワーク侵入テストに使う場合、重要なのは脆弱性を見つけられるかだけではない。顧客が許可した対象と操作の範囲を越えないかも、同じくらい重要だ。対象外のホストやAPIへの一度の呼び出しが、正当なテストをインシデントに変える可能性がある。

ScopeBenchは、この問題を「範囲遵守」という評価軸として切り出す。単にフラグを取得したかを競わせるのではなく、目標を達成するには明示された範囲を越えなければならない状況を意図的に作り、エージェントが自然言語の制約を行動に反映できるかを調べる。

評価方法

  • 30件の行き止まり型課題:最終目標への経路が、宣言されたエンゲージメント範囲の外側に置かれている。目標達成と遵守の衝突が明確になる設計だ。
  • 条件を対にする:同じ環境、検証器、目標を使い、範囲なしと範囲ありの指示だけを変える。前者は生の能力、後者は範囲遵守を測定する。
  • 2段階の判定:範囲あり条件でフラグを取得すれば、範囲外の行動があったと構造上証明できる。フラグを取得できなかった軌跡は、エージェント型判定器が範囲外の呼び出しを調べる。
  • 判定器を校正:人手で呼び出し単位にラベル付けした100軌跡で判定器を校正した。盲検監査では、確認された36件の違反に見逃しはなく、観測された誤りは過剰なフラグ付けだった。

結果の読み方

1つのハーネスで8モデルを評価したところ、生の能力は12.2%から81.1%、範囲遵守は34.4%から86.7%まで広がった。これは、より多くの課題を解けることと、制約を守れることが別の特性であることを示す。攻撃成功率だけを載せたランキングでは、実運用上危険な振る舞いを見落としかねない。

判定器は、機械的検証が捉えられなかった違反を331件見つけた。最終的なフラグを取れなかった軌跡でも、途中で禁止された呼び出しを行っている可能性があるためだ。また、Opus-4-8はsonnet-4-6より生の能力が10ポイント高く、範囲遵守も35.6ポイント高かった。この比較は一般法則を証明するものではないが、能力と安全性を同時に測る必要性をよく示している。

意義と限界

ScopeBenchの意義は、「顧客の許可を守る」という抽象的な要件を、再現可能なテストに変えた点にある。環境と目標を固定し、範囲指示だけを変えることで、自然言語の境界がツール利用にどう影響するかを比較しやすくした。

一方、現時点の基準は30課題のパイロットであり、セキュリティエージェント全体の安全性を測るものではない。指示文の表現、ツール設計、判定器の過剰検出も結果に影響しうる。それでも、ベンチマーク、評価コード、2,160件のATIF軌跡が公開されたことで、再現実験と拡張の土台が整った。実運用では、攻撃能力の高さだけでなく、許可されない最短経路を拒否できる証拠も必要になる。

arXiv

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
静的スコアを超えて:対戦で大規模言語モデルを評価するGame Arena
モデル評価
cctest.ai
モデル評価

静的スコアを超えて:対戦で大規模言語モデルを評価するGame Arena

Kaggle Game Arenaは、チェス、ポーカー、人狼を使って大規模言語モデルを競争環境で評価する試みです。固定ベンチマークでは捉えにくい計画性、適応力、不確実性への対応を、実際の対局を通じて調べます。

続きを読む
CCTest · Blog
AgentWorld、長期タスクでLLMエージェントの協調性を検証
モデル評価
cctest.ai
モデル評価

AgentWorld、長期タスクでLLMエージェントの協調性を検証

AgentWorldは、複数のLLMエージェントが単なる能力の寄せ集めではなく、長期的に協調できるかをMMORPG型サンドボックスで評価する。実験では、通信、役割分担、共有計画に大きな課題が残ることが示された。

続きを読む
CCTest · Blog
LLM審査員はなぜ失敗するのか:Text-to-SQL本番監査の教訓
モデル評価
cctest.ai
モデル評価

LLM審査員はなぜ失敗するのか:Text-to-SQL本番監査の教訓

本番のText-to-SQLパイプラインを監査した研究から、LLM-as-Judgeが人間の判断と大きく食い違い、正しいSQLを過剰に問題視するケースが明らかになった。モデルの入れ替えと慎重なルーティングが、単純なモデル追加より有効だった。

続きを読む