記事一覧へ戻る
モデル評価

エージェントの失敗は無知か無能か、知識ゲート型評価プロトコルが検証

読了目安 3 分

はじめに

エージェントが専門タスクに失敗したとき、その原因は単純ではない。必要な業務知識や組織内の慣行を知らなかったのか、それとも情報は与えられていたのに計画や実行に失敗したのか。両者を区別できなければ、検索機能やコンテキスト設計を改善すべきなのか、モデルの推論・ツール利用能力を改善すべきなのか判断しにくい。

「Ignorance or Incompetence? Constructing Knowledge-Gated, Verifiable Tasks for LLM Agents」は、この問題に対して知識ゲート型タスク構築プロトコルを提案する研究である。

プロトコルの要点

  • 指示と知識を分離:タスク指示とは別に、私的な慣行、参照表、実用的な操作子などを含むコンパクトなアーティファクトを用意する。
  • 指示文を同一化:アーティファクトを提供する条件と隠す条件で、タスク指示をバイト単位で同一にする。
  • 漏洩を監査:構築時の出所を記録し、非公開知識がタスク文面や公開データから漏れていないか確認する。
  • 結果を検証可能にする:構造化タスクでは決定的ソルバーやルールコーパスを使い、単一の実行可能な判定器が使えない出力には、基準ごとの明示的なルーブリックを適用する。
  • 複数回実行する:5回の試行を通じて、単発の偶然ではなく安定した知識依存性かを調べる。

実験から分かること

15件の校正タスクでは、あるフロンティアエージェント設定がアーティファクト提供時に68.0%の通過率を示したのに対し、非提供時は0%だった。また、もっともらしいものの誤ったアーティファクトを与えたタスクでは、5回の試行すべてで0%となった。これは、コンテキストを与えるだけで成功するわけではなく、その内容の正確さと適合性が重要であることを示す。

5回試行による経験的な知識ゲート基準を適用した結果、7件のタスクが残った。ただし、研究が検証したのは、知識への依存を測定できるタスクを構築する方法である。これらのタスクが追加学習の性能を高めることまでは示していない。

意義と限界

知識の利用可能性を統制変数として扱うことで、ベンチマークの失敗をより具体的に解釈できる。正しいアーティファクトを与えたときだけ成功するなら、検索、コンテキスト注入、知識管理が改善候補になる。一方、知識を与えても失敗するなら、計画、ツール利用、指示追従、実行の信頼性などが問題になり得る。

一方で、結果は特定のエージェント設定に依存し、タスク数も限定的である。知識ゲートの強さはアーティファクトの設計や評価基準にも左右される。公開されたのはタスク群とツールの一部であり、より多様なモデルや実運用ログ、長期タスクでの再検証が必要だろう。

この研究は新しいエージェント構造を提示するものではない。失敗を一つのスコアに埋没させず、知識不足と能力不足を診断するための評価設計を示した点に価値がある。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
VeriPhy:生成動画の物理的信頼性を追跡可能にする評価基盤
モデル評価
cctest.ai
モデル評価

VeriPhy:生成動画の物理的信頼性を追跡可能にする評価基盤

見た目が滑らかな生成動画でも、物体の数や位置関係、出来事の順序を誤っている可能性があります。VeriPhyはプロンプトを型付きの物理的義務へ変換し、根拠まで追跡できる判定を生成します。

続きを読む
CCTest · Blog
Principia、動画モデルが物理法則を理解しているかを関係性で検証
モデル評価
cctest.ai
モデル評価

Principia、動画モデルが物理法則を理解しているかを関係性で検証

動画生成モデルは自然に見える動きを作れても、基本的な物理法則を守るとは限りません。Principia は、同じシーンにある物体同士の関係を使い、カメラ校正に依存せず物理的一貫性を評価します。

続きを読む
CCTest · Blog
S³Gym:LLMは自己テストと自己評価から本当に改善できるのか
モデル評価
cctest.ai
モデル評価

S³Gym:LLMは自己テストと自己評価から本当に改善できるのか

S³Gymは、LLMエージェントが自らの行動を試し、経験を評価し、その結果を次の意思決定に生かせるかを測る対話型ベンチマークです。実験では、改善効果がタスク構造と経験の保存方法に強く依存することが示されました。

続きを読む