記事一覧へ戻る
モデル評価

WhatWorkedBench、AIエージェントの実験理解を測定

読了目安 3 分

導入

AI研究エージェントに求められるのは、コードを書いて実験を実行することだけではありません。結果を変えた要因を特定し、限られた計算予算の中で次に何を測るべきかを判断する必要があります。WhatWorkedBenchは、この能力を「実験理解」として切り出し、コンポーネントの変更が結果に与える影響をどれだけ正確に予測できるかを評価します。

エージェントはまずワークフローのコードを調べ、予算内で測定する設定を選びます。その後、コンポーネント設定のあらゆる組み合わせについてスコアを予測するレスポンスサーフェスを提出します。評価対象は単一の実験を成功させることではなく、観測結果から実験全体の構造を推定できるかどうかです。

主なポイント

  • 網羅的な実行を基準にする。 研究者はCPU上で設定を網羅的に実行し、他の要素を固定したまま一つのコンポーネントを変えた場合の効果を算出します。対象は36タスク、30データソース、8種類のワークフローで、設定記録は1248件です。中核評価には4206件の数値制御記録と108回のエージェントエピソードが含まれます。
  • どの測定を選ぶかが重要になる。 新たに8回測定する条件では、ペア効果リッジ回帰が22データソース中15件で最適設定を選択しました。3件では、すべての効果誤差がスコア範囲の10%以内に収まりました。
  • 同じ観測でも統計モデルで改善できる。 エージェントの観測にガウス過程を適用すると、効果復元指標は元のFlashコホートで0.632から0.698へ、追加コホートで0.621から0.720へ上昇しました。ビート検出とグラフに関する6件の提出では、ワークフロー族単位の復元も0.303から0.455へ改善しました。
  • コード構造が探索を助ける。 6個の二値オプションを持つワークフローで、コード上同じ挙動を示す設定を等価として扱うと、20回の追加測定におけるガウス過程の復元指標は0.248から0.462へ上がりました。

意義と影響

WhatWorkedBenchの意義は、「エージェントが実験を理解している」という曖昧な表現を、予測問題として測定可能にした点にあります。もっともらしい実験コードを生成できても、実際のコンポーネント効果と偶然の変動を区別できなければ、限られた予算で改善を積み重ねることは困難です。

また、性能向上は言語モデルの規模だけで決まらないことも示されています。情報量の高い測定点を選ぶ能力、レスポンスサーフェスを数値的に推論する能力、そしてコードから同じ挙動の設定を見つける能力が、実験自動化の重要な要素になります。

ただし、このベンチマークが直接測るのはコンポーネント効果の復元とスコア予測です。科学的発見全体を評価するものではありません。それでも、研究エージェントが実験を「実行する」だけでなく、そこから再利用可能な知識を学べるかを検証する、明確な出発点になります。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
ExplorationBench、未知の「異星世界」でAIの探索能力を測定
モデル評価
cctest.ai
モデル評価

ExplorationBench、未知の「異星世界」でAIの探索能力を測定

ExplorationBenchは、AIが未知の規則を実験によって発見したのか、それとも事前学習の記憶を呼び出しただけなのかを検証するためのベンチマークだ。実行可能で常識に反する仮想世界を用い、回答を厳密に確認する。

続きを読む
CCTest · Blog
正答率だけでは足りない:LLM評価で校正を重視すべき理由
モデル評価
cctest.ai
モデル評価

正答率だけでは足りない:LLM評価で校正を重視すべき理由

大規模言語モデルは、どれだけ正解できるかだけでなく、自分の回答がどの程度確かなのかを適切に示せるかでも評価すべきだとする立場論文が発表された。校正手法はすでに存在しており、課題は評価現場での普及にある。

続きを読む
CCTest · Blog
ブラックボックスを開く:最先端モデルの隠れた推論を引き出す
モデル評価
cctest.ai
モデル評価

ブラックボックスを開く:最先端モデルの隠れた推論を引き出す

標準APIのカスタムツール呼び出しを使い、研究者が最先端モデルの中間推論の一部を外部化した。GPT-6 Astraは短く直線的な推論を示したが、可視化された記録だけで真の内部思考を証明することはできない。

続きを読む