WhatWorkedBench、AIエージェントの実験理解を測定
導入
AI研究エージェントに求められるのは、コードを書いて実験を実行することだけではありません。結果を変えた要因を特定し、限られた計算予算の中で次に何を測るべきかを判断する必要があります。WhatWorkedBenchは、この能力を「実験理解」として切り出し、コンポーネントの変更が結果に与える影響をどれだけ正確に予測できるかを評価します。
エージェントはまずワークフローのコードを調べ、予算内で測定する設定を選びます。その後、コンポーネント設定のあらゆる組み合わせについてスコアを予測するレスポンスサーフェスを提出します。評価対象は単一の実験を成功させることではなく、観測結果から実験全体の構造を推定できるかどうかです。
主なポイント
- 網羅的な実行を基準にする。 研究者はCPU上で設定を網羅的に実行し、他の要素を固定したまま一つのコンポーネントを変えた場合の効果を算出します。対象は36タスク、30データソース、8種類のワークフローで、設定記録は1248件です。中核評価には4206件の数値制御記録と108回のエージェントエピソードが含まれます。
- どの測定を選ぶかが重要になる。 新たに8回測定する条件では、ペア効果リッジ回帰が22データソース中15件で最適設定を選択しました。3件では、すべての効果誤差がスコア範囲の10%以内に収まりました。
- 同じ観測でも統計モデルで改善できる。 エージェントの観測にガウス過程を適用すると、効果復元指標は元のFlashコホートで0.632から0.698へ、追加コホートで0.621から0.720へ上昇しました。ビート検出とグラフに関する6件の提出では、ワークフロー族単位の復元も0.303から0.455へ改善しました。
- コード構造が探索を助ける。 6個の二値オプションを持つワークフローで、コード上同じ挙動を示す設定を等価として扱うと、20回の追加測定におけるガウス過程の復元指標は0.248から0.462へ上がりました。
意義と影響
WhatWorkedBenchの意義は、「エージェントが実験を理解している」という曖昧な表現を、予測問題として測定可能にした点にあります。もっともらしい実験コードを生成できても、実際のコンポーネント効果と偶然の変動を区別できなければ、限られた予算で改善を積み重ねることは困難です。
また、性能向上は言語モデルの規模だけで決まらないことも示されています。情報量の高い測定点を選ぶ能力、レスポンスサーフェスを数値的に推論する能力、そしてコードから同じ挙動の設定を見つける能力が、実験自動化の重要な要素になります。
ただし、このベンチマークが直接測るのはコンポーネント効果の復元とスコア予測です。科学的発見全体を評価するものではありません。それでも、研究エージェントが実験を「実行する」だけでなく、そこから再利用可能な知識を学べるかを検証する、明確な出発点になります。
コメント
ログイン状態を確認中…
コメントを読み込み中…