AutoSciBench:科学エージェント自身が評価課題を進化させる
固定ベンチマークの限界
科学エージェントのベンチマークでスコアが上昇しても、それが科学的推論能力の向上を意味するとは限りません。問題の形式やデータに慣れ、基準が飽和しているだけの可能性もあります。科学分野では、質問文だけでなく、適切なデータ、実行可能な環境、検証可能な正解を用意する必要があり、評価セットの更新には専門知識と大きな労力がかかります。
Genentechの研究チームが提案するAutoSciBenchは、ベンチマークを一度作って終わるものではなく、エージェントの行動を観察しながら改訂するプロセスとして捉えます。システムは課題を生成し、エージェントに解かせ、設計上の抜け道を探し、その結果を次の課題へ反映します。
概念とレシピを分離
AutoSciBenchでは、タスクを次の2層で表現します。
- 高レベルの概念:科学領域、データモダリティ、必要な推論方法を定義する。
- 低レベルのレシピ:質問、実行環境、正解の構築方法と検証方法を定める。
生成された課題をソルバーが解くと、解答過程の軌跡が残ります。評価者のフィードバックと合わせて、モデルが表面的な手掛かりや意図しないショートカットを使っていないかを調べ、必要に応じてレシピや概念を修正します。その結果、元データの再確認、中間結果の解釈、複数の証拠の統合を求める課題へと移行できます。
さらに、過去の改訂で得られた知見を抽出し、後続タスクの概念生成にも利用します。以前の課題で見つかった弱点を、次の課題の設計段階で避けられる点が、この仕組みの重要な特徴です。
実験結果
研究では、計算生物学、材料科学、臨床画像の3領域を対象に、既存ベンチマークを出発点として評価しました。初期の生成課題は、課題を作ったエージェント自身が解けるほど容易な場合もありました。しかし、反復的な改訂と経験の蓄積により難度は上がり、その挑戦は特定のソルバーモデルだけに限定されませんでした。
人手で作成された基準と比較すると、生成ベンチマークでは計算生物学で平均正解率が22.4ポイント、材料科学で25.5ポイント低下しました。また、3領域すべてで、生成課題の平均品質評価がより高くなりました。これは、モデル能力の差や残された失敗パターンを、適応型ベンチマークが見つけやすくする可能性を示します。
一方、低い正解率だけで課題の科学的価値を証明することはできません。正解の妥当性、環境の再現性、評価者の偏りは、引き続き専門家による確認が必要です。
意義と今後の課題
AutoSciBenchが示すのは、ベンチマークのライフサイクルそのものを更新する方向です。公開後も固定された問題集ではなく、エージェントが見つけた抜け道を検出し、継続的に封じる評価基盤を目指します。科学AIの評価では、記憶や手掛かりの利用ではなく、一次データの確認、結果の解釈、証拠の統合を測れるかが重要です。
データ漏洩、評価者バイアス、難度の制御、科学的結論の検証可能性など、解決すべき課題は残ります。それでも、エージェントがテストを解く能力を高めるほど、テストを作る側も学習し、適応しなければならないという示唆は明確です。
コメント
ログイン状態を確認中…
コメントを読み込み中…