AIエージェントは開放型の科学発見に近づいたが、判断力には課題が残る
はじめに
AIによる科学発見の成果は、評価指標や探索範囲が明確な場合に特に伸びてきました。しかし、実際の研究では、何を調べるべきか、どの異常を追跡するか、いつ仮説を捨てるか、そして得られた結果が本当に重要かを判断しなければなりません。これは、決められたベンチマークを解く作業とは異なります。
論文「Can AI Agents Make Open-Ended Scientific Discovery? Evidence from Station」は、こうした開放型の研究をAIエージェントがどこまで進められるかを検証しました。中間目標や正解が与えられない状況で、エージェントが探索を維持できるかが焦点です。
主なポイント
- より開放的な実験設定。 研究チームは、ICLRの口頭発表3本をもとに課題を作成しました。エージェントには研究課題と実験設定だけを与え、元論文の結果は隠しました。さらにウェブアクセスも無効化し、検索結果ではなく自分たちの実験と記録から研究を進めさせています。
- 既知の発見をより多く回収。 元論文の結果を個別の基準に分解し、どれだけ再発見できたかを比較しました。Stationは平均62.7%の基準を回収しました。Codex Multiagent-v2は15.4%、AI Scientist-v2は設定により14.4〜20.6%でした。累積実験時間はそろえられていますが、モデル構成やトークン予算は異なるため、普遍的な順位ではなく、この実験条件での結果として解釈する必要があります。
- 探索を続けるための仕組み。 Supervisorは研究の方向性を支援し、周期的なMeta Reflectionは進捗と方針を見直させます。分析では、両方を組み合わせることで研究範囲と継続性が改善し、難しい問いを早々に放棄して簡単な課題へ移る傾向が抑えられました。
- 追加課題でも人間の発見と一致。 参照論文を用意しない2つの探索課題では、後に人間の研究者が報告した発見と近い結果も得られました。潜在学習の課題では、LoRAの訓練を初期層に限定することで、失敗していた特性転移を回復できる可能性を見いだしています。
意義と限界
Stationが示すのは、AI研究を一度きりの質問応答ではなく、複数エージェントが実験し、相互に結果を確認し、共有知識を次の探索に使う継続的なプロセスとして設計できることです。コードと研究記録の公開も予定されており、成功だけでなく失敗の経緯も検証できます。
ただし、AIが独立して科学を行えると証明されたわけではありません。課題、実験空間、評価基準は人間が設計しています。また、結果を再現することと、その結果が重要だと判断することは別です。研究でも、エージェントが人間なら価値が低いと考える問いに相当な資源を費やす問題が指摘されています。
Stationは完成形というより、能力の境界を測る実験です。次の課題は、価値のある問いを選び、意味のある異常を認識し、成果の乏しい方向を適切に打ち切る科学的判断力でしょう。
コメント
ログイン状態を確認中…
コメントを読み込み中…