ExplorationBench、未知の「異星世界」でAIの探索能力を測定
導入
科学的発見は、既知の問題を解くことだけではない。既存の知識が通用しない領域では、AIは仮説を立て、実験を設計し、結果を読み取りながら理解を更新する必要がある。しかし、この能力を測定するのは難しい。正しい答えが得られても、それが本当の探索の結果なのか、事前学習データに含まれる関連知識を思い出しただけなのかを区別しにくいためだ。
ExplorationBenchは、この問題を実行可能な「異星世界」に置き換える。そこでは規則をプログラムで検証できる一方、一般的な知識とは意図的に食い違うため、記憶だけでは簡単に解けない。
ベンチマークの仕組み
構成要素はAlienCodeとAlienLogicという二つのサンドボックスだ。システムは完全で正確な仕様を最初から与えられるわけではない。探索中に環境とやり取りし、観測結果から規則を推測したうえで、探索に使っていない保留タスクを解く。
主な特徴は次の通りだ。
- 厳密な検証:世界の規則は実行可能であり、回答を基礎となる規則に照らして正確に判定できる。
- 常識への依存を抑制:規則が通常の知識と矛盾するため、一般的なプログラミングや論理の知識だけでは十分ではない。
- 不完全な情報:システムには誤りを含むマニュアル、タスクごとの環境フィードバック、専用のツール呼び出し形式が与えられる。何を信じ、何を実験で確かめるかが問われる。
- 未見タスクでの転移評価:探索後に新しい課題を解かせることで、単なる例の暗記ではなく、再利用可能な規則を学んだかを確認する。
評価から見えたこと
論文は10種類のAIシステムを評価し、性能の高いシステムが未知の規則を取得し、後続タスクに適用できることを示した。これは、既存情報の検索や想起とは異なり、相互作用を通じて一時的な世界モデルを構築できる可能性を示している。
一方、探索は直線的に改善するプロセスではなかった。同じシステムでも探索の軌跡によって結果が大きく変わり、長く探索すれば必ず良くなるわけでもない。追加の相互作用が停滞を招いたり、以前に得た改善を失わせたりする場合もある。したがって、実験回数だけでなく、証拠の選別、仮説の更新、探索を止める判断が重要になる。
意義と限界
ExplorationBenchの意義は、「AIは発見できるか」という抽象的な問いを、再現可能な実験に落とし込んだ点にある。実行可能な規則は正解の判定を容易にし、探索段階と未見タスクを分ける設計は、新しく得た知識の転移を測る手段になる。
もちろん、仮想サンドボックスは現実の科学研究を完全に再現しない。現実には観測ノイズ、資源制約、専門知識、長期的なフィードバックが存在する。それでも、未知の環境でAIがどの実験を選び、矛盾する情報をどう扱い、いつ探索を終えるのかを研究する基盤として有用だ。
重要なのは、AIを「どれだけ知っているか」だけでなく、「知らないことをどれだけ信頼性高く学べるか」で評価する視点である。
コメント
ログイン状態を確認中…
コメントを読み込み中…