英国AISIとEvalEval、大規模モデル評価の再現性を高める
はじめに
大規模モデルのベンチマークスコアは、研究上の判断だけでなく、製品評価や政策議論にも利用されるようになった。一方で、同じベンチマーク名が使われていても、プロンプト、推論時の計算量、再試行の扱い、フィードバックの有無、集計方法が異なることは珍しくない。そのため、表面上は同じ指標でも、スコアを単純に比較できない場合がある。
英国AI安全研究所(AISI)とEvalEval Coalitionは、この問題に対して評価結果の記録方法と公開基盤から取り組んでいる。今回の協力の次の段階では、AISIが一部の評価手法と結果をEvalEvalの Evaluation Cards で公開する。結果の検証情報、実験設定、解釈に必要な文脈をまとめ、AISIの論文「How Inference Compute Shapes Frontier LLM Evaluation」と併せて提供する形だ。
主なポイント
- 5つのベンチマークを収録。 HealthBench、FrontierMath、Humanity’s Last Exam、SWE-Bench Pro、Terminal-Bench 2.0が主要実験の対象となっている。
- 6つのフロンティアモデルを対象。 Claude Opus 4、Claude Opus 4.5、Claude Opus 4.6、GPT-5、GPT-5.2、GPT-5.4の結果が含まれる。関連するCyber CTFsとThe Last Onesは、異なる一部重複のモデル集合を用いる。
- 最終スコア以外の情報も扱う。 Evaluation Cardsは、ベンチマークのメタデータ、評価実行データ、モデル情報、設定を共通の形式で整理する。
- 対話記録が分析を助ける。 複数回の試行やフィードバックを含む課題では、最終的な正解率だけでなく、どのように結果へ到達したかを調べられる。
- 共通スキーマを採用。 Every Eval Ever(EEE)は、論文、リーダーボード、リポジトリなどに結果が分散することで生じる情報不足を減らすことを目指す。
評価プロトコルが重要な理由
資料では、Humanity’s Last Examを例に、推論時の計算量と評価プロトコルによって性能の見え方が変わることを示している。ある設定では、モデルが各試行の後にオラクルから正誤フィードバックを受ける。利用できるトークン数が増えると、モデルは追加の課題を解けるようになる場合がある。
ここで重要なのは、特定のプロトコルが常に優れているという主張ではない。モデルが再試行できるのか、正誤を知らされるのか、どの程度の推論を許されるのかが、結果の一部になるという点だ。タスクの版、推論上限、フィードバック方式、成功例の集計方法が公開されていなければ、報告間の差がモデル能力によるものか、実験条件によるものかを判断しにくい。
意義と影響
今回の協力は、新しいランキングを追加するというより、評価結果を検証可能な形で残すための基盤整備に意味がある。検証済みの結果と設定情報を同時に公開すれば、研究者は個別研究を詳しく確認し、他の報告と条件を揃えて比較できる。既存の報告に詳細が不足している場合にも、AISIの公開データは解釈のための参照点になる。
モデル開発者はEEEを使って検証済み結果を体系的に報告でき、ベンチマーク開発者はベンチマーク情報と実行データを共有できる。評価、ガバナンス、政策の研究者は、モデルやベンチマークを軸にEvaluation Cardsを調べ、評価報告の状況を分析できる。
もちろん、共通形式を導入しただけで、すべての評価が直ちに再現可能になるわけではない。また、異なる設定で得られたスコアが自動的に比較可能になるわけでもない。現実的な効果は、条件の違いを見つけやすくし、単一の数字を集めるだけでなく、その数字が生まれた過程を研究対象にできる点にある。
コメント
ログイン状態を確認中…
コメントを読み込み中…