記事一覧へ戻る
モデル評価

Google DeepMind、モデルと試験問題を隠す二重盲検AI評価を試験導入

読了目安 3 分

AIモデルの能力が高まるほど、評価結果が本当に未見の課題に対する能力を示しているのかが重要になる。モデルが試験問題や類似データを事前に学習していれば、ベンチマークの得点は実力を過大評価する可能性がある。Google DeepMindは2026年8月27日、こうした問題に対応する「二重盲検」評価の試験導入を発表した。

この取り組みには、シンガポールAI安全研究所、OpenMined、AVERI、MLCommonsが参加する。機密性のあるベンチマークを使い、Gemini Flash Liteモデルをプライバシー保護環境で評価する計画だ。

何が二重盲検なのか

これまで外部評価では、評価機関がテスト用プロンプトをモデル提供者に渡すか、提供者がモデルの重みを評価機関に渡す必要があった。前者は問題が将来のモデル最適化に利用される懸念があり、後者は知的財産の流出リスクを伴う。二重盲検方式は、この交換を避けることを狙う。

  • 評価機関はGeminiのモデル重みを見ない。
  • Googleは評価用の質問やプロンプトを見ない。
  • 実行処理はGoogle Cloudの機密コンピューティング基盤にあるConfidential Spaceで保護する。
  • 暗号学的な証拠により、モデルと評価データが意図した環境内に留まったことを確認する。

ベンチマーク汚染への対策

ベンチマーク汚染は、モデルが評価問題を直接、または類似した形で事前に見ている状態を指す。契約上の守秘義務、ログを残さない運用、アクセス制限はこれまでも使われてきたが、運用者の約束だけに依存する部分が残っていた。暗号学的に隔離された実行環境は、双方が相手の機密情報にアクセスできないことを技術面から補強する。

この仕組みは、サイバーセキュリティ評価や政府機関が扱う高機密のテストなどで特に意味を持つ。外部の研究機関がデータ主権を保ったまま先端モデルを検証できれば、モデル提供者の内部テストだけでは見つけにくい盲点を調べやすくなる。

期待と限界

重要なのは、二重盲検が評価の信頼性を支える土台であって、評価の公正さを自動的に保証する仕組みではない点だ。テストセットの設計、指標、実行条件、結果の解釈、参加機関の独立性は依然として結論を左右する。今回もあくまで試験導入であり、さまざまなモデルや評価分野で再現性を検証する必要がある。

今後、方法の詳細や監査手順が広く共有されれば、二重盲検評価はAIの安全監督における新たな基盤となる可能性がある。モデルの実力と、事前にテストへ適応した結果を区別するための、より検証可能な仕組みとして注目される。

出典:Google DeepMind

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Video-IFBench、動画マルチモーダルモデルの指示追従を検証
モデル評価
cctest.ai
モデル評価

Video-IFBench、動画マルチモーダルモデルの指示追従を検証

Video-IFBenchは、動画を正しく理解できるかだけでなく、視覚・音声・意味・形式・条件分岐を含む複雑な指示を守れるかを評価する。20以上の近年のMLLMを対象にした評価では、動画における指示追従の難しさが示された。

続きを読む
CCTest · Blog
AnTrapが明らかにするAndroid GUIエージェントの実行時の脆弱性
モデル評価
cctest.ai
モデル評価

AnTrapが明らかにするAndroid GUIエージェントの実行時の脆弱性

AnTrapは、解決可能なAndroidタスクの実行途中に現実的な実行時異常を注入し、GUIエージェントの頑健性を評価する。調査では多くのモデルで性能が低下し、学習で修正できる罠と、深い推論限界に由来する失敗が分かれた。

続きを読む