返回文章列表
模型评测

Google DeepMind试点“双盲”AI评测:让模型和题目彼此不可见

阅读约 2 分钟

面对能力快速提升的AI模型,如何证明一次评测测到的是真实能力,而不是模型“提前看过答案”,正成为行业治理中的关键问题。Google DeepMind于2026年8月27日宣布,正与新加坡人工智能安全研究所、OpenMined、AVERI和MLCommons合作,试点面向一款Gemini Flash Lite模型的“双盲”评测。

导语:评测可信度正在成为基础设施问题

模型基准测试类似于高风险考试。如果模型在正式测试前接触过题目、提示词或相近数据,就可能针对测试进行优化,最终得分却不能准确代表其泛化能力。这种现象通常被称为基准污染。过去,外部机构和模型提供方主要依靠不记录日志、合同约束以及内部流程来保护测试内容,但这些措施并不能完全替代技术上的隔离与验证。

核心要点

  • 双方数据同时保密:评测机构不需要交出完整测试集,Google也无需向外部机构提供模型权重。
  • 依托机密计算环境:项目使用Google Cloud机密计算体系中的Confidential Space,将模型运行和评测数据限制在可验证的“密码学盒子”内。
  • 降低提前适配空间:Google无法看到评测提示词,评测方无法看到Gemini模型权重,从机制上减少模型针对题目进行优化的机会。
  • 面向敏感场景:这类方法尤其适合网络安全评测以及政府机构使用的高敏感度测试。
  • 仍处于试点阶段:目前披露的是方法和合作框架,不能据此推导模型能力或安全表现已经得到全面证明。

意义与影响

“双盲”评测解决的是外部评测长期存在的信任难题:评测方希望独立验证模型,模型提供方则需要保护商业机密和知识产权。通过密码学证据确认数据和模型分别处于受保护状态,双方可以在不互相交付敏感资产的情况下完成测试。这比单纯依赖承诺或合同,更接近可审计的技术保障。

不过,安全执行环境并不等于评测本身自动公正。测试集设计、指标选择、运行配置、结果解释以及参与机构的独立性,仍会影响结论。未来行业还需要公开更多方法细节和审计方式,并验证不同模型、不同评测类型下的可复现性。如果这些条件能够逐步建立,双盲评测可能成为高风险AI系统监督的重要基础设施,帮助政策制定者、研究者和企业更有依据地理解模型表现。

来源:Google DeepMind

评论

正在确认登录状态……

正在加载评论……

相关文章