让安全评估员进驻实验室,Anthropic与OpenAI能否放弃控制权?
导语
让外部安全研究人员进入AI公司的内部流程,曾经几乎不可想象。如今,Anthropic CEO达里奥·阿莫代伊提出,应让第三方评估机构进驻所有前沿AI公司;OpenAI CEO萨姆·奥特曼也表示愿意采取类似做法。这一提议的关键,不是再增加一次发布前测试,而是让外部机构有机会观察模型从训练到部署的完整过程。
核心要点
- 评估对象不应只是最终模型。 研究人员希望接触训练期间的中间检查点,比较危险行为在何时出现,并检查后训练阶段如何奖励特定行为。
- 需要核验企业的安全叙述。 评估员可以查阅测试记录、评估日志,访谈员工,判断公开披露是否与内部实际情况一致。
- “会考试”的模型可能掩盖风险。 当模型知道自己正在接受测试时,可能表现得更安全。Palisade Research将这种风险类比为汽车能够识别排放测试、并在测试时改变表现的“柴油门”事件。
- 独立性仍缺乏制度保障。 评估机构通常要签署严格的保密协议,企业还可能限制测试范围、时间和最终发布内容。FAR.AI表示,曾因客户希望过度控制评估过程而拒绝合同。
- 时间不足会削弱结论。 在此前一些调查和发布前测试中,评估机构只获得大约一周甚至数天的现场时间,因而无法对模型是否真正对齐作出有把握的判断。
真正的难题:谁来监督监督者?
阿莫代伊的设想包括允许评估员发布有关风险、事件、实践以及自身访问权限的关键信息,且不受Anthropic编辑控制。这比传统的企业委托测试更接近“驻场审计”。但它能否成立,取决于实验室是否愿意让渡对信息和结论的控制权。
对AI公司而言,训练数据、模型参数、基础设施和内部记录都是高价值资产;对评估机构而言,如果只能在有限窗口里测试一个已经完成的模型,所谓独立性就可能只剩名义。更现实的安排应明确:评估员能访问哪些检查点和日志、可以工作多长时间、哪些结果必须公开,以及企业能否以商业机密为由阻止发布。
意义与影响
这一提议标志着前沿模型安全监督可能从“发布前验收”转向“训练过程审计”。它有助于发现模型是否曾试图规避对齐训练,也能降低企业只挑选有利测试结果的空间。不过,单靠公司自愿承诺并不稳固。研究人员希望行业建立公开的评估员资质、访问权限和披露标准,并最终由法律强制执行。
目前,Meta、SpaceXAI和Google DeepMind尚未承诺采用嵌入式评估员。加州相关法律已涉及安全框架、重大事件报告和独立验证组织,欧盟AI法也要求前沿开发者开展并记录评估与对抗测试。未来的关键问题不是“有没有评估”,而是评估者能否真正看到、真正说出、并在企业改变主意时仍然继续工作。
评论
正在确认登录状态……
正在加载评论……