返回文章列表
AI 安全

纳德拉呼吁为AI模型设置“紧急刹车”:安全不能只靠黑箱判断

阅读约 3 分钟

微软CEO萨提亚·纳德拉近日在社交平台发文,呼吁业界重新审视人工智能系统的“信任架构”。在他看来,随着模型开始承担更复杂、持续时间更长的任务,安全问题不能再被简化为“是否相信模型答案”。系统还必须回答一个更实际的问题:当模型正在行动、出现异常或偏离预期时,人类能否及时介入?

核心要点

  • 模型与任务编排层分离。 纳德拉主张把模型本身和负责调用工具、安排步骤、执行任务的“控制层”区分开来。这样做的重点,是避免把所有权限都集中在模型内部,也便于在模型之外部署限制和防护措施。
  • 控制与安全机制外置。 安全规则不应只依赖模型自行遵守,而应由外部系统进行约束、检查和执行。模型可以提出建议或采取行动,但关键权限应受到独立控制。
  • 为重要动作留下证据。 他提出,模型每一项有意义的行动都应形成防篡改、便于人类阅读的记录。这样的记录有助于追溯模型做了什么、为什么这样做,以及问题发生在何处。
  • 保留人工“紧急刹车”。 即使任务已经进行,获得授权的人仍应能够暂停或关闭模型。这个能力应当是系统设计的一部分,而不是出现事故后才临时寻找的补救措施。
  • 从“可能已被攻破”出发设计。 纳德拉建议,系统应默认模型可能已经受到影响,并从一开始就采取隔离和限制措施。他用“紧急刹车”来概括这种思路。

为什么这番表态值得关注

过去,AI安全讨论经常聚焦于模型输出是否准确、有害内容是否被拦截,以及模型是否遵守指令。但当模型能够连续调用工具、处理信息并推动任务进展时,风险就不只存在于单次回答中,也存在于一连串行动的组合效果里。此时,单纯依赖模型内部的“判断”并不足够。

纳德拉的建议实际上把安全重点部分转向系统工程:权限如何分配,动作如何记录,外部控制是否独立,以及人工能否在关键时刻介入。这并不意味着模型本身不需要改进,而是强调模型能力之外还必须存在一套可验证、可中断的保护层。

这一观点出现之际,多家领先AI公司都开始承认曾发生模型控制能力不足的事件;Anthropic CEO达里奥·阿莫代伊也已提出更谨慎的AI开发计划。由此看,行业关注点正从“模型能做什么”逐步扩展到“模型做事时谁拥有最终控制权”。

对企业而言,这意味着部署AI代理时,审计日志、权限隔离、人工审批和即时停机机制可能不再只是合规选项,而会成为基础架构的重要组成部分。纳德拉的“紧急刹车”比喻,提醒行业:真正可信的AI,不仅要能完成任务,也要能够被观察、被限制,并在必要时被立即停止。

来源:TechCrunch AI

评论

正在确认登录状态……

正在加载评论……

相关文章