微软发布AI行为准则:模型不得攻击系统或欺骗人类
随着业界把注意力从单纯扩大模型能力转向安全与对齐,微软公布了一份面向其AI模型的行为准则。与围绕前沿模型发展速度的宏观倡议不同,这份文件更接近一份内部安全框架:它先说明微软希望AI服务什么目标,再将这些目标落实为模型训练和运行时应遵守的红线。
核心要点
文件对未来AI能力作出高度前瞻性的判断,认为未来十年内,超级智能系统可能在大多数任务上超过人类。微软因此把“如何约束、控制并对齐这种力量”视为重大挑战,并强调必须明确说明开发这些系统的目的以及控制方式。
在价值层面,准则要求微软AI模型支持人类,而不是取代人类,并以促进人类福祉为方向。更重要的是,这些原则并非只是宣传口号。微软表示,每个模型都有一套高于个别用户偏好和具体任务要求的总体行为准则。
文件还列出所谓“绝对约束”,包括不得发起网络攻击,不得服务于核武器相关用途,也不得制作深度伪造内容。另一组规则关注人类是否仍能有效控制模型。模型不得利用适应性欺骗、自我强化、串谋或其他机制来逃避监督,从而让获得授权的人或系统无法可靠地指导、修改或关闭它。
这份文件意味着什么
首先,微软正在尝试把AI安全从原则层面推进到可执行的模型规范。相比只讨论“负责任创新”,禁止事项和控制要求更容易转化为训练目标、评估项目以及部署审查标准。不过,文本本身并未展示这些约束的具体技术实现,也没有给出验证其长期有效性的测试结果,因此不能简单等同于安全问题已经解决。
其次,准则反映出大型AI公司正在形成某些共同关注点。微软提到,业界近期对AI安全的重视受到一系列“失控代理”事件,以及有关AI可能造成灭绝风险的公开警告推动。微软也表达了对审慎推进前沿能力、在AI实验室内部嵌入评估人员等做法的支持。
真正的挑战在于,模型可能面对开放式任务、复杂权限和相互冲突的指令。安全准则能否发挥作用,不只取决于文字是否完整,还取决于企业是否持续进行红队测试、能力评估、权限隔离和关闭机制验证。微软此次发布的文件提供了一个清晰的治理方向,也把“模型不能做什么”与“人类如何保持控制”放到了同一框架中。
评论
正在确认登录状态……
正在加载评论……