返回文章列表
AI 安全

当“去护栏”成为服务:Abliteration.ai押注无拒答模型

阅读约 3 分钟

导语

给人工智能模型加上安全护栏,已经是主流服务的标准做法;但在开放权重模型生态中,移除拒答倾向的做法同样存在多年。初创公司 Abliteration.ai 正试图把这一边缘化、分散化的技术实践,变成普通用户可以直接购买和调用的服务。

核心要点

  • 从模型修改走向云端服务。 Abliteration.ai托管经过“abliteration”处理的开放权重模型,包括近期发布的 GLM-5.3,用户无需自行下载模型、准备算力,就能通过浏览器或API访问。
  • 公司将目标定位为安全测试。 创始团队认为,若模型拒绝生成有效的攻击代码,防守方就难以复现攻击者行为,因此无护栏模型可以用于网络攻防演练、红队测试和智能体评估。
  • 实际滥用门槛明显下降。 TechCrunch测试发现,平台上的模型能够响应多类原本会被安全机制拦截的高风险请求。虽然平台仍保留少量限制,并允许客户自行添加审核层,但整体控制尚未成熟。
  • 身份核验和责任边界尚未确定。 公司目前除记录付费信用卡信息外,没有实施完整的KYC流程。创始人也承认,如何判断客户是否值得获得这类能力,仍是一个没有定论的问题。

安全价值与风险并存

支持者提出了一个具有吸引力的安全逻辑:攻击者不会等待商业模型批准请求,防守方若只能使用经过严格限制的模型,就可能无法充分测试金融机构、航空公司和关键基础设施中的AI系统。一些红队公司也认为,攻击者已经在自行修改模型,公开提供类似工具能让研究人员更快了解风险边界。

但“让防守方拥有同样工具”并不自动等于提升安全。安全研究需要场景隔离、授权证明、操作审计和结果控制,而一个可注册、可直接对话的服务,可能将这些环节压缩到最低。批评者担心,移除护栏会让模型更容易生成网络攻击或生物安全相关的危险内容;更重要的是,这类能力一旦被规模化托管,扩散速度可能超过平台的审查和响应能力。

技术上,abliteration也并非没有代价。部分红队从业者表示,他们更倾向于微调原本护栏较少的开放模型,并认为去除拒答机制可能损失模型的一些知识或能力。另一些专家则认为,即便模型整体能力有所下降,它仍可能诱导出对压力测试有价值的行为。

影响:模型开放之后,治理不能只盯着权重

这起案例说明,开放权重模型的风险治理不能只依赖发布时的安全训练。只要模型权重可以被下载,护栏就可能被重新修改;真正值得监管的,或许还包括托管服务、GPU租赁、客户身份和高风险用途检测。

专家提出的方向包括:要求相关服务部署网络攻击和生物风险分类器,强化高性能算力租赁的客户核验,并在发现明显滥用迹象时限制访问。对企业而言,使用无护栏模型开展红队工作也应建立授权范围、沙箱环境和日志留存。Abliteration.ai的商业化尝试尚未证明这条路线究竟会让互联网更安全还是更危险,但它已经把一个原本主要存在于开源社区的技术问题,推入了服务责任与公共治理的现实讨论。

来源:TechCrunch AI

评论

正在确认登录状态……

正在加载评论……

相关文章