返回文章列表
AI 安全

AI 安全护栏正在困住网络安全研究者?

阅读约 3 分钟

导语

AI 公司正在努力阻止模型被黑客用于自动化攻击、编写恶意代码或开发漏洞利用工具。但在网络安全领域,“危险能力”和“防御能力”往往共享同一套技术路径。TechCrunch 采访的多位安全研究者指出,当前由 OpenAI、Anthropic 等公司设置的访问审核与安全护栏,正在影响合法研究者确认漏洞、分析代码和构建防御方案的效率。

核心要点

  • 攻防边界很难切开。 NCC Group 首席科学家 Chris Anley 认为,让模型尝试验证某个 bug 是否可被利用,是判断漏洞是否真实且值得修复的重要步骤。但同一个提示既可能帮助防御者修代码,也可能给攻击者提供利用思路。
  • 护栏带来不确定性。 RemoteThreat CEO Chris Thompson 表示,即便进入 OpenAI 或 Anthropic 面向网络安全研究者的审核项目,模型也可能每天表现不同,研究者常常要花时间“说服”模型,而不是专注于漏洞本身。
  • 本地开源模型成为替代方案。 当云端前沿模型拒答或过度过滤时,一些团队会转向本地运行的开源模型。这样既绕开护栏,也减少将敏感漏洞信息上传到云服务的风险。
  • 不同研究者态度并不一致。 有人认为护栏严重影响工作,也有人表示自己只用 AI 做初步逆向、理解代码或生成辅助工具,真正的漏洞发现和武器化仍由人来完成。
  • 访问审核并非万能。 Anthropic 和 OpenAI 都提供面向网络安全研究者的特殊访问计划,但受访者认为,这些机制仍可能过窄、过慢或过于依赖大公司对“安全用途”的单方面判断。

为什么这件事重要

网络安全研究天然具有“双重用途”。发现一个未知漏洞,可以帮助厂商修补系统,也可能被政府、情报机构或犯罪团伙用于入侵。AI 模型进一步放大了这种张力:它能帮助防御者更快分析复杂代码,也可能降低攻击者构建工具的门槛。

因此,简单地把某些请求全部拦下,并不一定会提升整体安全。对合法团队而言,过度限制会拖慢漏洞确认和修复;对攻击者而言,他们仍可能使用无护栏的开源模型、本地模型或其他替代工具。结果可能是,负责任的研究者被约束,而不受约束的人继续前进。

更现实的路线或许不是取消护栏,而是把护栏做得更细:提供可审计、分级、稳定的专业访问;对滥用行为追责;同时保护研究者上传的敏感漏洞数据不被泄露或用于后续训练。AI 安全不只是防止模型“说错话”,也包括让真正承担防御责任的人能够有效使用它。

这场争论揭示了前沿模型治理的一个核心难题:当同一种能力既能修房子,也能当武器时,谁来决定谁可以拿到“锤子”?

来源:TechCrunch AI

评论

正在确认登录状态……

正在加载评论……

相关文章