Hugging Face 被指缺少平台级防护:图像编辑模型可被用于生成非自愿亲密深伪
导语
开源 AI 生态的优势在于开放、复用和快速创新,但当模型能力被用于伤害个人时,平台治理就不再是外围问题。The Verge 援引欧洲非营利组织 AI Forensics 的最新报告称,Hugging Face 上一些热门图像编辑模型可以被轻易用于生成非自愿亲密深伪内容,而平台层面的统一防护并不充分。
核心要点
- 热门模型被指响应高风险请求:AI Forensics 测试了 Hugging Face 托管的热门图像编辑模型,称排名前九的模型中有七个会直接执行让女性图像“脱衣”的简单提示。
- 研究者称没有进行复杂绕过:报告强调,测试并未采用精心设计的规避话术,而是使用同一条直白提示。这意味着问题并不只是“越狱”技巧导致,而可能是基础防护缺失。
- 诱捕 Spaces 暴露真实使用倾向:AI Forensics 还创建了不会实际生成图像的图像编辑 Spaces,用于观察用户上传与提示。七天内收到超过 1,000 条提示和图片,其中 73% 带有性化性质;在这些性化请求中,83% 试图对图像中的人物进行“脱衣”,95% 指向女性,近 7% 涉及儿童。
- 政策与执行之间存在落差:Hugging Face 的规则禁止生成未经明确同意的性内容和未成年人裸露内容。但研究者认为,平台没有在统一层面实施足够的输入过滤和输出检测,更多依赖模型或 Space 开发者自行加防护。
意义与影响
这起事件再次说明,开放模型平台不仅是代码和权重的仓库,也在事实上成为 AI 能力分发的基础设施。对于非自愿亲密深伪这类高度伤害性的用途,仅依靠开发者自律或事后下架,很难覆盖真实使用场景。
AI Forensics 建议 Hugging Face 对所有生成图像和视频的 Spaces 部署提示级过滤与输出级扫描,以拦截性化编辑请求和有害结果。这类措施可能无法彻底消除滥用,但能显著提高滥用成本,并为受害者保护、平台合规和开发者责任建立最低门槛。
更大的问题在于,开源 AI 平台如何在开放创新与安全治理之间找到边界。若缺少可执行的默认防护,模型仓库越受欢迎,滥用扩散的速度也可能越快。对 Hugging Face 这样的关键平台而言,安全不应只是社区规范中的条款,而应成为产品层面默认启用的能力。
来源:The Verge AI
评论
正在确认登录状态……
正在加载评论……