Anthropic披露大规模模型蒸馏活动:能力保护进入攻防阶段
导语
大模型之间的竞争,正在从公开评测和产品体验延伸到模型能力本身的获取与保护。Anthropic最新报告称,过去几个月,多个位于中国的AI团队持续尝试通过“蒸馏”方式收集Claude的输出,活动规模和技术复杂度都在上升。
Anthropic将这些行为归纳为五起活动,累计观察到的交互接近2亿次。报告称,相关活动瞄准了Claude的多项关键能力,包括智能体工作流与工具调用、编程、数据分析以及逻辑推理。
核心要点
- 蒸馏目标不只是答案。 蒸馏通常通过大量查询收集教师模型的输出,再用监督微调训练较小模型。此次活动尤其关注模型的推理过程和工作痕迹,而非单纯复制最终答案。
- 攻击者尝试绕过思考过程保护。 Anthropic表示,Claude通常只向用户展示概括性的思考摘要,不直接提供内部思维链。但报告称,部分攻击者通过特殊提示包装请求,例如将提取工作记忆伪装成翻译任务,试图让模型输出更详细的推理痕迹。
- 阿里巴巴相关活动规模最大。 Anthropic称,5月至7月间,一项被归因于阿里巴巴的活动产生约1.51亿次交互,涉及约3500个账号,峰值接近每天300万次。由于这些账号使用了同一个固定提示词,Anthropic将其视为一个统一的训练材料收集行动,并认为其目标与Qwen系列模型有关。
- 月之暗面相关活动涉及敏感场景。 报告称,另一项与Kimi开发商月之暗面有关的活动,在10天内通过约5000个账号转发近30万次请求,主要针对Claude Opus。其中一项请求涉及分析闭路电视画面,判断目标是否存在“异常行为”。Anthropic还称,请求网络似乎与中国军方相关,但这一点属于报告中的归因判断。
意义与影响
这份报告首先说明,模型蒸馏已从零散的技术尝试发展为可规模化运行的组织活动。多账号、固定提示词和自动化请求,让服务提供商很难仅凭单个用户行为识别真实目的,也迫使模型厂商把账号关联、流量模式和提示词特征纳入安全检测。
其次,推理过程成为新的竞争资产。若攻击者能够持续获得高质量的中间步骤,就可能减少训练更小模型所需的时间和成本。不过,报告披露的是Anthropic对请求来源和意图的判断,并不等于证明相关模型已经完整复制了Claude的能力,也没有说明这些材料最终如何被使用。
对行业而言,问题的难点在于防护边界:模型需要提供足够透明的解释,用户又可能借此反向提取训练信号。未来,模型访问权限、输出策略、异常流量识别以及跨公司共享的滥用情报,可能成为能力保护的重要组成部分。Anthropic此前曾披露类似问题,OpenAI也曾将相关活动归因于DeepSeek,表明这已不再是单一公司的个案。
评论
正在确认登录状态……
正在加载评论……