黑盒大模型也能被“操控解码”?一项研究揭示文本接口的安全漏洞
生成式大模型的安全对齐,通常被理解为模型在面对有害请求时能够拒绝回答。但一篇发表于 Hugging Face Daily Papers 的新论文指出,即使攻击者看不到模型权重,也拿不到完整的 token 概率,只要接口允许反复采样并支持助手前缀续写,仍可能通过控制生成过程削弱安全机制。
问题:黑盒接口隐藏了什么
许多既有的解码攻击方法依赖 logits、token 概率或模型权重。它们可以直接寻找更容易通向目标输出的下一个 token,因此难以迁移到只返回文本的商业 API。研究团队尝试从多次采样结果中反推出可用的分布信息,但这种估计天然存在两个困难:有限样本会造成稀疏和噪声,而如果每生成一个 token 都重复采样,查询成本又会迅速上升。
论文的关键观察是,成功的越狱轨迹并不一定要求在每个位置都改变生成分布。较大的分布变化往往集中在少数位置。基于这一点,研究提出了一套面向文本续写接口的选择性控制框架,核心思路是把昂贵的分析资源投入到更可能影响后续输出的节点。
三个组成部分
- 基于样本的分布重建:综合多次生成结果,并为没有观察到的候选动作引入先验,从稀疏样本中获得一个可用于控制的近似信号。
- 风险门控残差控制:根据不断增长的回答前缀判断当前阶段是否值得进行分布重建和修改,而不是对每个位置一视同仁。
- 推测式多 token 执行:先生成一段候选前缀,再让目标接口验证;对于不需要干预的部分直接接受,从而摊薄目标模型调用成本。
这套设计体现出一个重要转变:攻击者不再试图完整还原模型的概率分布,而是寻找足以改变轨迹的局部信息。对黑盒系统而言,局部、稀疏的控制可能比精确估计整个词表更现实。
实验与安全启示
论文在四个目标端点和三个基准上进行评估,并报告该方法在多数对比中取得最高平均分。不过,素材没有提供具体端点、基准名称、成功率或查询次数,因此不能据此判断方法对所有模型都同样有效。研究结果更适合被理解为一种风险信号:只返回文本并不能保证生成分布无法被间接推断,支持前缀续写和高频重复采样的接口尤其需要谨慎设计。
对防御方而言,可能的方向包括限制异常密集的重复采样、审查带有助手前缀的续写请求、监测连续会话中的输出轨迹,并在安全过滤之外增加对生成行为的整体分析。与此同时,研究也说明安全评估不能只测试单轮提示词拒答,还应考虑黑盒查询、跨轮累积和生成过程操控等场景。
这项工作并不意味着所有文本 API 都会被轻易突破,但它清楚展示了一个原则:当接口暴露足够多的可重复行为时,隐藏概率并不等于隐藏决策过程。模型提供方需要在可用性、可调试性与攻击面之间重新权衡。
评论
正在确认登录状态……
正在加载评论……