返回文章列表
AI 安全

同样的字符,不同的权限:聊天模板控制令牌如何放大提示注入

阅读约 3 分钟

导语

提示注入通常被理解为模型读到了恶意文字,但这项研究把注意力进一步推进到分词器:同一串可见字符,可能被编码成一个模型预留的控制令牌,也可能被拆成多个普通子词。两种编码最终解码为相同文本,模型接收到的底层表示却并不相同,因此它们在“像不像一条系统或用户消息”这件事上,可能拥有截然不同的影响力。

核心发现

研究围绕伪造聊天模板标记展开,例如攻击者在不可信内容中插入类似 <|im_start|> 的标记。实验固定解码后的文字,并控制替换操作带来的额外令牌数量,从而尽量排除文本变化和长度变化的干扰。

  • 在三个开放权重模型家族中,把伪造标记从单个保留控制令牌改为普通子词序列后,InjecAgent 基准上的攻击成功率下降了39至66个百分点,且效果延伸到 AgentDojo 的多轮代理任务。
  • Qwen3-8B 的差距较小,约为8个百分点。研究认为,该模型即使看不到保留令牌,也能通过文本推理识别伪造的对话轮次;关闭推理模块后,差距扩大到50个百分点。
  • 嵌入分析显示,普通子词向量的均值无法复现保留令牌的作用,而在 Llama-3.1 上,使用与控制令牌最接近的普通令牌向量,反而可以恢复攻击效果。
  • 自适应攻击者能够搜索非保留标记,在四个模型家族中的三个找到具有相近嵌入表示的替代物。

这意味着什么

研究将控制令牌的“权威”定位到标记位置上的单个学习向量,而不仅是标记所对应的字节或文字含义。这个结论提醒开发者,简单地把控制标记当作普通文本、或只依据字符串匹配来过滤,可能无法覆盖真实攻击面。

从防守角度看,在处理外部内容前将潜在伪造标记强制编码为普通子词,是一种有价值的分词器侧缓解措施。不过,它并不能构成完整防线:模型可能凭借语义推理恢复攻击,自适应攻击者也可能寻找嵌入近邻。研究还审计了若干分词器配置,指出不少方案仍会暴露工具协议标记,而代理正是通过这些标记读取不可信工具输出。因此,防护范围不能只覆盖用户提示,也应覆盖工具返回值、协议边界以及多轮消息拼接流程。

总体而言,这项工作把提示注入防御从“过滤什么文字”扩展到了“模型以什么表示接收文字”。它为分词器设计、控制令牌管理和代理输入隔离提供了新的评估维度,但最终安全性仍需要与模型训练、权限控制和工具调用审计结合。

Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
模型内部信息何时真正有助于大模型安全?一项对表示工程的系统比较
AI 安全
cctest.ai
AI 安全

模型内部信息何时真正有助于大模型安全?一项对表示工程的系统比较

一项匹配评估比较了DPO、表示引导、内部探针与文本监控器在大模型安全控制和风险监测中的表现。结果显示,表示工程并非行为安全机制的替代品,但在低数据、低成本监测和后训练修复等场景具有独特价值。

阅读全文