AdvSim2Real:让网页智能体在对抗演化中学会抵御提示注入
导语
网页智能体的安全难点在于:它不能简单地把网页内容视为不可信噪声。用户要求往往需要依赖页面中的文本、按钮、表单和商品信息,但这些内容也可能被第三方植入“忽略原任务”“执行另一项操作”等指令。一旦智能体把页面指令误认为用户意图,间接提示注入就可能改变整个任务结果。
论文提出的 AdvSim2Real,试图把防御训练从静态样本对抗升级为持续的三方博弈。研究团队将任务、攻击方式和智能体放入一个冻结的网页世界模型中,让它们在模拟环境内共同演化,再观察训练出的能力能否迁移到真实浏览器。
核心要点
- 任务课程动态调整。 课程模块优先生成智能体大约一半时间能够完成的任务。太容易的任务很快失去训练价值,太难的任务又难以提供有效反馈,这种“中等难度”目标使训练持续聚焦于能力边界。
- 攻击者关注成功翻转。 对抗模块并非只生成看起来像攻击的文本,而是寻找能够把一次原本判定成功的运行变成失败的注入。这让攻击信号直接连接到任务结果。
- 三方共同演化。 智能体同时面对新攻击和历史攻击,任务分布也随智能体能力变化而更新,避免固定数据集在模型学会后迅速失去挑战性。
- 能力与安全并非简单冲突。 在150个网页任务上,4B智能体的干净完成率由74.89%升至81.33%,受攻击完成率由48.07%升至57.48%。面对训练时未使用的Kimi-K3攻击者,完成率由23.00%升至30.72%,相对提升33.6%。在真实浏览器的严格任务成功率也从25.56%升至44.44%。
意义与影响
这项工作的价值不只是“多训练一些攻击样本”,而是重新设计了训练信号:课程模块持续寻找值得学习的任务,攻击者持续寻找真正有效的攻击,智能体则在两者变化中学习区分用户目标与页面指令。对网页代理而言,这种机制比固定注入集合更接近真实世界中的适应性攻击。
不过,结果仍应被理解为特定实验设置下的证据。模拟器中的网页、任务和判定方式不可能覆盖所有真实网站;真实浏览器上的迁移结果也不等于已经解决部署安全问题。未来评估仍需要覆盖更多网站结构、工具调用和长期任务,并检验模型能否解释其拒绝页面指令的依据。
总体而言,AdvSim2Real展示了一条值得关注的路线:利用世界模型承载低成本的安全对抗训练,再把获得的能力迁移到真实环境。它将网页智能体的鲁棒性问题,从静态防御数据构建推进到了动态、可持续的攻防课程设计。
评论
正在确认登录状态……
正在加载评论……