Bounded Agents:用授权链约束多智能体系统的越权风险
导语
当大语言模型开始代表用户访问云服务、调用工具,甚至继续委托给其他智能体时,安全问题就不再只是“模型会不会被提示词注入”。更基础的问题是:一个被授予部分权限的智能体,能否把这些权限组合成超出原始任务的结果?论文《Bounded Agents》将焦点放在授权架构上,并提出 Agentic Principal Chain(APC)作为多智能体系统的安全控制模型。
核心要点
- 从静态权限转向会话状态。 传统方案往往在会话开始时配置权限,之后对每次请求单独判断。APC则保存已发生的动作、当前授权范围以及委托关系,让后续请求基于累积状态进行评估。
- 沿委托链限制权限。 当一个主体把任务交给另一个智能体时,子智能体不会自动继承完整权限。APC会继续传递并收紧授权范围,同时约束可用预算,避免权限在多跳委托中逐步扩张。
- 阻断危险组合。 某些单独看似合法的操作,组合起来可能产生数据泄露、破坏资源或操纵业务流程的结果。APC使用组合闭包思路,把先前动作纳入新请求的判断,而不是只检查当前调用本身。
- 把执行裁决放在模型之外。 模型可以提出行动,但最终授权由外部控制层执行。这意味着即使模型受到提示词注入影响,攻击能否落地仍取决于授权架构是否允许该动作。
- 提供形式化安全性质。 论文证明了“爆炸半径单调性”和“组合健全性”。后者的保证依赖完整的禁止组合规则集,以及串行化的准入流程,因此并非对所有并发场景都无条件成立。
评估结果
研究共评估3,154个实例,覆盖 InjecAgent、AgentDojo 和 Agent Security Bench 等测试。根据论文报告,在 AgentDojo 的四个领域中,数据外泄率由75%—100%降至0%;破坏行为由38.6%降至4.0%,操纵行为由90.5%降至12.1%。APC还拦截了 InjecAgent 的544个数据窃取案例,以及 Agent Security Bench 中全部破坏性案例。对于2至8跳的委托链,论文验证了99/99条链路;授权检查在第99百分位的延迟为0.24毫秒。
意义与边界
APC的价值在于重新划分了模型能力与系统权限的边界:模型负责提出计划,安全层负责判断行动是否仍处在可接受范围内。这种设计尤其适合工具调用、云资源访问和多智能体协作等场景,也为审计和责任追踪提供了更明确的状态记录。
不过,实验结果不能等同于所有真实部署都能获得同样保护。组合健全性依赖于禁止规则是否完整,也依赖请求按序进入授权系统;如果策略遗漏了某类危险组合,架构本身无法自动发现它。对工程团队而言,下一步重点仍是建立细致的权限模型、委托预算和风险组合规则,而不是单纯期待更强的模型自行识别越权行为。
评论
正在确认登录状态……
正在加载评论……