别让智能体自己当裁判:OBPE把治理移到工具边界之外
导语
当智能体直接继承用户凭证时,它获得的是用户可达的数据范围,却没有用户在真实工作中依赖的职责判断。只要一次工具调用符合权限检查,智能体就可能读取过多记录,把隐藏指令或敏感信息带入上下文,甚至完成超出任务目标的操作。论文《If Agents Were Angels, No Governance Would Be Necessary》提出的 OBPE,试图把关键治理环节从模型推理中移出,放到一个更可信的工具边界上。
核心做法
OBPE(Out-of-Band Policy Enforcement,即带外策略执行)并不是再给提示词增加几条规则,而是在智能体与后端服务之间部署策略层,主要完成四类工作:
- 先授权再调用:检查操作类型、目标资源以及调用者身份,确认请求是否处于允许范围。
- 收窄查询:在请求抵达 Jira、ServiceNow 等后端前,修改或限制查询条件,避免模型一次性获取全部可达数据。
- 处理返回结果:按记录、字段或具体值过滤响应,也可以对敏感内容进行遮蔽,让未获授权的信息不进入模型上下文。
- 执行语义拦截:即使操作本身已获授权,也可根据参数值或外部状态拒绝请求,或将其暂挂等待处理。
论文还区分了两层策略:数据策略所有者设定最大授权范围,智能体策略只能进一步收紧,不能扩大权限。作者在一定条件下证明,策略组合的顺序不会改变最终计划,智能体侧规则也无法突破授权上限。
测试结果与边界
作者发布了一个简化的 HTTP 代理原型,并用 Cedar 策略核心及一致性测试连接策略模型。在 Jira 和 ServiceNow 模拟环境中,研究比较了四个模型在有无 OBPE 时的表现,测试包含 20 个自适应红队任务,共进行 3,621 次试验。研究将以下情况视为轨迹失败:受保护数据进入上下文、答案出现精确敏感值,或被禁止的效果已经完成。
启用 OBPE 后,失败率从 57.6% 降至 0.2%;按测试簇加权后,降幅为 41.2 个百分点,95% 置信区间为 27.7 至 54.9 个百分点。与此同时,任务履约率由 79.1% 降至 60.9%,但“安全且有用”的配对完成率上升了 21.8 个百分点,区间为 9.5 至 35.2 个百分点。这说明治理的价值不只是“全部拒绝”,而是在安全与可用之间重新分配风险。
不过,论文并未把 OBPE 描绘成完整的安全证明。某些回答可能通过未进入上下文的信息重构出敏感值,或者利用被过滤结果的行数作为侧信道。因而,一次执行中的字段删除并不等于实现了严格的信息非干扰性。写入控制、持久化审批,以及时间和聚合策略也不在本次评估范围内。
意义与影响
这项工作的核心启示是:智能体治理不能只依赖提示词,也不能把“请求通过身份认证”误认为“行为符合业务意图”。对于企业系统,更稳妥的架构是让模型负责提出行动建议,让外部策略层决定它能看什么、能传什么、能否执行。
OBPE的代价同样清晰:更严格的查询和响应整形会降低部分任务的完成率,策略设计还必须防范计数、错误信息和多轮交互造成的间接泄露。未来若要走向生产环境,仍需把读控制扩展到写操作、审批流程、历史状态和跨请求关联分析。它更像是一道必要的基础边界,而不是智能体治理的终点。
来源:arXiv
评论
正在确认登录状态……
正在加载评论……