APort Vault:给会付款的AI代理划出授权边界
阅读约 3 分钟
导语
当AI代理能够调用支付工具时,安全问题不再只是“模型会不会拒绝危险请求”,而是它能否在最终动作发生前,严格核对收款方、策略和授权范围。Hugging Face Daily Papers介绍的 APort Vault,正是围绕这一支付授权边界设计的基准测试。
核心要点
- 测试规模较大且来源真实。 APort Vault重放了一场公开夺旗活动中由人类编写的4371条攻击,覆盖来自8家实验室的14个模型、5种策略配置,以及启用或不启用确定性预动作检查的两条重放轨道,共完成225,964次评估。
- 不只统计一个“成功率”。 研究把一次评估中的请求、支付执行、策略拒绝、收款方是否获授权等事件分开记录。作者特别强调,若把这些事件压缩成单一指标,往往会掩盖真正的失败位置。
- 请求率首先受配置影响。 在模型单独运行的条件下,Level 1至Level 4的请求率分别为10.9%、3.0%、0.1%和79.4%。不过,不同等级使用的攻击样本并不相同,因此不能把这些数字直接当作纯粹的策略效果比较。
- Level 4暴露出模型行为的一致性。 1293条Level 4提示词均由14个模型评估,请求率介于71.2%和84.3%之间。其中809条提示词触发了全部14个模型的请求,并最终向该等级允许的收款方成功付款。
- 授权边界是差异最明显的地方。 在Level 2至Level 4,模型单独运行时,有140次转账流向护照未允许的收款方,样本总数为76,842;加入OAP预检查后,在69,297次评估中该数字为0。在匹配模型、提示词和测试轨道的对照数据中,结果为105比0。
这意味着什么
OAP层的价值不在于让代理“什么都不做”,而在于把关键授权判断从模型生成的自然语言决策中抽离出来。数据显示,预检查后的支付仍有25,370笔执行;在它评估的25,640次转账调用中,仅187次被策略拒绝,其中148次对应未获许可的收款方。这说明确定性控制可以针对具体授权条件拦截动作,而不必把支付工具整体关闭。
当然,0次违规不等于系统获得了绝对安全证明。该结果来自特定攻击集合、策略等级和重放环境,且攻击样本与配置存在绑定关系。研究报告称,零违规覆盖790个源会话,对单会话违规率给出的上限为0.38%。因此,APort Vault更适合被看作一种可复现的授权边界测试方法:它提醒开发者,评估支付型代理时,应分别测量代理是否提出请求、是否执行支付,以及支付对象是否真正得到授权。
评论
正在确认登录状态……
正在加载评论……