HazardAuditor:让计算机使用代理的安全评估走向执行时监督
导语
当AI代理只能回答问题时,安全审核主要关注提示词和最终回复;但当代理能够打开浏览器、执行终端命令、读写文件,甚至调用外部服务时,风险往往隐藏在一连串动作中。一个看似正常的目标,可能在运行阶段演变为越权访问、危险操作或不符合预期的外部交互。HazardAuditor关注的正是这一变化:如何从代理的实际执行行为出发,为安全防护模型提供可学习、可迁移的监督信号。
核心要点
- 从静态文本转向运行时行为。 传统guard模型通常判断输入提示和输出内容,难以完整覆盖代理执行命令、调用工具和修改环境时产生的风险。HazardAuditor将评估对象扩展到完整交互过程。
- 统一异构代理的事件格式。 该框架在受控环境中运行Claude Code、Codex、Hermes和OpenClaw等不同系统,再把它们的交互归一为一种规范化事件表示。这样,来自不同代理框架的行为可以使用相对一致的方式进行监督和比较。
- 修正生成式guard的训练错配。 论文指出,按token计算的后训练目标会让较长的推理过程占据更多梯度更新,安全判定本身反而可能被稀释。Guard Policy Optimization(GuardPO)把确定性的安全结果转换为序列级优势,并分别规范化推理和判定区域,使最终安全决策成为更有效的优化单位。
- 强调跨系统评估。 论文报告称,在多个基准和异构计算机使用系统上,HazardAuditor相较此前最强的guard模型,准确率最高提升16.5个百分点。代码、模型和评估材料计划通过项目页面提供。
为什么重要
这项工作的价值不只在于增加一个安全分类器,而在于重新定义了计算机使用代理的安全监督对象。对这类系统而言,单独检查“它说了什么”已经不够,还需要检查“它做了什么、按什么顺序做,以及最终造成了什么状态变化”。统一事件表示为不同代理建立了共同的观察层,也为跨框架训练和测试提供了基础。
GuardPO则回应了另一个容易被忽视的问题:安全模型的解释过程很长,并不意味着安全判断更可靠。如果训练机制过度奖励或惩罚长推理文本,模型可能学会生成形式上的解释,却没有充分优化最终判定。将安全结果提升到序列级,有助于把训练重点重新放在是否正确识别风险上。
当然,素材目前主要披露了框架、训练方法和总体结果,尚未提供各基准的详细拆分。因此,16.5个百分点的提升应理解为论文在其评估设置下报告的最高值,而不能直接外推到所有代理或真实生产环境。随着更多执行轨迹、攻击场景和不同工具链被纳入,执行时安全监督能否保持稳定,仍值得持续验证。
评论
正在确认登录状态……
正在加载评论……