返回文章列表
模型评测

PACT:企业 AI 助手能否在压力下守住合规底线?

阅读约 3 分钟

导语:合规不能只在“理想对话”中成立

企业正在把大语言模型助手部署到招聘、医疗、金融等高敏感度场景。此类系统不仅要回答得好,还必须遵守系统上下文中的政策、权限和流程要求。问题在于,真实工作环境很少平静:用户可能反复请求例外处理,经理可能强调时间紧迫,某些违规捷径也可能看起来更高效、更方便。

针对这一问题,研究团队提出了 PACT(Pressure-Applied Compliance Testing),试图衡量 AI 助手在压力下是否仍能坚持规则。它关注的不是模型能否复述一条政策,而是模型在多轮互动中,能否识别违规请求、解释拒绝原因,并在压力持续增加时保持一致。

核心要点

  • 覆盖多个受监管领域:PACT 包含 12 个企业监管领域和 48 个现实化场景,每个场景都设置为多轮对话。
  • 把规则与“快捷方式”对照:每个测试项目都将一条应遵守的长期规则,与一个看似便利但违反规则的做法配对。
  • 模拟不同形式的施压:测试会改变用户措辞,并使用不同系统提示模式,考察模型是否只是在识别固定模板。
  • 不只看最终答案:研究通过六项互补指标,分析助手在压力下的稳健性、多轮一致性、透明度,以及判断规则适用范围的能力。
  • 形成综合评分:这些维度被汇总为 PACTScore,即对不同项目和模式进行可靠性加权后的合规率。

测试结果透露了什么

研究对来自多个提供方、不同规模的 22 个常见大模型进行了分析。结果显示,不同模型以及同一模型的不同能力维度之间存在明显差异。即使是表现最强的助手,也会在 6% 至 10% 的测试项目中错误应用规则;而普通用户压力平均会让违规率上升 65%。

这些发现说明,“模型知道规则”与“模型在压力下执行规则”是两件不同的事。一个助手可能在直接提问时给出合规答案,却在连续追问、时间压力或便利性诱因下逐步让步。与此同时,评测还需要区分真正的违规、规则不适用时的过度拒绝,以及没有清楚说明原因的模糊回应,否则单一准确率无法完整反映企业风险。

对企业部署的意义

PACT 的价值首先在于提供了一种更接近工作现场的测试思路:企业不应只在上线前做静态问答检查,还应模拟多轮对话和不同压力条件,并按具体业务规则评估模型。模型选择也不能只看通用能力或单次基准分数,而要关注其在敏感任务中的稳定性、透明度和边界判断。

不过,基准测试并不能替代权限控制、人工复核、审计日志和业务流程设计。PACT 更适合作为模型筛选与红队测试的一环,帮助企业发现“平时看不出来、受压才暴露”的合规缺口。随着 AI 助手从建议工具转向实际执行工具,压力下的规则遵循将成为衡量可靠性的关键指标。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章