返回文章列表
AI 安全

多智能体“从众”如何击穿 conformal prediction 的安全保证

阅读约 3 分钟

导语

Conformal prediction 常被用来给模型输出加上一层统计保障:在预设条件下,预测集合应以不低于目标概率覆盖正确答案。它的价值不只是告诉系统“模型猜了什么”,还帮助系统判断何时应当保守、转人工或升级处理。

但这份发表于 arXiv 的研究提醒,多智能体 LLM 系统中存在一个容易被忽视的前提:模型的评分方式必须保持稳定。如果一个模型先独立回答,再读取其他代理的意见,哪怕问题本身、真实答案和输入分布都没有改变,原先的 conformal 证书也可能不再可靠。

核心要点

  • 问题不是分布变化,而是评分变化。 研究将现象称为“评分机制转移”。干净校准数据描述的是模型独立作答时如何给候选答案打分,却没有覆盖模型面对同行意见时的行为。
  • 错误共识会直接拉低覆盖率。 在多个开放权重模型和选择题任务上,标准 alpha=0.10 的校准覆盖率为90%,当同行一致支持错误答案后,覆盖率降至74%。
  • 平均指标可能掩盖定向攻击。 如果攻击者专门挑选那些原本仍被证书覆盖、但模型信心较低的题目,覆盖率会从87%降至47%,接近腰斩;只看总体平均值,风险可能不够明显。
  • 影响会传导到决策层。 一个原本应在不确定时升级处理的系统,可能因错误同行意见而获得虚假的高信心,最终直接执行错误答案。

为什么常规修复不够

常见的 conformal 修复通常围绕校准集、显著性水平或输入分布展开。然而这里并不是测试问题换了一批,也不是样本分布发生了明显漂移,而是同一个模型在新交互环境中改变了打分行为。因此,继续使用只在“独立作答”条件下收集的校准数据,并不能自动恢复保证。

这对多智能体架构尤其重要。多数代理、讨论链和交叉验证机制通常被视为提升可靠性的手段,但如果代理之间可以形成一致的错误意见,协作就可能从纠错机制变成放大偏差的压力源。更隐蔽的是,监控系统若只追踪总体覆盖率,可能看不到攻击者针对脆弱样本进行选择的结果。

意义与影响

研究并不意味着 conformal prediction 在 LLM 中没有价值,而是说明它的保证必须绑定到具体的交互条件。部署多智能体系统时,应分别校准独立作答、读取他人答案以及面对一致意见等状态,并测试同行信息如何改变分数与升级策略。评估也不能只报告平均覆盖率,还应检查按置信度、意见一致性和攻击目标筛选后的子群体表现。

对安全设计而言,关键问题不再只是“模型是否校准”,而是“模型在什么信息环境下被校准”。只有把社会影响、提示上下文和代理间通信纳入校准与红队测试,统计证书才更有可能在真实协作系统中继续成立。

来源:arXiv

评论

正在确认登录状态……

正在加载评论……

相关文章