Ventor-QTest:用威胁模型审计供应商托管的 LLM API
导语
当企业通过第三方 API 使用开源权重模型时,用户通常只能看到最终文本,却无法确认请求是否始终由同一模型、同一路由和相近的推理状态处理。传统评测往往关注平均准确率,但平均分未必能暴露长链路任务中偶发而致命的输出偏离。论文《Ventor-QTest》把问题转化为对托管推理 API 的黑盒审计。
核心方法
Ventor-QTest 不要求目标 API 返回 token 概率或其他内部信息,而是从可观察的文本输出中重建统计信号,主要包含两部分:
- AFL(平均保真度损失):对冻结且受约束的上下文进行多次请求,依据不同文本结果的出现次数重建分类分布,再计算经过零假设偏差校正、窗口内平均化的粗粒度 KL 统计量。它用于描述重复请求下的总体偏离程度。
- EFL(极端保真度损失):针对长序列任务进行相互独立的多次运行,观察以参考结果为中心的惊奇度统计量的经验上尾部,从而捕捉少数但幅度很大的异常运行。
这一区分很重要:AFL 更接近“平均情况下是否稳定”,EFL 则关注“是否偶尔出现严重失真”。对于需要连续调用、规划和执行的智能体任务,后者可能更具风险。
实验观察
在三个具备 logprob 的路由条件下,AFL 与由 logprob 计算的粗粒度 KL 对照指标表现出较强的线性描述一致性,说明仅凭文本重复采样也能获得有用的审计信号。研究还在七个路由快照上开展了 20 次运行的长序列探测,发现 EFL 存在明显的路由特异性差异。
指标与 GPQA-Diamond 准确率之间没有检测到明显的路由层面关联。相比之下,当 EFL 较为显著时,随着任务暴露增加,Terminal-Bench 通过率出现下降。这并不等于证明因果关系,但提示长时程任务的正确性可能比短题准确率更容易受到极端输出偏离影响。
意义与局限
这项工作把供应商 API 的“黑箱质量”拆成平均稳定性和极端风险两个维度,为模型路由、版本快照和服务质量的持续监测提供了更细的框架。实际审计中,单独报告平均指标可能掩盖长序列任务的尾部风险,因此联合报告 AFL 与 EFL 更有价值。
同时,现有结果主要是描述性证据,不能据此断言某条路由一定发生了模型替换、服务降级或具体内部故障。指标也依赖测试上下文、重复次数和参考构造方式。论文同时公开了实现,便于研究者在不同托管 API 和智能体任务上复核这些发现。
评论
正在确认登录状态……
正在加载评论……