返回文章列表
模型评测

文档抽取的选择性风险控制:为什么“低置信度就复核”还不够

阅读约 3 分钟

导语

对文档抽取系统而言,真正有价值的承诺不是“模型平均上很准”,而是:系统只自动接受它有把握的字段,并保证被接受字段中的错误率不超过预算 α,其余字段交给人工复核。这类选择性风险控制听起来直接,但一项发表于 Hugging Face Daily Papers 的研究显示,标准校准流程在真实文档上可能悄悄失效。

研究使用 800 张 CORD 收据中的 13,859 个真实字段,字段正确率仅为 49.0%,因而是一个相当有压力的测试环境。作者重点不是提出新的共形预测理论,而是检查现有程序在文档抽取中的假设是否成立。

三个容易被忽视的失效点

  • 文档聚类。 同一张收据里的字段共享版式、图像质量和模型错误,不能简单视为相互独立。研究测得设计效应为 1.84–2.45,意味着名义上的校准样本量可能明显高估了有效信息量。
  • 评分重拟合泄漏。 如果高容量评分器和接受阈值使用同一批字段,评分中的乐观偏差会传递到阈值选择。即使将评分拟合与校准分开,若仍忽略文档聚类,也可能在目标风险附近超标。
  • 并列分数病灶。 当评分退化为少数离散取值,阈值候选网格会塌缩,覆盖率可能从 0.030 到 0.001 这样的幅度跳变,细致调节风险与覆盖率变得困难。

一条“有效性阶梯”

研究把方法按保证形式分成四层。前两层主要控制期望选择性风险:拟合/验证切分后的融合评分,在名义 α=0.10 时得到 0.318 的覆盖率和 0.096 的风险,但在重复重采样中,实际风险超过 α 的比例仍为 47.5%。这并不是证书,而是一个平均意义上的点估计。

第三层使用 Mondrian Learn-then-Test 和精确二项尾概率,提供按分组的 PAC 证书;字段独立假设下覆盖率为 0.171、风险为 0.068,进行聚类修正后为 0.140。第四层采用文档独立假设,覆盖率进一步降至 0.060、风险为 0.020,且在 40 次切分中有 19 次无法认证任何内容。它最符合真实文档的依赖结构,却也近乎没有统计功效。

条件化何时值得付出代价

结论并非“分组越多越好”。对于学习得到的评分器,输入特征已可在评分内部完成尺度调整;额外进行 Mondrian 分组会切碎阈值校准样本,覆盖率反而下降。对于弱评分或冻结评分,分组则可能有帮助,尤其是在合并阈值无法达到严格证书时。CORD 的 Sonnet 实验中,预先指定的 support-bin 分类在严格层级取得 0.171 覆盖率,高于合并阈值的约 0.091–0.098。

但这一优势并不普遍:在相同文档上换用 haiku 或 Qwen2.5-14B 后,provenance 分组的胜势消失,实际层级的优胜者转为字段类型分组。研究因此把“条件化有效”限定为与评分信号和数据分布相关的两种机制,而非普适规则。

意义与影响

这项工作提醒工程团队,生产系统中的“风险低于 10%”必须明确是平均承诺,还是带置信度的文档级证书。研究还报告了一个冻结配置在未参与选择的两组模型捕获数据上均未违反风险合同,但覆盖率随模型信号质量变化;149 个被接受字段经人工复核后有 2 个错误,选择性风险为 1.3%。这说明自动标签偏保守可能有利于安全,却不能替代严谨的抽样设计。

实践上,系统应按文档而不是字段进行切分和评估,隔离评分拟合与阈值校准,记录分数并列情况,并同时报告覆盖率、风险和证书类型。研究提供了 Apache-2.0 开源实现 VerifyDoc,但其最重要的开放问题仍是:如何在只有约 800 份文档的规模下,构造既诚实又不近乎空白的文档级界限。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章