返回文章列表
模型评测

ExtractBench:面向企业文档抽取的模式引导评测基准

阅读约 2 分钟

导语

企业文档抽取正在从传统 OCR 与规则模板,转向由智能体按照用户定义的 Schema 直接生成结构化结果。问题也随之变得更复杂:模型不仅要“看懂”文档,还要严格遵循字段定义,补全多条记录,并给出可追溯的来源证据。围绕这一需求,论文提出了 ExtractBench,一个面向 Schema-guided enterprise document extraction 的评测基准。

核心要点

  • 评测对象更贴近企业流程:ExtractBench 要求系统输入文档和用户定义的 Schema,输出结构化数据,并附带来源证据作为 grounding metadata。这比单纯问答或单字段抽取更接近发票、表单、合同、清单等真实业务流程。
  • 覆盖规模较大且场景多样:基准包含 370 份企业文档,共 4869 页,横跨 8 个业务领域和 67 种文档类型,并通过标签区分不同挑战场景,有助于观察模型在短文档、长文档、列表、表单等任务上的差异。
  • 指标不只看答案对不对:论文报告了顺序无关的 value F1,用于衡量抽取值准确率;同时加入 word-level F1 和 page-level F1,评估证据定位的可追溯性。基准还把记录完整性和测得成本纳入同一评测框架。
  • 数据标注强调可扩展性:其 Schema 与真值构建流程结合了真实文档上的独立系统一致性、合成列表中的已知值,以及表单任务中的人工核验,试图在规模与可靠性之间取得平衡。
  • 不同系统短板清晰:商业 VLM 在短文档上表现不错,但面对长文档时常出现列表记录截断;编码代理能保持更高准确率,却带来明显更高成本。LlamaExtract Agentic Plus 在三项主要指标中排名第一,并以较低成本达到接近编码代理的准确率。

意义与影响

ExtractBench 的价值在于把企业文档抽取从“演示级能力”拉回到可量化比较:抽得准不够,还要抽得全、证据可查、成本可控。对于采用 AI 代理处理合同审阅、报销、合规或供应链文档的团队而言,这类基准能帮助他们判断模型是否真的适合上线,而不仅是能在少数样例中给出漂亮答案。

同时,长文档列表截断这一发现也提醒开发者,企业抽取系统的瓶颈往往不只是视觉识别,而是上下文管理、迭代读取、记录校验和输出控制。未来的文档代理可能需要更强的分块策略、状态管理与自检机制,才能在真实业务规模下稳定运行。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章