記事一覧へ戻る
モデル評価

ExtractBench:企業文書のスキーマ誘導抽出を測る新ベンチマーク

読了目安 3 分

導入

企業文書の抽出は、従来の OCR や固定テンプレートから、ユーザーが定義したスキーマに沿ってエージェントが構造化データを生成する形へ移りつつあります。この場合、重要なのは単に文字を読むことではありません。指定されたフィールドを守り、複数レコードを漏れなく抽出し、各値の出所を根拠として示す必要があります。ExtractBench は、このような実務的なスキーマ誘導型抽出を評価するために提案されたベンチマークです。

核心ポイント

  • 企業ワークフローに近いタスク設計:入力は文書とユーザー定義スキーマで、出力は構造化データと grounding metadata です。単一質問への回答よりも、請求書、フォーム、契約書、一覧表などの業務処理に近い設定です。
  • 幅広い文書セット:評価データは 370 件の企業文書、4,869 ページで構成され、8 つの業務領域と 67 種類の文書タイプを含みます。さらに課題シナリオ別のタグが付与されており、長文書、リスト、フォームなどでの失敗を分析しやすくしています。
  • 正解率だけに依存しない評価:値の正確性には順序に依存しない value F1 を用い、根拠の追跡可能性には word-level F1 と page-level F1 を用います。加えて、レコードの完全性と実測コストも同じ枠組みで扱います。
  • スケールを意識した真値作成:実文書では独立システム間の一致、合成リストでは既知の値、フォームでは人手検証を組み合わせています。これにより、大規模化と信頼性の両立を狙っています。
  • システムごとの違いが明確:商用 VLM は短い文書では良好に動作しますが、長い文書ではレコードリストを途中で切り落とす傾向があります。coding agent は高い精度を維持する一方でコストが大きくなります。LlamaExtract Agentic Plus は主要 3 指標で首位となり、coding agent に近い精度をより低いコストで示しました。

意義と影響

ExtractBench の意義は、企業文書抽出をデモの見栄えではなく、運用可能性で比較できる点にあります。実務では、値が合っているだけでは不十分です。レコードを漏らさず、根拠を確認でき、コストも許容範囲に収める必要があります。これは、コンプライアンス、経費処理、調達、契約管理などで AI エージェントを導入する際の重要な判断材料になります。

また、長文書のリストが途中で省略されるという結果は、文書抽出の課題が視覚認識だけではないことを示しています。今後は、文脈管理、分割処理、反復的な読み取り、出力検証、レコード単位の自己チェックがより重要になるでしょう。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
StealthBench:攻撃的セキュリティAIの“隠密性”を測る新ベンチマーク
モデル評価
cctest.ai
モデル評価

StealthBench:攻撃的セキュリティAIの“隠密性”を測る新ベンチマーク

StealthBench は、自律型セキュリティエージェントを「脆弱性を見つけられるか」だけでなく、「痕跡やリスクを増やさずに実行できるか」で評価する。結果は、現行モデルに OPSEC 上の課題が残ることを示している。

続きを読む
CCTest · Blog
AIエージェントは開かれたAI研究を進められるのか:2つの影評価が示す初期証拠
モデル評価
cctest.ai
モデル評価

AIエージェントは開かれたAI研究を進められるのか:2つの影評価が示す初期証拠

新論文は、未発表論文の中心的な研究課題をAIエージェントに任せ、元の著者が評価する「シャドー評価」を提案した。結果は、現在のエージェントが工学的作業をこなせても、開かれた研究判断にはまだ弱いことを示している。

続きを読む