記事一覧へ戻る
モデル評価

文書抽出の選択的リスク制御はなぜ破綻するのか

読了目安 4 分

導入

文書抽出システムに求められるのは、単に平均精度が高いことではない。自動的に受理したフィールドの誤り率を、設定した予算 α 以下に保ち、確信の低いフィールドだけを人手確認へ回すことだ。この選択的リスク制御は、業務導入時の重要な信頼契約になる。しかし Hugging Face Daily Papers で紹介された研究は、実文書上で一般的な信頼度しきい値の手順が静かにその契約を破る可能性を示した。

評価には、800枚のCORDレシートから得た13,859個の実フィールドを使う。正解率は49.0%にとどまり、理想化された高精度データではなく、失敗が起こりやすい設定である。研究の新規性は新しい共形予測理論ではなく、既存の校正手順が文書データの構造に耐えるかを診断した点にある。

三つの失敗モード

  • 文書内クラスタリング。 同じレシートのフィールドは、レイアウト、画質、抽出失敗の原因を共有する。独立なサンプルとして扱えず、測定されたデザイン効果は1.84–2.45だった。見かけのフィールド数より実効的な校正情報は少ない。
  • スコア再適合による漏洩。 高容量のスコアと受理しきい値を同じフィールドで学習すると、スコアの楽観性がしきい値にも伝わる。スコア学習と校正を分けても、文書単位の依存を無視すれば問題は残る。
  • 同値スコアの集中。 スコアが少数の離散値に縮退すると、候補となるしきい値の格子も崩れる。報告例ではカバレッジが0.030から0.001へ変化し、リスクとカバレッジを滑らかに調整できない。

保証の有効性ラダー

研究は主張を四つの層に分ける。最初の二層は期待選択リスクを制御するが、すべての再分割で α を下回る確率までは保証しない。学習用と検証用を分けた融合スコアは、名目 α=0.10でカバレッジ0.318、リスク0.096を得た。一方、再分割の47.5%では実現リスクが目標を超えた。これは平均的な運用点であり、証明書ではない。

第三層は、Mondrian Learn-then-Test と正確な二項分布の裾確率によるグループ別PAC保証である。フィールド独立の計算ではカバレッジ0.171、リスク0.068、クラスタ補正後はカバレッジ0.140となった。第四層は文書独立を仮定し、データ生成単位により近い。だがカバレッジは0.060、リスクは0.020で、40分割中19回は何も認証できなかった。最も正直な層ほど、現在の規模ではほぼ無力になる。

条件付けはいつ効くか

分割を増やせば安全になるわけではない。学習済みスコアなら、必要な共変量がスコア内部で使われている可能性がある。外部でMondrian分割を追加すると、しきい値を推定するデータが細かく分断され、カバレッジが下がる。反対に、弱いスコアや固定スコアでは、共変量を分類体系にする価値がある。SonnetのCORDデータでは、事前指定のsupport-bin分類が厳密な層で0.171のカバレッジを示し、プールしたしきい値の約0.091–0.098を上回った。

ただし、この優位性は普遍的ではない。同じ文書でもhaikuやQwen2.5-14Bへ替えるとprovenance分類の優位は消え、実用層ではフィールド種別の分類が勝者になった。条件付けの効果は、スコアに残る信号と分類の安定性に依存する。

意義

本研究が現場に求めるのは、「リスク10%以下」という言葉の意味を明示することだ。平均的な期待値なのか、文書単位の高確率保証なのかで、必要な手順も得られるカバレッジも異なる。VerifyDocの実装も公開されている。実務では文書単位で分割し、スコア学習としきい値校正を分離し、同値スコアを点検し、カバレッジ・実現リスク・保証の種類を別々に報告すべきだ。今後の課題は、文書レベルの依存を正直に扱いながら、保証がほぼ空振りにならない統計手法である。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
FM-Bench、AIエージェントの20年間にわたるサッカー経営を評価
モデル評価
cctest.ai
モデル評価

FM-Bench、AIエージェントの20年間にわたるサッカー経営を評価

FM-Benchは、言語モデルにサッカークラブを20年間運営させ、移籍、契約更新、投資、戦術の判断が長期的にどう作用するかを測定する。結果は、モデルの規模やトークン消費よりも、管理行動の違いが成績を左右することを示した。

続きを読む
CCTest · Blog
StartupBench、実際の業務ワークフローで汎用エージェントを評価
モデル評価
cctest.ai
モデル評価

StartupBench、実際の業務ワークフローで汎用エージェントを評価

StartupBenchは、研究者が想定した課題ではなく、市場で利用実績のあるAIスタートアップ製品のワークフローから端到端の評価課題を作成します。評価対象の最強モデルでも、完全に達成できたのは約30%にとどまりました。

続きを読む
CCTest · Blog
PTXBench、大規模言語モデルのGPUカーネル最適化を検証
モデル評価
cctest.ai
モデル評価

PTXBench、大規模言語モデルのGPUカーネル最適化を検証

PTXBenchは、コードが正しいかだけでなく、指定したPTX命令が実行されるか、そして先端ライブラリに対して実際に高速化できるかを評価する。結果は、アーキテクチャ固有命令の利用と性能向上の間に差があることを示した。

続きを読む