문서 추출의 선택적 위험 통제는 왜 조용히 무너지는가
들어가며
문서 추출 시스템의 핵심 약속은 단순히 평균 정확도가 높다는 것이 아니다. 시스템이 자동으로 승인한 필드의 오류율을 허용 예산 α 이하로 유지하고, 확신이 낮은 필드만 사람 검토로 보내는 것이 실제 운영에서 필요한 신뢰 계약이다. Hugging Face Daily Papers에 소개된 연구는 실제 문서에서 흔히 쓰이는 신뢰도 임계값 절차가 이 계약을 조용히 위반할 수 있다고 지적한다.
실험은 800개의 CORD 영수증에서 얻은 13,859개의 실제 필드를 사용했다. 필드 정답률은 49.0%에 불과해, 높은 성능을 가정한 데이터셋보다 훨씬 까다로운 환경이다. 이 연구의 기여는 새로운 공형 예측 이론이 아니라, 기존 보정 절차가 문서 데이터의 구조적 의존성까지 고려할 때 제대로 작동하는지 진단한 데 있다.
세 가지 실패 모드
- 문서 클러스터링. 한 영수증의 필드들은 레이아웃, 이미지 품질, 추출 오류 원인을 공유한다. 따라서 독립 표본처럼 다룰 수 없다. 측정된 설계 효과는 1.84–2.45로, 명목상 필드 수보다 실질적인 보정 정보가 훨씬 적을 수 있음을 뜻한다.
- 점수 재적합 누수. 고용량 점수 모델과 승인 임계값을 같은 필드에서 학습하면 점수의 낙관성이 임계값 선택으로 전달된다. 점수 학습과 보정을 분리해도 문서 단위 의존성을 무시하면 위험은 남는다.
- 동률 점수 문제. 점수가 소수의 이산 값으로 축소되면 가능한 임계값 격자도 붕괴한다. 보고된 사례에서는 커버리지가 0.030에서 0.001로 바뀌어 위험과 커버리지를 부드럽게 조정하기 어려웠다.
유효성 사다리
연구는 보장 수준을 네 단계로 나눈다. 첫 두 단계는 기대 선택 위험을 통제하지만, 반복되는 모든 데이터 분할에서 α를 지킬 확률까지 보장하지는 않는다. 학습과 검증을 나눈 융합 점수는 명목 α=0.10에서 커버리지 0.318, 위험 0.096을 기록했다. 그러나 재분할의 47.5%에서는 실제 위험이 목표를 초과했다. 이는 평균적인 운영 지점이지 인증서가 아니다.
세 번째 단계는 Mondrian Learn-then-Test와 정확한 이항 꼬리확률을 이용해 그룹별 PAC 인증을 제공한다. 필드 독립 가정에서는 커버리지 0.171, 위험 0.068이었고, 클러스터 보정 후 커버리지는 0.140으로 떨어졌다. 네 번째 단계는 문서 독립 가정을 사용해 실제 문서 샘플링 구조에 더 가깝다. 하지만 커버리지는 0.060, 위험은 0.020이었으며 40개 분할 중 19개에서는 아무것도 인증하지 못했다. 가장 정직한 방식이지만 현재 규모에서는 거의 무력한 셈이다.
조건화가 효과적인 경우
그룹을 더 많이 나눈다고 항상 좋아지는 것은 아니다. 학습된 점수 모델은 관련 공변량을 이미 내부에서 사용할 수 있다. 이때 외부 Mondrian 분할을 추가하면 임계값 보정 표본이 쪼개져 커버리지가 감소한다. 반대로 약한 점수나 고정 점수에서는 공변량을 분류 체계로 사용하는 편이 유리할 수 있다. Sonnet의 CORD 데이터에서 사전 지정된 support-bin 분류는 엄격한 단계에서 0.171의 커버리지를 달성해, 통합 임계값의 약 0.091–0.098보다 높았다.
다만 이 결과는 보편 법칙이 아니다. 같은 문서에 haiku와 Qwen2.5-14B를 적용하면 provenance 분류의 우위가 사라지고, 실용 단계에서는 필드 유형 분류가 더 나은 선택이 됐다. 조건화의 효과는 점수가 이미 보유한 신호와 그룹별 오류 차이가 얼마나 안정적인지에 달려 있다.
의미와 실무적 시사점
이 연구는 “오류율 10% 이하”라는 표현을 더 정확히 정의해야 한다고 말한다. 평균적으로 기대되는 수치인지, 문서 수준에서 높은 확률로 성립하는 인증인지에 따라 절차와 커버리지가 달라진다. 연구팀은 VerifyDoc 구현도 Apache-2.0으로 공개했다. 실무자는 문서 단위로 데이터를 분할하고, 점수 학습과 임계값 보정을 분리하며, 동률 점수를 점검해야 한다. 또한 커버리지, 실제 위험, 보장 유형을 하나의 숫자로 뭉뚱그리지 말고 따로 보고해야 한다. 남은 핵심 과제는 문서 간 의존성을 정직하게 반영하면서도 표본 800개 수준에서 거의 무용하지 않은 문서 수준 경계를 만드는 일이다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…