OCR It, 복사할 수 없는 PDF를 브라우저에서 편집 가능한 텍스트로 변환
들어가며
스캔 PDF나 복사할 수 없는 PDF에서 텍스트를 추출하는 일은 문서를 읽는 것보다 더 많은 시간을 요구할 때가 많습니다. Firecrawl 팀과 관련된 개발자들이 공개한 OCR It은 이 과정을 브라우저 안의 몇 가지 조작으로 줄이려는 오픈소스 도구입니다. 인식 영역을 한 번 지정하면 페이지를 캡처하고 OCR을 실행한 뒤 다음 페이지로 이동하면서 텍스트를 모을 수 있습니다.
핵심 기능
- 속도에 초점: 프로젝트 설명에 따르면 OCR It은 복사할 수 없는 PDF 한 페이지의 텍스트를 최단 20밀리초에 처리할 수 있습니다. 3초에 200개의 PDF를 처리한다는 설명도 함께 제시됐습니다. 다만 이 수치는 프로젝트가 제시한 성능 지표이며, 실제 속도는 문서 복잡도, 브라우저 환경, 작업 큐의 상태에 따라 달라질 수 있습니다.
- 로컬·오프라인 OCR: Chrome과 Firefox용 확장 프로그램으로 제공되며, 내장 Tesseract를 사용합니다. API 키와 인터넷 연결이 필요하지 않습니다. 설치 시 광범위한 웹사이트 권한을 요구하지 않고, 자동 실행이나 교차 출처 iframe 조작이 필요할 때만 현재 사이트의 권한을 요청합니다.
- 수동 및 자동 모드: 수동 모드에서는 먼저 인식할 영역을 선택한 뒤 단축키로 현재 페이지를 처리합니다. 페이지를 넘기면서 OCR 작업을 백그라운드에 대기시킬 수도 있습니다. 자동 모드는 캡처, OCR, 페이지 넘김을 반복하며, 같은 페이지가 연속으로 인식되거나 더 이상 넘길 수 없을 때, OCR에 실패했을 때, 또는 300페이지에 도달했을 때 중단됩니다.
- 검수와 내보내기: 확장 프로그램 패널에서 결과를 확인하고 수정하거나 특정 페이지만 다시 인식할 수 있습니다. 전체 텍스트를 복사하거나 TXT 파일로 다운로드하는 것도 가능합니다. 소개에서는 Markdown 친화적인 결과물이 강조되지만, 제공된 사용 절차에서 구체적으로 설명된 출력 방식은 편집 가능한 텍스트와 TXT 파일입니다.
복잡한 PDF에는 한계
OCR It의 장점은 빠르고 가볍다는 데 있습니다. 별도 서버를 구축하거나 외부 API에 문서를 전송하지 않고도, 추출한 내용을 AI 요약, 검색, 질의응답에 활용할 수 있습니다. 그러나 인식 속도가 빠르다고 해서 문서 구조까지 정확하게 복원되는 것은 아닙니다.
소재에 포함된 테스트 의견에 따르면 글자가 선명하고 레이아웃이 단순한 페이지는 비교적 잘 처리됩니다. 반면 제목, 각주, 표, 수식, 본문이 섞인 페이지에서는 위치가 어긋나거나 일부 내용이 빠질 수 있어 수동 수정이 필요합니다. 브라우저 내장 PDF 뷰어는 자동 페이지 넘김도 아직 지원하지 않으므로, 해당 환경에서는 수동 모드가 더 안정적일 수 있습니다.
의미와 영향
OCR It은 로컬 OCR, 브라우저 자동화, AI 문서 읽기 흐름이 결합되는 방향을 보여줍니다. 단순히 이미지를 문자로 바꾸는 것을 넘어, 접근하기 어려운 PDF를 별도 설정 없이 후속 AI 처리에 연결한다는 점이 핵심입니다. 앞으로 표, 수식, 복잡한 레이아웃 지원이 개선된다면 가벼운 PDF 지식 처리 도구로서 활용도가 높아질 가능성이 있습니다.
출처: 量子位
댓글
로그인 상태 확인 중…
댓글 불러오는 중…