많은 문서 파이프라인이 들어오는 PDF를 곧바로 OCR 작업으로 처리합니다. 하지만 실제로는 페이지의 60%–80%는 OCR이 필요 없습니다—선택 가능한 텍스트 레이어, 벡터 표, 임베디드 폰트가 이미 있기 때문입니다. Textract나 Document AI를 호출하기 전에 PDF 사전 검사(pre-flight)를 수행하는 것이 OCR Cost 통제에서 ROI가 가장 높은 단계입니다. 본 글에서는 이유, 페이지 분류 방법, 프로덕션 OCR Optimization 적용 방법을 설명합니다.
1. OCR 전에 PDF를 검사해야 하는 이유
PDF OCR은 대개 페이지당 과금됩니다. AWS Textract, Google Document AI, Azure Document Intelligence, ABBYY, PaddleOCR 관리형 서비스 등 단가는 페이지당 $0.0015~$0.05+ 범위입니다. 핵심은 PDF가 단일 형식이 아니라는 점입니다. 같은 「송장.pdf」라도:
- ERP에서 보낸 네이티브 텍스트 PDF (
pdftotext로 즉시 전문 추출); - Word 변환 임베디드 폰트 PDF;
- 스캐너 순수 래스터 PDF (OCR 필수);
- 표지만 스캔, 본문은 텍스트인 하이브리드.
사전 검사 없이 전량 OCR하면 이미 있는 텍스트 레이어를 픽셀로 다시 읽게 되어 비용만 늘고 정확도는 떨어집니다. 금융·법무·보험 배치에서는 페이지 단위 pre-flight + 라우팅으로 클라우드 OCR 호출을 절반 이상 줄이는 경우가 흔합니다. 전자 계약서·은행 명세서처럼 네이티브 텍스트 비중이 높으면 연간 OCR Cost 70%–80% 절감도 현실적입니다.
2. 페이지당 실제 비용
최적화 전 측정 기준을 맞춥니다. 클라우드 과금 항목:
| 항목 | 2026년 일반 단가 | 비고 |
|---|---|---|
| 기본 OCR(텍스트만) | $0.0015–0.003/페이지 | 표·양식 없음 |
| 표 / 양식 OCR | $0.01–0.05/페이지 | Document AI 구조화 티어 |
| 필기 / 저품질 스캔 | 1.5–3× 프리미엄 | 인력 QA 대기열 필요할 수 있음 |
| 자체 GPU(상각) | ≈$0.0003–0.001/페이지 | 가동률에 따라 다름 |
예: 월 200만 페이지, 혼합 단가 $0.008/페이지 → 연간 OCR 약 $192,000. pre-flight 결과 75%는 텍스트 추출 (한계 비용 거의 0), 25%만 OCR이면 OCR 지출 약 $48,000 — 약 75% 절감. 오인식 재작업이 줄면 체감 80%에 가깝습니다.
단가는 리전·Batch·약정량에 따라 변합니다. Google Document AI 요금과 AWS Textract 요금을 비교하세요. LLM 다단 라우팅으로 API 비용을 줄였다면 문서 파이프라인에도 같은 계층화가 필요합니다 — OmniRoute 마이그레이션 검수 체크리스트를 참고하세요.
3. 세 가지 PDF 유형
| 유형 | 신호 | 라우트 | 상대 비용 |
|---|---|---|---|
| A. 네이티브 텍스트 | 폰트 존재; pdftotext 임계값 초과 | 추출 + 인코딩 정규화 | ≈0 |
| B. 하이브리드 | 일부 페이지 텍스트, 일부 스캔 | 페이지별 라우팅 | 중 |
| C. 플랫 스캔 | 폰트 없음; 전면 비트맵 | OCR (기울기·노이즈 전처리) | 높음 |
하이브리드에서 실패하는 패턴: 파일 전체에 단일 전략 적용. 200페이지 M&A 자료도 부록 스캔만 OCR이 필요할 수 있습니다. 페이지 단위 검사가 진짜 PDF OCR 최적화입니다. Adobe PDF 폰트 가이드는 임베디드 텍스트와 스캔 레이어 차이를 설명합니다.
4. 5단계 pre-flight 파이프라인
- 구조 프로브: 페이지 수, 암호화, 손상——과금 OCR 전 복구.
- 텍스트 레이어 프로브: 페이지별 문자 수·폰트 객체; 임계값 이상·깨진 글자 비율 낮으면
TEXT_OK. - 이미지 커버리지: 큰 비트맵 + 빈 텍스트 →
SCAN. - 품질 점수: DPI, 대비, 기울기——유료 재시도 방지를 위해 OCR 전 전처리.
- 라우트:
TEXT_OK→ 로컬 추출;SCAN→ OCR 큐;HYBRID→ 페이지 분할.
메트릭보내기: preflight_text_ratio, ocr_pages_ratio, ocr_retry_rate. 월간 리뷰가 단가 협상만큼 효과적입니다.
5. 오픈소스 vs 클라우드
| 단계 | 로컬 / OSS | 클라우드 API |
|---|---|---|
| pre-flight / 추출 | PyMuPDF, poppler, qpdf | 보통 불필요 |
| OCR 엔진 | Tesseract, PaddleOCR, Surya | Document AI, Textract, Azure DI |
| 표 | pdfplumber, camelot (네이티브 PDF) | 클라우드 양식/표 모드 |
OCR Optimization 승리 패턴: 로컬 pre-flight, SCAN 페이지만 클라우드 OCR.
6. Python 라우팅 예제
import fitz # PyMuPDF
MIN_CHARS = 30
def page_classify(page) -> str:
text = page.get_text("text").strip()
if len(text) >= MIN_CHARS:
return "TEXT_OK"
if page.get_images(full=True) and len(text) < MIN_CHARS:
return "SCAN"
return "HYBRID"
프로덕션에서는 타임아웃, 암호화 PDF 핸들러, 검색 메타데이터를 추가하세요. pre-flight 워커는 안정적인 CPU가 필요합니다——배치 작업은 CI 워크로드와 유사하며, 시끄러운 공유 VPS보다 전용 노드가 낫습니다.
7. 사례: 연간 약 80% 절감
크로스보더 물류 SaaS가 일 8,000 PDF (약 32,000페이지)를 수집했습니다. Document AI 전량 OCR ($0.006/페이지) 월 약 $5,760. 페이지 pre-flight 후 OCR 대상 22%만 — 월 OCR 약 $1,270 (약 78% 절감, pre-flight 연산 $200 미만).
| 단계 | 조치 | OCR 페이지 비율 | 월 OCR 비용 |
|---|---|---|---|
| 도입 전 | 전량 클라우드 OCR | 100% | ~$5,760 |
| 도입 후 | 페이지 pre-flight + 로컬 추출 | 22% | ~$1,270 |
| 절감 | — | — | ~78% |
부가 효과: 네이티브 ID 필드 정확도 OCR ~96%에서 거의 100%로. 운송장 오인식 지원 티켓 40%+ 감소——OCR Cost 최적화의 숨은 이익입니다.
8. OCR 최적화 체크리스트
- ☐ 대시보드: 추출 / OCR / 재시도 페이지
- ☐ 페이지별 라우팅——파일 단일 전략 금지
- ☐ SCAN 페이지 OCR 전 품질 게이트 (DPI·기울기)
- ☐ 네이티브 표는 pdfplumber, 사진 OCR 금지
- ☐ 언어별 엔진 벤치마크 (CJK vs 라틴)
- ☐ TEXT_OK 페이지 주 0.1% 스팟 체크
- ☐ OCR 호출 일간 +30% 알림(계층형 API 라우팅과 동일 FinOps)
9. 자주 묻는 질문
pre-flight가 OCR보다 느린가요?
페이지 텍스트 프로브는 밀리초 단위——클라우드 OCR RTT보다 훨씬 짧습니다. IO 바운드 배치는 워커 병렬화로 해결.
가짜 텍스트 레이어는?
저품질 보이지 않는 OCR 텍스트가 있는 스캔 PDF가 있습니다. 깨진 글자 비율·이미지 겹침 검사로 SCAN으로 다운그레이드.
암호화 PDF는?
pre-flight에서 비밀번호 해결. 복호 실패 파일을 과금 OCR에 반복 투입하지 마세요.
80%는 보편적인가요?
네이티브 텍스트 비중에 따름. 순수 스캔 아카이브 10%–20%; 전자 세금계산서·계약서 70%–85%. 1% 샘플로 먼저 통계.
Tesseract로 클라우드 OCR 대체?
단순 레이아웃 대량 처리에 적합. 복잡한 표·필기는 클라우드/전용 모델. pre-flight 로컬, 어려운 케이스 클라우드.
LLM 「PDF 읽기」와 관계는?
멀티모달 모델은 토큰 과금으로 PDF 읽기가 더 비쌉니다. 깨끗한 텍스트/JSON으로 먼저 변환——OCR 전 검사와 같은 FinOps.
pre-flight·OCR용 안정 워커
pre-flight, 이미지 전처리, 자체 OCR은 장시간 CPU/GPU 작업입니다. 공유 VPS 노이즈로 타임아웃·유료 재시도가 늘어 OCR Cost가 증가합니다. Apple Silicon 통합 메모리는 PyMuPDF + 로컬 추론 병렬에 적합합니다.
PDF OCR 또는 RAG 수집 파이프라인을 구축 중이라면 Nuvcloud 전용 Mac mini M4를 pre-flight/OCR 워커로——요금제 보기, 예측 가능한 하드웨어에서 OCR Optimization.