스캔한 PDF를 OCR로 편집 가능한 텍스트로 만드는 방법
2026년 9월 1일에 게시됨 · 읽는 데 4분
복사한 양식, 촬영한 인쇄 계약서, 영수증 같은 스캔 문서는 사실 PDF로 감싼 이미지일 뿐입니다. 선택하거나 검색할 수 있는 텍스트 레이어가 없습니다. 광학 문자 인식(OCR)은 픽셀을 읽어 실제 텍스트를 재구성하며, 이 도구는 성숙한 오픈소스 OCR 엔진인 Tesseract를 사용해 WebAssembly를 통해 완전히 클라이언트 측에서 실행하고, 25개 언어의 학습된 데이터를 자체 호스팅합니다.
OCR PDF 사용해보기단계
- 1
OCR PDF 도구 열기
PDF용 OCR 도구로 이동합니다.
- 2
스캔한 PDF 업로드
텍스트를 추출하고 싶은 PDF(또는 이미지)를 선택하세요.
- 3
문서 언어와 옵션 선택
문서가 작성된 언어, OCR을 실행할 페이지, 그리고 문서 레이아웃이 특이한 경우(예: 항목이 드문 양식) 분할 모드를 선택하세요.
- 4
OCR 실행
도구가 각 페이지를 렌더링하고 텍스트를 인식합니다. OCR은 단순 텍스트 추출보다 실제로 작업량이 많아 페이지당 몇 초가 걸립니다.
- 5
텍스트 복사 또는 다운로드
추출된 텍스트를 검토한 뒤 복사하거나 일반 .txt 파일로 다운로드하세요.
자주 묻는 질문
정확도는 스캔 품질에 크게 좌우됩니다. 깨끗하고 고해상도이며 조명이 좋은 인쇄 텍스트 스캔은 매우 정확하게 인식되지만, 흐릿한 손글씨 사진은 그렇지 않습니다. 이 도구는 인쇄 텍스트에 맞춰진 LSTM 기반 Tesseract 엔진을 사용합니다.
이 사이트가 제공하는 모든 언어에 대응하는 25개 언어를 지원하며, 각 언어는 선택했을 때만 다운로드되는 자체 호스팅 학습 모델을 갖고 있습니다. 제3자 OCR API로는 아무것도 전송되지 않습니다.
네. OCR은 페이지당 일반 텍스트 추출보다 훨씬 느리므로, 브라우저 탭에서 여러 분 동안 처리가 돌아가는 것을 막기 위해 50페이지로 제한됩니다. 더 많은 페이지에 OCR이 필요하다면 먼저 큰 PDF를 분할하세요.
아니요. PDF 뷰어에서 이미 텍스트를 선택할 수 있다면 더 빠른 PDF to Text 도구를 사용하세요. OCR은 PDF가 사실상 텍스트 레이어 없이 텍스트 이미지로만 이루어져 있을 때만 필요합니다.
OCR 모델과 엔진이 자체 호스팅되어 Web Worker에서 실행되므로, 제3자 OCR API에 업로드하고 싶지 않은 민감한 스캔 문서에도 사용할 수 있습니다.

