검색 가능한 스캔 PDF 만들기
사진처럼 저장된 스캔 PDF에는 검색할 글자가 없습니다. 이 도구는 페이지를 로컬에서 OCR하고 단어 위치에 보이지 않는 글자를 추가해 검색·복사를 돕습니다. 원본 스캔 이미지는 다시 압축하거나 재그리지 않으며, 인식 오류와 위치 오차는 사용자가 확인해야 합니다.
주요 기능
- 기기에 포함된 Apache-2.0 Tesseract 영어·한국어 모델로 브라우저에서 페이지별 OCR 실행
- 기존 PDF의 스캔 이미지 스트림을 유지하며 단어 좌표에 보이지 않는 텍스트 추가
- 신뢰도 60 미만 단어와 글꼴 미지원 단어를 별도 보고서로 제공
- PDF·JSON 보고서를 로컬 다운로드하고 OCR 대상 파일은 서버로 보내지 않음
사용 방법
- 텍스트 레이어가 없는 15MiB 이하, 1~5쪽 스캔 PDF를 선택합니다.
- 한국어+영어, 한국어 또는 영어 중 문서 언어를 선택합니다.
- 검색 가능 PDF 만들기를 누르고 페이지별 OCR이 끝날 때까지 기다립니다.
- PDF에서 검색과 글자 선택을 직접 시험하고, 낮은 신뢰도 보고서를 원본 스캔과 대조합니다.
활용 예시
- 오래된 스캔 자료에서 이름이나 날짜 찾기
- 한글과 영어가 섞인 이미지 PDF에서 단어 선택하기
- 원본 페이지 모습은 유지하면서 검토 가능한 OCR 사본 만들기
자주 묻는 질문
원본 스캔 화질이 바뀌나요?
PDF 안의 원본 페이지 이미지 스트림을 그대로 두고 텍스트 명령을 덧붙입니다. 이 도구는 화면에 보이는 이미지를 재압축하지 않습니다. 다만 출력 PDF의 메타데이터와 내부 구조는 달라집니다.
한글 인식은 항상 정확한가요?
아닙니다. 흐린 글씨, 기울어진 페이지, 작은 활자, 필기, 복잡한 표에서 오류가 날 수 있습니다. 신뢰도는 교정된 확률이 아니라 OCR 엔진의 점수입니다. 원본과 검색·선택 결과를 확인하세요.
검색과 선택 위치가 정확히 겹치나요?
OCR 단어 경계 상자에 보이지 않는 텍스트를 배치합니다. 사용한 시험 자료에서는 추출 좌표를 확인했지만 PDF 뷰어별 글자 선택 범위와 한글 자모 처리는 달라질 수 있습니다.
어떤 PDF는 왜 거부하나요?
기존 텍스트 PDF, 암호화·폼·회전·비표준 크롭 페이지, 15MiB 초과 또는 5쪽 초과 파일은 이 버전의 범위 밖입니다. 이미지 전용 페이지를 대상으로 합니다.
파일이나 OCR 모델을 외부로 보내나요?
파일 처리는 브라우저에서 실행됩니다. OCR 코드·영어/한국어 모델·폰트는 같은 사이트에서 내려받으며 외부 OCR API를 호출하지 않습니다. 초기 로딩에는 약 25MiB 정적 자산과 기기 메모리가 필요할 수 있습니다.
개인정보 안내
PDF와 추출 단어는 브라우저 메모리에서 처리하며 서버에 업로드하지 않습니다. 다운로드한 PDF와 JSON 보고서는 사용자가 보관합니다. OCR 모델과 PDF 코드·폰트는 이 사이트의 정적 자산입니다.
댓글과 질문