OCR 및 스캔 문서: 검색 가능한 PDF 및 텍스트 레이어
광학 문자 인식(OCR), 텍스트 추출 및 스캔된 문서의 검색 가능성.
파일은 HTML5 Canvas와 WebAssembly를 사용하여 웹 브라우저 안에서 완전히 처리됩니다. 어떤 데이터도 기기 밖으로 유출되지 않습니다.
업로드 및 다운로드 대기열이 필요 없습니다. 서버 제한 없이 컴퓨터 하드웨어의 최대 속도로 로컬에서 변환이 이루어집니다.
최신 운영체제 전반에서 출력 호환성을 보장하기 위해 공식 ISO, W3C 및 IETF 사양을 준수합니다.
형식 비교 및 기술 사양
| 출력 형식 | MIME 유형 | 사양 | 유형 |
|---|---|---|---|
| PDF 스캔된 | application/pdf | ISO-32000-2 | 비트맵 스캔 PDF |
| IMG 스캔된 이미지 | image/jpeg | W3C-PNG | 스캔된 문서 이미지 |
| TXT 텍스트 파일 | text/plain | RFC-4180-CSV | 서식 없는 일반 텍스트 |
| DOCX Word 문서 | application/vnd.openxmlformats-officedocument.wordprocessingml.document | ISO-IEC-29500 | 마이크로소프트 Word OpenXML 문서 |
| HOCR HTML | text/html | HOCR-SPEC-12 | hOCR 공간 마크업 |
| PNG 이미지 | image/png | W3C-PNG | 휴대용 네트워크 그래픽 |
| JPG JPEG 이미지 | image/jpeg | W3C-PNG | Joint Photographic Experts Group 이미지 |
| PDF 문서 | application/pdf | ISO-32000-2 | 휴대용 문서 형식 |
기술 사양 및 코덱 분석
검색 가능한 PDF의 작동 원리
스캔된 문서는 종이의 사진일 뿐입니다. OCR 엔진은 글자 모양을 인식하여 이미지 바로 위에 보이지 않고 선택 가능한 텍스트 레이어를 삽입합니다. PDF에서 텍스트를 강조 표시하거나 검색할 때 선택하는 것은 바로 그 보이지 않는 텍스트 레이어입니다.
스캔을 위한 최적의 해상도: 300 DPI
150 DPI로 문서를 스캔하면 글자가 깨지고 OCR 정확도가 떨어집니다. 600 DPI로 스캔하면 텍스트 인식률은 향상되지 않으면서 파일 크기가 네 배로 커집니다. 300 DPI는 높은 OCR 정확도와 컴팩트한 파일 크기를 모두 달성할 수 있는 범용적인 최적의 해상도입니다.
외부 서버로 업로드된 데이터 0바이트. 모든 처리는 브라우저 샌드박스내에서 로컬로 수행되었습니다.