OCR 与扫描文档:可搜索 PDF 与文本层
光学字符识别(OCR)、文本提取以及扫描文档的可搜索性。
🔒100% 隐私保护
您的文件完全在您的网页浏览器中通过 HTML5 Canvas 和 WebAssembly 进行处理。没有任何数据会离开您的设备。
⚡极速转换
无需等待上传和下载队列。转换在本地以全机硬件速度进行,且没有任何服务器限制。
📐通用标准
符合官方的 ISO、W3C 和 IETF 规范,保证在现代操作系统上的输出兼容性。
格式比较与技术规格
| 输出格式 | MIME 类型 | 规格 | 类型 |
|---|---|---|---|
| PDF 扫描 | application/pdf | ISO-32000-2 | 位图扫描 PDF |
| IMG 扫描图像 | image/jpeg | W3C-PNG | 扫描文档图像 |
| TXT 纯文本 | text/plain | RFC-4180-CSV | 无格式纯文本 |
| DOCX Word 文档 | application/vnd.openxmlformats-officedocument.wordprocessingml.document | ISO-IEC-29500 | 微软 Word OpenXML 文档 |
| HOCR HTML | text/html | HOCR-SPEC-12 | hOCR 空间标记 |
| PNG 图像 | image/png | W3C-PNG | 便携式网络图形 |
| JPG JPEG 图像 | image/jpeg | W3C-PNG | 联合图像专家小组格式 |
| PDF 文档 | application/pdf | ISO-32000-2 | 便携式文档格式 |
技术规格与编解码器解析
⚙️
可搜索 PDF 的工作原理
扫描文档本质上只是一张纸质图片的快照。OCR 引擎识别字形,并在图像正上方插入一个不可见的、可选择的文本层。当您在 PDF 中高亮显示或搜索文本时,实际上选中的就是这个不可见的文本层。
📜
扫描的最佳平衡点:300 DPI
以 150 DPI 的分辨率扫描会导致文字破损且 OCR 准确率低下。以 600 DPI 扫描会在文字识别率没有明显提升的情况下使文件体积增大四倍。300 DPI 是兼顾高 OCR 准确率和紧凑文件体积的通用最佳选择。
💡实用信息
上传至外部服务器的数据为 0 字节。所有处理均在您的浏览器沙箱中本地完成。