OCR 与扫描 转换器

从扫描图像和 PDF 中提取并转换光学字符。

OCR 与扫描文档:可搜索 PDF 与文本层

光学字符识别(OCR)、文本提取以及扫描文档的可搜索性。

🔒100% 隐私保护

您的文件完全在您的网页浏览器中通过 HTML5 Canvas 和 WebAssembly 进行处理。没有任何数据会离开您的设备。

极速转换

无需等待上传和下载队列。转换在本地以全机硬件速度进行,且没有任何服务器限制。

📐通用标准

符合官方的 ISO、W3C 和 IETF 规范,保证在现代操作系统上的输出兼容性。

格式比较与技术规格

输出格式MIME 类型规格类型
PDF 扫描application/pdfISO-32000-2位图扫描 PDF
IMG 扫描图像image/jpegW3C-PNG扫描文档图像
TXT 纯文本text/plainRFC-4180-CSV无格式纯文本
DOCX Word 文档application/vnd.openxmlformats-officedocument.wordprocessingml.documentISO-IEC-29500微软 Word OpenXML 文档
HOCR HTMLtext/htmlHOCR-SPEC-12hOCR 空间标记
PNG 图像image/pngW3C-PNG便携式网络图形
JPG JPEG 图像image/jpegW3C-PNG联合图像专家小组格式
PDF 文档application/pdfISO-32000-2便携式文档格式

技术规格与编解码器解析

⚙️

可搜索 PDF 的工作原理

扫描文档本质上只是一张纸质图片的快照。OCR 引擎识别字形,并在图像正上方插入一个不可见的、可选择的文本层。当您在 PDF 中高亮显示或搜索文本时,实际上选中的就是这个不可见的文本层。

📜

扫描的最佳平衡点:300 DPI

以 150 DPI 的分辨率扫描会导致文字破损且 OCR 准确率低下。以 600 DPI 扫描会在文字识别率没有明显提升的情况下使文件体积增大四倍。300 DPI 是兼顾高 OCR 准确率和紧凑文件体积的通用最佳选择。

💡实用信息

上传至外部服务器的数据为 0 字节。所有处理均在您的浏览器沙箱中本地完成。