اسناد اسکنشده و OCR: PDFهای قابل جستجو و لایههای متنی
تشخیص نوری کاراکتر (OCR)، استخراج متن و قابلیت جستجوی اسناد اسکنشده.
فایلهای شما بهطور کامل در مرورگر وب شما و با استفاده از HTML5 Canvas و WebAssembly پردازش میشوند. حتی یک بایت داده نیز از دستگاه شما خارج نمیشود.
از صفهای آپلود و دانلود صرفنظر کنید. تبدیلها بهصورت محلی و با سرعت کامل سختافزار سیستم و بدون محدودیتهای سرور انجام میشوند.
مطابق با مشخصات رسمی ISO، W3C و IETF برای تضمین سازگاری خروجی در سیستمعاملهای مدرن.
مقایسه فرمتها و مشخصات فنی
| فرمت خروجی | نوع MIME | مشخصات | نوع |
|---|---|---|---|
| PDF اسکنشده | application/pdf | ISO-32000-2 | فایل PDF اسکنشده به صورت رستر |
| IMG تصویر اسکنشده | image/jpeg | W3C-PNG | تصویر سند اسکنشده |
| TXT متن ساده | text/plain | RFC-4180-CSV | متن ساده بدون قالببندی |
| DOCX سند Word | application/vnd.openxmlformats-officedocument.wordprocessingml.document | ISO-IEC-29500 | سند OpenXML مایکروسافت ورد |
| HOCR فایل hOCR HTML | text/html | HOCR-SPEC-12 | نشانهگذاری مکانی hOCR |
| PNG تصویر | image/png | W3C-PNG | گرافیک شبکهای قابل حمل |
| JPG تصویر JPEG | image/jpeg | W3C-PNG | فرمت استاندارد گروه کارشناسان عکاسی |
| PDF سند | application/pdf | ISO-32000-2 | فرمت قابل حمل اسناد |
مشخصات فنی و تحلیل کدک
فایلهای PDF قابل جستجو چگونه کار میکنند
یک سند اسکنشده در واقع تنها تصویری از یک کاغذ است. موتور OCR اشکال حروف را تشخیص داده و یک لایه متنی نامرئی و قابل انتخاب را دقیقاً بر روی تصویر درج میکند. هنگامی که متنی را در فایل PDF برجسته کرده یا جستجو میکنید، در حقیقت در حال انتخاب آن لایه متنی نامرئی هستید.
وضوح ۳۰۰ DPI؛ نقطه ایدهآل برای اسکن کردن
اسکن کردن اسناد با وضوح ۱۵۰ DPI باعث ایجاد حروف شکسته و دقت پایین در OCR میشود. اسکن با وضوح ۶۰۰ DPI اندازه فایل را چهار برابر میکند بدون اینکه بهبود چشمگیری در تشخیص متن ایجاد نماید. وضوح ۳۰۰ DPI نقطه ایدهآل جهانی برای دستیابی به دقت بالای OCR و حجم فشرده فایلها است.
صفر بایت به سرورهای خارجی آپلود میشود. تمام پردازشها به صورت محلی در سندباکس مرورگر شما انجام شد.