OCR та скановані документи: доступні для пошуку PDF та текстові шари
Розпізнавання оптичних символів, витяг тексту та пошук у сканованих документах.
Ваші файли обробляються повністю у вашому веб-переглядачі за допомогою HTML5 Canvas та WebAssembly. Жодні дані ніколи не покидають ваш пристрій.
Жодних черг завантаження та вивантаження. Конвертація відбувається локально на повній швидкості апаратного забезпечення без обмежень сервера.
Відповідає офіційним специфікаціям ISO, W3C та IETF для гарантії сумісності результатів у сучасних операційних системах.
Порівняння форматів та технічні характеристики
| Формат виводу | MIME-тип | Специфікація | Тип |
|---|---|---|---|
| PDF Сканований | application/pdf | ISO-32000-2 | Растровий сканований PDF-документ |
| IMG Скановане зображення | image/jpeg | W3C-PNG | Зображення сканованого документа |
| TXT Звичайний текст | text/plain | RFC-4180-CSV | Неформатований текстовий файл |
| DOCX Документ Word | application/vnd.openxmlformats-officedocument.wordprocessingml.document | ISO-IEC-29500 | Документ Microsoft Word OpenXML |
| HOCR HTML | text/html | HOCR-SPEC-12 | Просторове розмітки hOCR |
| PNG Зображення | image/png | W3C-PNG | Переносне растрове зображення |
| JPG Зображення JPEG | image/jpeg | W3C-PNG | Стиснене растрове зображення Joint Photographic Experts Group |
| PDF Документ | application/pdf | ISO-32000-2 | Портативний формат документів |
Технічні специфікації та розбір кодеків
Як працюють доступні для пошуку PDF
Сканований документ - це просто зображення паперу. Рушій OCR розпізнає форми літер і вставляє невидимий, виділюваний текстовий шар безпосередньо поверх зображення. Коли ви виділяєте або шукаєте текст у PDF, ви взаємодієте саме з цим невидимим текстовим шаром.
Ідеальна роздільна здатність 300 DPI для сканування
Сканування документів із роздільною здатністю 150 DPI призводить до розриву літер та низької точності OCR. Сканування при 600 DPI збільшує розмір файлу вчетверо без покращення розпізнавання тексту. 300 DPI - це універсальний «золотий стандарт» для високої точності OCR та компактних розмірів файлів.
0 байт завантажено на зовнішні сервери. Уся обробка виконується локально в пісочниці вашого браузера.