Конвертер сканированных PDF в извлеченный текст
Преобразование сканированного PDF в текстовый формат превращает растровые изображения документов в редактируемые символы простого текста.
Сравнение форматов и технические характеристики
| Характеристика | SCANNED-PDF | TXT |
|---|---|---|
| MIME-тип | application/pdf | text/plain |
| Тип | scanned bitmap PDF document | plain text |
| Сжатие | Flate / JBIG2 / DCT compression | none |
| Стандартная спецификация | ISO 32000-2:2020 | Unicode Standard / UTF-8 RFC 3629 |
| Сигнатура файла (Magic Bytes) | 25 50 44 46 2D (%PDF-) | UTF-8 / ASCII plain stream |
Обзор формата и применение
Сканированный PDF по сути представляет собой набор цифровых изображений внутри файла документа. Когда пользователям требуется отредактировать, найти или проиндексировать слова внутри таких файлов, стандартные средства просмотра оказываются бесполезными, поскольку они видят пиксели, а не буквы. Преобразование сканированного PDF в текст основано на технологиях оптического распознавания символов (OCR). Этот процесс анализирует сетку пикселей, определяет очертания букв и выводит чистые строки в универсальный текстовый файл. Юридические фирмы, исторические архивы и библиотеки ежедневно используют этот рабочий процесс. Бумажные документы, переведенные в сканы на планшетном сканере, занимают место и не поддерживают поиск по ключевым словам. Обработка таких графических PDF-файлов в простой текст делает миллионы страниц доступными для поиска за считанные секунды. Разработчики программного обеспечения также применяют этот метод для обучения моделей машинного обучения и извлечения исходных данных из отсканированных чеков, счетов и государственных бланков без ручного ввода.
Технические спецификации и разбор кодеков
Сканированный PDF использует MIME-тип application/pdf и обычно начинается с сигнатуры %PDF, за которой следует номер версии. Внутри контейнера содержимое страниц опирается на кодеки сжатия изображений, такие как Flate, JBIG2 или DCT, для хранения растровых битмапов. Преобразование в текстовый формат изменяет MIME-тип на text/plain без каких-либо сигнатур или сжатия. Модуль OCR считывает сжатые данные растра, декодирует матрицы пикселей и выводит последовательности символов ASCII или UTF-8. Поскольку TXT не содержит форматирования, стилей, шрифтов или графики, итоговый размер файла резко уменьшается по сравнению с исходным PDF.
Совместимость с ОС и браузерами
Операционные системы вроде Windows, macOS, Linux, iOS и Android открывают файлы TXT с помощью встроенных текстовых редакторов: «Блокнот», TextEdit и Nano. Веб-браузеры выводят текстовые документы мгновенно без установки плагинов. В отличие от них, сканированные PDF требуют наличия специализированных программ для чтения или движков рендеринга в браузере. Перевод отсканированных документов в простой текст гарантирует совместимость со старыми системами, интерфейсами командной строки и простыми скриптами обработки текста.
💡 Полезная информация
Сохраняйте разрешение исходного скана на уровне 300 DPI или выше, чтобы движок OCR мог четко распознать края букв и снизить количество ошибок распознавания.
Сравнение форматов и технические характеристики
Типичный 10-страничный сканированный PDF-документ весит около 5 МБ из-за встроенных растровых изображений. Конвертация этого файла в извлеченный текст уменьшает размер примерно до 20 КБ. При медленном мобильном соединении 4G со скоростью 15 Мбит/с передача тяжелого PDF занимает около 2,7 секунды, в то время как полученный текстовый файл сканируется за доли миллисекунды.
Часто задаваемые вопросы
Как перевести сканированный PDF в извлеченный текст без потери качества?
Поскольку сканированные PDF хранят страницы документов в виде растровых изображений с потерями или без них, процесс извлечения текста является скорее шагом трансляции, чем прямым перекодированием. Текстовые файлы не сохраняют визуальное качество или форматирование. Точность конвертации целиком зависит от разрешения исходного растра и точности алгоритмов распознавания.
В чем разница между сканированным PDF и извлеченным текстом?
Сканированный PDF - это контейнер документов, использующий алгоритмы бинарного сжатия для сохранения страниц в виде пикселей. Извлеченный текст - это простой текстовый файл, содержащий исключительно коды символов без сжатия, служебных данных контейнера, стилей и картинок.