Konvertor naskenovaného PDF na extrahovaný text

Konverzia naskenovaného PDF na extrahovaný text premieňa obrázky dokumentov na upraviteľné znaky obyčajného textu.

Vybrať alebo presunúť súbory

Vyberte alebo presuňte súbory sem

100 % súkromná konverzia v prehliadači - súbory nikdy neopustia vaše zariadenie

alebo prilepiť Ctrl+V
Záruka súkromia s nulovým prenosom do siete: 0 bajtov odovzdaných na externé servery. Všetko spracovanie prebehlo lokálne v pieskovisku vášho prehliadača.

Porovnanie formátov a technické špecifikácie

ŠpecifikáciaSCANNED-PDFTXT
MIME typapplication/pdftext/plain
Typscanned bitmap PDF documentplain text
KompresiaFlate / JBIG2 / DCT compressionnone
Štandardná špecifikáciaISO 32000-2:2020Unicode Standard / UTF-8 RFC 3629
Hlavička magických bajtov25 50 44 46 2D (%PDF-)UTF-8 / ASCII plain stream

Prehľad formátu a použitie

Naskenované PDF je v podstate zbierka digitálnych obrázkov zabalených v kontajneri dokumentu. Keď používatelia potrebujú upravovať, vyhľadávať alebo indexovať slová v týchto obrazových súboroch, štandardné prehliadače zlyhávajú, pretože vidia iba pixely namiesto písmen. Konverzia naskenovaného PDF na extrahovaný text sa spolieha na softvér na optické rozpoznávanie znakov (OCR). Tento proces analyzuje mriežky pixelov, rozpoznáva tvary písmen a ukladá čisté reťazce do univerzálneho textového súboru. Právne kancelárie, historické archívy a knižnice tento pracovný postup využívajú denne. Papierové záznamy skonvertované na ploché skeny zaberajú miesto a odolávajú vyhľadávaniu kľúčových slov. Spracovaním týchto obrázkových súborov PDF na obyčajný text sa milióny stránok stanú vyhľadávateľnými v priebehu niekoľkých sekúnd. Vývojári softvéru tiež používajú tento postup na trénovanie modelov strojového učenia a extrakciu surových dát zo naskenovaných bločkov, faktúr a vládnych formulárov bez nutnosti manuálneho písania.

Technické špecifikácie a prehľad kodekov

Naskenované PDF používa MIME typ application/pdf a zvyčajne začína podpisom s magickými bajtmi %PDF, za ktorými nasleduje číslo verzie. Obsah stránok vo vnútri kontajnera sa spolieha na kodeky obrazovej kompresie, ako sú Flate, JBIG2 alebo DCT, na ukladanie rastrových bitmap. Konverzia na extrahovaný text mení MIME typ na text/plain bez magických bajtov alebo kompresie. Motor OCR číta komprimované bitmapové dáta, dekóduje matice pixelov a generuje surové znakové sekvencie v kódovaní ASCII alebo UTF-8. Keďže TXT neobsahuje žiadne formátovanie, štýly, fonty ani obrázky, veľkosť výstupného súboru sa v porovnaní so zdrojovým PDF dramaticky zmenší.

Kompatibilita s OS a prehliadačmi

Operačné systémy ako Windows, macOS, Linux, iOS a Android otvárajú súbory TXT natívne pomocou vstavaných textových editorov, ako sú Poznámkový blok (Notepad), TextEdit a Nano. Webové prehliadače zobrazujú textové dokumenty okamžite bez potreby doplnkov. Naproti tomu naskenované PDF vyžaduje špecializované čítačky PDF alebo vykresľovacie motory prehliadača na správne zobrazenie. Konverzia naskenovaných dokumentov na obyčajný text zaisťuje kompatibilitu so staršími systémami, rozhraniami príkazového riadku a jednoduchými skriptmi na spracovanie textu.

💡 Užitočné informácie

Udržujte rozlíšenie zdrojového skenu na hodnote 300 DPI alebo vyššej, aby ste pomohli motoru OCR zachytiť čisté okraje písmen a znížili chybovosť rozpoznávania znakov.

Porovnanie formátov a technické špecifikácie

Typický 10-stranový naskenovaný dokument PDF zaberá približne 5 MB kvôli vloženým bitmapovým obrázkom. Konverzia tohto súboru na extrahovaný text zmenšuje veľkosť na približne 20 KB. Cez pomalé mobilné pripojenie 4G s rýchlosťou 15 megabitov za sekundu trvá prenos rozsiahleho PDF približne 2,7 sekundy, zatiaľ čo výsledný textový súbor sa stiahne za zlomok milisekundy.

Často kladené otázky

Ako konvertovať naskenované PDF na extrahovaný text bez straty kvality?

Keďže naskenované PDF ukladá stránky dokumentu ako strácajúce alebo bezstratové rastrové obrázky, proces extrakcie OCR funguje ako krok prekladu, a nie ako priame transkódovanie. Textové súbory neukladajú vizuálnu kvalitu ani formátovanie. Presnosť konverzie závisí výlučne od rozlíšenia zdrojovej bitmapy a presnosti algoritmov rozpoznávania znakov.

Aký je rozdiel medzi naskenovaným PDF a extrahovaným textom?

Naskenované PDF je kontajner dokumentu využívajúci algoritmy binárnej kompresie na ukladanie obrázkov stránok vo forme pixelov. Extrahovaný text je súbor obyčajného textu obsahujúci iba surové kódy znakov bez akejkoľvek kompresie, réžie kontajnera, štýlov alebo obrázkov.