Pretvornik skeniranih PDF-jev v izvlečeno besedilo
Pretvorba skeniranega PDF-ja v izvlečeno besedilo pretvori slikovne dokumente v ureljive znake navadnega besedila.
Primerjava formatov in tehnične specifikacije
| Specifikacija | SCANNED-PDF | TXT |
|---|---|---|
| Vrsta MIME | application/pdf | text/plain |
| Vrsta | scanned bitmap PDF document | plain text |
| Stiskanje | Flate / JBIG2 / DCT compression | none |
| Standardna specifikacija | ISO 32000-2:2020 | Unicode Standard / UTF-8 RFC 3629 |
| Glava magičnih bajtov | 25 50 44 46 2D (%PDF-) | UTF-8 / ASCII plain stream |
Pregled formata in uporaba
Skeniran PDF je v bistvu zbirka digitalnih slik, zavitih v vsebnik dokumenta. Ko morajo uporabniki urejati, iskati ali indeksirati besede v teh slikovnih datotekah, običajni pregledovalniki dokumentov odpovedo, ker vidijo samo slikovne pike in ne črk. Pretvorba skeniranega PDF-ja v izvlečeno besedilo temelji na programski opremi za optično prepoznavanje znakov. Ta korak obdelave pregleduje mreže slikovnih pik, prepoznava oblike črk in izpiše čiste nize v univerzalno besedilno datoteko. Pravne pisarne, zgodovinski arhiv in knjižnice uporabljajo ta potek dela vsak dan. Papirni zapisi, pretvorjeni v skene na ploskem optičnem bralniku, zavzemajo prostor za shranjevanje in se upirajo iskanju po ključnih besedah. Obdelava teh slikovnih PDF-jev v navadno besedilo omogoča iskanje po milijonih strani v nekaj sekundah. Razvijalci programske opreme uporabljajo ta cevovod tudi za učenje modelov strojnega učenja in pridobivanje surovih podatkov iz skeniranih računov, faktur in vladnih obrazcev brez ročnega tipkanja.
Tehnične specifikacije in pregled kodekov
Skeniran PDF uporablja vrsto MIME application/pdf in se običajno začne s podpisom čarobnega bajta %PDF, čemur sledi številka različice. Znotraj vsebnika vsebina strani temelji na kodekih za stiskanje slik, kot so Flate, JBIG2 ali DCT, za shranjevanje rastrskih bitnih slik. Pretvorba v izvlečeno besedilo spremeni vrsto MIME v text/plain brez čarobnih bajtov ali stiskanja. Motor OCR bere stisnjene podatke bitne slike, dekodira matrike slikovnih pik in izpisuje surova zaporedja znakov ASCII ali UTF-8. Ker TXT ne vsebuje nobenega oblikovanja, slogov, pisav ali slik, se velikost izhodne datoteke dramatično zmanjša v primerjavi z izvirnim PDF-jem.
Združljivost z OS in brskalniki
Operacijski sistemi, kot so Windows, macOS, Linux, iOS in Android, izvorno odpirajo datoteke TXT z vgrajenimi urejevalniki besedila, kot so Beležka (Notepad), TextEdit in Nano. Spletni brskalniki takoj prikažejo besedilne dokumente brez vtičnikov. Nasprotno pa skenirani PDF-ji zahtevajo namenske bralnike PDF ali brskalniške mehanizme za pravilno prikazovanje. Pretvorba skeniranih dokumentov v navadno besedilo zagotavlja združljivost med starejšimi sistemi, vmesniki ukazne vrstice in preprostimi skriptami za obdelavo besedila.
💡 Uporabne informacije
Ločljivost izvirnega skena naj bo 300 DPI ali višja, da pomagate motorju OCR zajeti čiste robove črk in zmanjšati napake pri prepoznavanju znakov.
Primerjava formatov in tehnične specifikacije
Tipičen 10-stranski skeniran dokument PDF meri približno 5 MB zaradi vgrajenih bitnih slik. Pretvorba te datoteke v izvlečeno besedilo zmanjša velikost na približno 20 KB. Prek počasne mobilne povezave 4G s hitrostjo 15 megabitov na sekundo prenos obsežnega PDF-ja traja približno 2,7 sekunde, medtem ko se nastala besedilna datoteka prenese v delčku millisekunde.
Pogosto zastavljena vprašanja
Kako pretvoriti skeniran PDF v izvlečeno besedilo brez izgube kakovosti?
Ker skenirani PDF-ji shranjujejo strani dokumenta kot rastrske slike z izgubo ali brez nje, postopek ekstrakcije OCR deluje kot korak prevajanja in ne kot neposredno prekódiranje. Besedilne datoteke ne shranjujejo vizualne kakovosti ali oblikovanja. Točnost pretvorbe je popolnoma odvisna od ločljivosti izvirne bitne slike in natančnosti algoritmov za prepoznavanje znakov.
Kakšna je razlika med skeniranim PDF-jem in izvlečenim besedilom?
Skeniran PDF je vsebnik dokumenta, ki uporablja binarne algoritme stiskanja za shranjevanje slik strani kot slikovnih pik. Izvlečeno besedilo je navadna besedilna datoteka, ki vsebuje samo surove kode znakov brez stiskanja, režije vsebnika, slogov ali slik.