Pretvarač skeniranog PDF-a u izvučeni tekst
Pretvaranje skeniranog PDF-a u izvučeni tekst pretvara slike dokumenata u uredive znakove običnog teksta.
Usporedba formata i tehničke specifikacije
| Specifikacija | SCANNED-PDF | TXT |
|---|---|---|
| MIME vrsta | application/pdf | text/plain |
| Vrsta | scanned bitmap PDF document | plain text |
| Kompresija | Flate / JBIG2 / DCT compression | none |
| Standardna specifikacija | ISO 32000-2:2020 | Unicode Standard / UTF-8 RFC 3629 |
| Zaglavlje čarobnih bajtova (Magic Bytes) | 25 50 44 46 2D (%PDF-) | UTF-8 / ASCII plain stream |
Pregled formata i primjena
Skenirani PDF je u osnovi zbirka digitalnih slika omotanih unutar spremnika dokumenata. Kada korisnici trebaju uređivati, pretraživati ili indeksirati riječi unutar ovih slikovnih datoteka, standardni preglednici dokumenata ne uspijevaju jer vide samo piksele, a ne slova. Pretvaranje skeniranog PDF-a u izvučeni tekst oslanja se na softver za optičko prepoznavanje znakova. Ovaj korak obrade skenira mreže piksele, prepoznaje oblike slova i ispisuje čiste nizove znakova u univerzalnu tekstualnu datoteku. Pravni uredi, povijesni arhivi i knjižnice svakodnevno koriste ovaj tijek rada. Papirni zapisi pretvoreni u skenirane slike zauzimaju prostor za pohranu i otežavaju pretraživanje ključnih riječi. Obrada ovih slikovnih PDF-ova u običan tekst čini milijune stranica pretraživljivima u sekundi. Programeri također koriste ovaj cjevovod za obuku modela strojnog učenja i izvlačenje sirovih podataka iz skeniranih računa, faktura i državnih obrazaca bez ručnog tipkanja.
Tehničke specifikacije i pregled kodeka
Skenirani PDF koristi MIME tip application/pdf i obično počinje s čarobnim bajtnim potpisom %PDF, nakon čega slijedi broj verzije. Unutar spremnika, sadržaj stranice oslanja se na kodeke za kompresiju slika kao što su Flate, JBIG2 ili DCT za pohranu rasteriziranih bitmape. Pretvaranje u izvučeni tekst mijenja MIME tip u text/plain bez čarobnih bajtova ili kompresije. OCR mehanizam čita komprimirane podatke bitmape, dekodira matrice piksela i ispisuje sirove ASCII ili UTF-8 nizove znakova. Budući da TXT ne sadrži nikakvo oblikovanje, stilove, fontove ni slike, izlazna veličina datoteke dramatično pada u usporedbi s izvornim PDF-om.
Kompatibilnost s OS-om i preglednikom
Operativni sustavi poput Windowsa, macOS-a, Linuxa, iOS-a i Androida izvorno otvaraju TXT datoteke pomoću ugrađenih uređivača teksta kao što su Notepad, TextEdit i Nano. Web preglednici trenutačno prikazuju tekstualne dokumente bez dodataka. Suprotno tome, skenirani PDF-ovi zahtijevaju namjenske PDF čitače ili mehanizme za renderiranje u pregledniku za pravilan prikaz. Pretvaranje skeniranih dokumenata u običan tekst osigurava kompatibilnost na starijim sustavima, sučeljima naredbenog retka i jednostavnim skriptama za obradu teksta.
💡 Korisne informacije
Držite razlučivost izvornog skeniranja na 300 DPI ili višoj kako biste pomogli OCR mehanizmu da uhvati čiste rubove slova i smanji pogreške u prepoznavanju znakova.
Usporedba formata i tehničke specifikacije
Tipičan skenirani PDF dokument od 10 stranica zauzima oko 5 MB zbog ugrađenih slika bitmape. Pretvaranje ove datoteke u izvučeni tekst smanjuje veličinu na otprilike 20 KB. Preko spore 4G mobilne veze brzine 15 megabita u sekundi, prijenos golemog PDF-a traje oko 2,7 sekundi, dok se rezultirajuća tekstualna datoteka preuzima u djeliću milisekunde.
Često postavljana pitanja
Kako pretvoriti skenirani PDF u izvučeni tekst bez gubitka kvalitete?
Budući da skenirani PDF-ovi pohranjuju stranice dokumenata kao rasterske slike s gubicima ili bez gubitaka, postupak OCR izvlačenja djeluje kao korak prevođenja, a ne izravno transkodiranje. Tekstualne datoteke ne pohranjuju vizualnu kvalitetu niti formatiranje. Točnost pretvorbe ovisi isključivo o razlučivosti izvorne bitmape i preciznosti algoritama za prepoznavanje znakova.
Koja je razlika između skeniranog PDF-a i izvučenog teksta?
Skenirani PDF je spremnik dokumenata koji koristi binarne algoritme kompresije za pohranu slika stranica kao piksela. Izvučeni tekst je obična tekstualna datoteka koja sadrži samo sirove kodove znakova bez kompresije, režije spremnika, stilova ili slika.