Skenēta PDF uz iegūtu tekstu pārveidotājs
Skenēta PDF dokumenta konvertēšana uz iegūtu tekstu pārvērš attēla veida dokumentu attēlus rediģējamās tīra teksta rakstzīmēs.
Formātu salīdzinājums un tehniskās specifikācijas
| Specifikācija | SCANNED-PDF | TXT |
|---|---|---|
| MIME tips | application/pdf | text/plain |
| Tips | scanned bitmap PDF document | plain text |
| Kompresija | Flate / JBIG2 / DCT compression | none |
| Standarta specifikācija | ISO 32000-2:2020 | Unicode Standard / UTF-8 RFC 3629 |
| Maģisko baitu galvene | 25 50 44 46 2D (%PDF-) | UTF-8 / ASCII plain stream |
Formāta pārskats un lietojums
Skenēts PDF būtībā ir digitālu attēlu kolekcija, kas ievietota dokumentu konteinerā. Kad lietotājiem ir nepieciešams rediģēt, meklēt vai indeksēt vārdus šajos attēlu failos, standarta dokumentu skatītāji nedarbojas, jo tie redz tikai pikseļus, nevis burtus. Skenēta PDF konvertēšana uz iegūtu tekstu balstās uz optiskās rakstzīmju atpazīšanas programmatūru. Šis apstrādes solis skenē pikseļu režģus, identificē burtu formas un izvada tīras rindiņas universālā teksta failā. Juridiskie biroji, vēstures arhīvi un bibliotēkas šo konvertēšanas darbplūsmu izmanto katru dienu. Papīra ieraksti, kas pārveidoti par plakanvirsmas skenējumiem, aizņem vietu krātuvē un pretojas atslēgvārdu meklēšanai. Šo attēlu PDF failu apstrāde vienkāršā tekstā padara miljoniem lappušu meklējamus dažu sekunžu laikā. Programmatūras izstrādātāji arī izmanto šo cauruļvadu, lai apmācītu mašīnmācīšanās modeļus un iegūtu neapstrādātus datus no skenētām čekiem, rēķiniem un valdības veidlapām bez manuālas rakstīšanas.
Tehniskās specifikācijas un kodeku sadalījums
Skenēts PDF izmanto application/pdf MIME tipu un parasti sākas ar burvju baitu parakstu %PDF, kam sekon versijas numurs. Konteinera iekšpusē lapas saturs balstās uz attēlu saspiešanas kodekiem, piemēram, Flate, JBIG2 vai DCT, lai uzglabātu rasterizētas bitkartes. Konvertēšana uz iegūtu tekstu maina MIME tipu uz text/plain bez burvju baitiem vai saspiešanas. OCR dzinējs nolasa saspiestos bitkartes datus, atkodē pikseļu matrices un izvada neapstrādātās ASCII vai UTF-8 rakstzīmju secības. Tā kā TXT nesatur formatējumu, stilus, fontus vai attēlus, izvades faila izmērs ievērojami samazinās salīdzinājumā ar avota PDF.
OS un pārlūkprogrammu saderība
Operētājsistēmas, piemēram, Windows, macOS, Linux, iOS un Android, pēc noklusējuma atver TXT failus, izmantojot iebūvētos teksta redaktorus, piemēram, Notepad, TextEdit un Nano. Tīmekļa pārlūkprogrammas attēlo teksta dokumentus uzreiz bez spraudņiem. Turpretim skenētiem PDF failiem ir nepieciešami īpaši PDF lasītāji vai pārlūkprogrammas renderēšanas dzinēji, lai tos pareizi parādītu. Skenētu dokumentu konvertēšana vienkāršā tekstā nodrošina saderību starp mantotajām sistēmām, komandrindas saskarnēm un vienkāršiem teksta apstrādes skriptiem.
💡 Noderīga informācija
Saglabājiet avota skenējuma izšķirtspēju 300 DPI vai augstāku, lai palīdzētu OCR dzinējam uztvert tīras burtu malas un samazinātu rakstzīmju atpazīšanas kļūdas.
Formātu salīdzinājums un tehniskās specifikācijas
Tipisks 10 lappušu skenēts PDF dokuments aizņem aptuveni 5 MB, pateicoties iegultajiem bitkartes attēliem. Šī faila konvertēšana uz iegūtu tekstu samazina izmēru līdz aptuveni 20 KB. Izmantojot lēnu 4G mobilo savienojumu ar ātrumu 15 megabiti sekundē, milzīgā PDF pārsūtīšana aizņem aptuveni 2,7 sekundes, savukārt iegūtais teksta fails lejupielādējas sekundes daļā.
Biežāk uzdotie jautājumi
Kā konvertēt skenētu PDF uz iegūtu tekstu, nezaudējot kvalitāti?
Tā kā skenēti PDF faili uzglabā dokumentu lapas kā ar vai bez zudumiem saspiestus rastra attēlus, OCR ieguves process darbojas kā tulkošanas solis, nevis tieša pārkodēšana. Teksta faili neuzglabā vizuālo kvalitāti vai formatējumu. Konvertēšanas precizitāte ir pilnībā atkarīga no avota bitkartes izšķirtspējas un rakstzīmju atpazīšanas algoritmu precizitātes.
Kāda ir atšķirība starp skenētu PDF un iegūtu tekstu?
Skenēts PDF ir dokumentu konteiners, kas izmanto binārās saspiešanas algoritmus, lai saglabātu lapu attēlus kā pikseļus. Iegūtais teksts ir vienkārša teksta fails, kas satur tikai neapstrādātus rakstzīmju kodus bez saspiešanas, konteinera pieskaitāmās noslodzes, stila vai attēliem.