Skenēta PDF uz iegūtu tekstu pārveidotājs

Skenēta PDF dokumenta konvertēšana uz iegūtu tekstu pārvērš attēla veida dokumentu attēlus rediģējamās tīra teksta rakstzīmēs.

Atlasiet vai velciet failus

Atlasiet vai velciet failus šeit

100% privāta konvertēšana pārlūkprogrammā - faili nekad neatstāj jūsu ierīci

vai ielīmējiet Ctrl+V
Privātuma garantija bez datu pārraides tīklā: 0 baitu augšupielādēti ārējos serveros. Visa apstrāde notika lokāli jūsu pārlūkprogrammas smilškastē.

Formātu salīdzinājums un tehniskās specifikācijas

SpecifikācijaSCANNED-PDFTXT
MIME tipsapplication/pdftext/plain
Tipsscanned bitmap PDF documentplain text
KompresijaFlate / JBIG2 / DCT compressionnone
Standarta specifikācijaISO 32000-2:2020Unicode Standard / UTF-8 RFC 3629
Maģisko baitu galvene25 50 44 46 2D (%PDF-)UTF-8 / ASCII plain stream

Formāta pārskats un lietojums

Skenēts PDF būtībā ir digitālu attēlu kolekcija, kas ievietota dokumentu konteinerā. Kad lietotājiem ir nepieciešams rediģēt, meklēt vai indeksēt vārdus šajos attēlu failos, standarta dokumentu skatītāji nedarbojas, jo tie redz tikai pikseļus, nevis burtus. Skenēta PDF konvertēšana uz iegūtu tekstu balstās uz optiskās rakstzīmju atpazīšanas programmatūru. Šis apstrādes solis skenē pikseļu režģus, identificē burtu formas un izvada tīras rindiņas universālā teksta failā. Juridiskie biroji, vēstures arhīvi un bibliotēkas šo konvertēšanas darbplūsmu izmanto katru dienu. Papīra ieraksti, kas pārveidoti par plakanvirsmas skenējumiem, aizņem vietu krātuvē un pretojas atslēgvārdu meklēšanai. Šo attēlu PDF failu apstrāde vienkāršā tekstā padara miljoniem lappušu meklējamus dažu sekunžu laikā. Programmatūras izstrādātāji arī izmanto šo cauruļvadu, lai apmācītu mašīnmācīšanās modeļus un iegūtu neapstrādātus datus no skenētām čekiem, rēķiniem un valdības veidlapām bez manuālas rakstīšanas.

Tehniskās specifikācijas un kodeku sadalījums

Skenēts PDF izmanto application/pdf MIME tipu un parasti sākas ar burvju baitu parakstu %PDF, kam sekon versijas numurs. Konteinera iekšpusē lapas saturs balstās uz attēlu saspiešanas kodekiem, piemēram, Flate, JBIG2 vai DCT, lai uzglabātu rasterizētas bitkartes. Konvertēšana uz iegūtu tekstu maina MIME tipu uz text/plain bez burvju baitiem vai saspiešanas. OCR dzinējs nolasa saspiestos bitkartes datus, atkodē pikseļu matrices un izvada neapstrādātās ASCII vai UTF-8 rakstzīmju secības. Tā kā TXT nesatur formatējumu, stilus, fontus vai attēlus, izvades faila izmērs ievērojami samazinās salīdzinājumā ar avota PDF.

OS un pārlūkprogrammu saderība

Operētājsistēmas, piemēram, Windows, macOS, Linux, iOS un Android, pēc noklusējuma atver TXT failus, izmantojot iebūvētos teksta redaktorus, piemēram, Notepad, TextEdit un Nano. Tīmekļa pārlūkprogrammas attēlo teksta dokumentus uzreiz bez spraudņiem. Turpretim skenētiem PDF failiem ir nepieciešami īpaši PDF lasītāji vai pārlūkprogrammas renderēšanas dzinēji, lai tos pareizi parādītu. Skenētu dokumentu konvertēšana vienkāršā tekstā nodrošina saderību starp mantotajām sistēmām, komandrindas saskarnēm un vienkāršiem teksta apstrādes skriptiem.

💡 Noderīga informācija

Saglabājiet avota skenējuma izšķirtspēju 300 DPI vai augstāku, lai palīdzētu OCR dzinējam uztvert tīras burtu malas un samazinātu rakstzīmju atpazīšanas kļūdas.

Formātu salīdzinājums un tehniskās specifikācijas

Tipisks 10 lappušu skenēts PDF dokuments aizņem aptuveni 5 MB, pateicoties iegultajiem bitkartes attēliem. Šī faila konvertēšana uz iegūtu tekstu samazina izmēru līdz aptuveni 20 KB. Izmantojot lēnu 4G mobilo savienojumu ar ātrumu 15 megabiti sekundē, milzīgā PDF pārsūtīšana aizņem aptuveni 2,7 sekundes, savukārt iegūtais teksta fails lejupielādējas sekundes daļā.

Biežāk uzdotie jautājumi

Kā konvertēt skenētu PDF uz iegūtu tekstu, nezaudējot kvalitāti?

Tā kā skenēti PDF faili uzglabā dokumentu lapas kā ar vai bez zudumiem saspiestus rastra attēlus, OCR ieguves process darbojas kā tulkošanas solis, nevis tieša pārkodēšana. Teksta faili neuzglabā vizuālo kvalitāti vai formatējumu. Konvertēšanas precizitāte ir pilnībā atkarīga no avota bitkartes izšķirtspējas un rakstzīmju atpazīšanas algoritmu precizitātes.

Kāda ir atšķirība starp skenētu PDF un iegūtu tekstu?

Skenēts PDF ir dokumentu konteiners, kas izmanto binārās saspiešanas algoritmus, lai saglabātu lapu attēlus kā pikseļus. Iegūtais teksts ir vienkārša teksta fails, kas satur tikai neapstrādātus rakstzīmju kodus bez saspiešanas, konteinera pieskaitāmās noslodzes, stila vai attēliem.