Nuskaityto PDF failo konvertavimas į išskirtą tekstą
Nuskaityto PDF failo konvertavimas į išskirtą tekstą paverčia dokumento paveikslėlius redaguojamais paprasto teksto simboliais.
Formatų palyginimas ir techninės specifikacijos
| Specifikacija | SCANNED-PDF | TXT |
|---|---|---|
| MIME tipas | application/pdf | text/plain |
| Tipas | scanned bitmap PDF document | plain text |
| Glaudinimas | Flate / JBIG2 / DCT compression | none |
| Standartinė specifikacija | ISO 32000-2:2020 | Unicode Standard / UTF-8 RFC 3629 |
| Maginės baitų antraštės (Magic Bytes) | 25 50 44 46 2D (%PDF-) | UTF-8 / ASCII plain stream |
Formato apžvalga ir taikymas
Nuskaitytas PDF failas iš esmės yra skaitmeninių nuotraukų rinkinys, supakuotas į dokumento konteinerį. Kai vartotojams prireikia redaguoti, ieškoti ar indeksuoti šių paveikslėlių failų žodžius, standartinės dokumentų peržiūros programos neveikia, nes jos mato tik pikselius, o ne raides. Nuskaityto PDF failo konvertavimas į išskirtą tekstą remiasi optinio simbolių atpažinimo programine įranga. Šis apdorojimo žingsnis nuskaito pikselių tinklelius, atpažįsta raidžių formas ir išveda švarias simbolių eilutes į universalią teksto rinkmeną. Teisiniai biurai, istoriniai archyvai ir bibliotekos šį konvertavimo procesą naudoja kasdien. Popieriniai įrašai, paversti plokščiaisiais nuskaitymais, užima vietą saugykloje ir neleidžia atlikti paieškos pagal raktažodžius. Šių vaizdo PDF failų apdorojimas į paprastą tekstą leidžia milijonuose puslapių ieškoti informacijos per kelias sekundes. Programuotojai taip pat naudoja šį procesą mašininio mokymosi modeliams apmokyti ir neapdorotiems duomenims iš nuskaitytų čekių, sąskaitų faktūrų bei vyriausybės formų išgauti be rankinio rinkimo.
Techninės specifikacijos ir kodekų apžvalga
Nuskaitytame PDF faile naudojamas application/pdf MIME tipas, o failas paprastai prasideda magiškojo baito parašu %PDF, po kurio eina versijos numeris. Konteinerio viduje puslapio turinys remiasi vaizdo glaudinimo kodekais, tokiais kaip „Flate", „JBIG2" arba „DCT", rastriniams bitų žemėlapiams saugoti. Konvertavimas į išskirtą tekstą pakeičia MIME tipą į text/plain be jokių magiškųjų baitų ar glaudinimo. OCR variklis nuskaito suspaustą bitų žemėlapio duomenų srautą, iškoduoja pikselių matricas ir išveda neapdorotas ASCII arba UTF-8 simbolių sekas. Kadangi TXT formatas neturi jokių formatavimo elementų, stilių, šriftų ar paveikslėlių, išvesties rinkmenos dydis smarkiai sumažėja, palyginti su pradiniu PDF failu.
OS ir naršyklės suderinamumas
Operacinės sistemos, tokių kaip „Windows", „macOS", „Linux", „iOS" ir „Android", atidaro TXT rinkmenas tiesiogiai naudodamos integruotas teksto redagavimo programas, tokias kaip „Notepad", „TextEdit" ir „Nano". Žiniatinklio naršyklės teksto dokumentus atvaizduoja akimirksniu be papildinių. Tuo tarpu nuskaitytiems PDF failams reikia specialių PDF skaitytuvų arba naršyklės atvaizdavimo variklių. Nuskaitytų dokumentų konvertavimas į paprastą tekstą užtikrina suderinamumą tarp senųjų sistemų, komandinės eilutės sąsajų ir paprastų teksto apdorojimo scenarijų.
💡 Naudinga informacija
Išlaikykite pradinio nuskaitymo raišką 300 DPI arba didesnę, kad OCR variklis galėtų tiksliai užfiksuoti švarius raidžių kraštus ir sumažinti simbolių atpažinimo klaidas.
Formatų palyginimas ir techninės specifikacijos
Tipinis 10 puslapių nuskaitytas PDF dokumentas užima apie 5 MB dėl įterptųjų bitų žemėlapio vaizdų. Konvertavus šį failą į išskirtą tekstą, dydis sumažėja maždaug iki 20 KB. Naudojant lėtą 4G mobiliojo ryšio tinklą (15 megabitų per sekundę greičiu), didelio PDF failo perkėlimas užima apie 2,7 sekundės, o gautas teksto failas parsiunčiamas per tūkstantąją sekundės dalį.
Dažnai užduodami klausimai
Kaip konvertuoti nuskaitytą PDF failą į išskirtą tekstą neprarandant kokybės?
Kadangi nuskaitytuose PDF failuose dokumentų puslapiai saugomi kaip nuostolingi arba be nuostolių rastriniai vaizdai, OCR išgavimo procesas veikia kaip vertimo žingsnis, o ne tiesioginis perkodavimas. Teksto failai nesaugo vizualinės kokybės ar formatavimo. Konvertavimo tikslumas visiškai priklauso nuo pradinio bitų žemėlapio raiškos ir simbolių atpažinimo algoritmų tikslumo.
Kuo skiriasi nuskaitytas PDF nuo išskirto teksto?
Nuskaitytas PDF yra dokumentų konteineris, kuriame naudojami dvejetainiai glaudinimo algoritmai puslapių vaizdams kaip pikseliams saugoti. Išskirtas tekstas yra paprasto teksto rinkmena, kurioje yra tik neapdoroti simbolių kodai be jokio glaudinimo, konteinerio pertekliaus, stilių ar vaizdų.