Skannitud PDF-i tekstiks muutmise konvertija
Skannitud PDF-i teisendamine tekstiks muudab pildipõhised dokumendifotod redigeeritavateks lihttekstimärkideks.
Formaatide võrdlus ja tehnilised spetsifikatsioonid
| Spetsifikatsioon | SCANNED-PDF | TXT |
|---|---|---|
| MIME-tüüp | application/pdf | text/plain |
| Tüüp | scanned bitmap PDF document | plain text |
| Tihendamine | Flate / JBIG2 / DCT compression | none |
| Standardne spetsifikatsioon | ISO 32000-2:2020 | Unicode Standard / UTF-8 RFC 3629 |
| Tunnuskoodi päis (Magic Bytes) | 25 50 44 46 2D (%PDF-) | UTF-8 / ASCII plain stream |
Formaadi ülevaade ja kasutusvaldkonnad
Skannitud PDF on põhimõtteliselt dokumendikonteinerisse pakitud digitaalsete piltide kogum. Kui kasutajad peavad nendes pildifailides olevaid sõnu muutma, otsima või indekseerima, siis tavalised dokumendivaaturid ebaõnnestuvad, sest nad näevad tähtede asemel ainult piksleid. Skannitud PDF-i teisendamine tekstiks põhineb optilisel märgituvastustarkvaral. See töötlusetapp skannib piksliruudustikud, tuvastab tähtede kujud ja väljastab puhtad tekstirea jadad universaalsesse tekstifaili. Õigusbürood, ajalooarhiivid ja raamatukogud kasutavad seda konversioonitöövoogu iga päev. Tasapinnalisteks skannitud paberdokumendid võtavad ruumi ega võimalda märksõnaotsingut. Pildipõhiste PDF-ide töötlemine lihttekstiks teeb miljonid leheküljed sekunditega otsitavaks. Tarkvaraarendajad kasutavad seda torujuhet ka masinõppemudelites ning skannitud kviitungitelt, arvetelt ja ametlikelt vormidelt toorandmete eraldamiseks ilma käsitsi tippimiseta.
Tehnilised spetsifikatsioonid ja koodekite ülevaade
Skannitud PDF kasutab MIME-tüüpi application/pdf ja algab tavaliselt tunnussignatuuriga %PDF, millele järgneb versiooninumber. Konteineri sees tugineb lehekülje sisu rasterdatud bitikaartide salvestamiseks pilditihenduskoodekitele nagu Flate, JBIG2 või DCT. Tekstiks konverteerimine muudab MIME-tüübi väärtuseks text/plain ilma tunnussignatuuride ja tihenduseta. OCR-mootor loeb tihendatud bitikaardi andmeid, dekodeerib pikslimaatriksid ja väljastab toored ASCII- või UTF-8-märgijadad. Kuna TXT ei sisalda vormingut, stiile, fonte ega pilte, väheneb väljundfaili suurus lähtefailiga võrreldes märgatavalt.
OS-i ja brauseri ühilduvus
Operatsioonisüsteemid nagu Windows, macOS, Linux, iOS ja Android avavad TXT-faile vaikimisi sisseehitatud tekstiredaktorite (Notepad, TextEdit ja Nano) abil. Veebibrauserid kuvavad tekstidokumente koheselt ilma pistikprogrammideta. Seevastu skannitud PDF-id nõuavad korrektseks kuvamiseks spetsiaalseid PDF-lugejaid või brauseri renderdusmootoreid. Skannitud dokumentide teisendamine lihttekstiks tagab ühilduvuse pärandsüsteemide, käsurealiideste ja lihtsate tekstitöötlusskriptidega.
💡 Kasulik teave
Hoidke lähteskanni eraldusvõimet 300 DPI või kõrgemana, et aidata OCR-mootoril tabada puhtaid täheservi ja vähendada märkide tuvastamise vigu.
Formaatide võrdlus ja tehnilised spetsifikatsioonid
Tüüpiline 10-leheküljeline skannitud PDF-dokument kaotab sisseehitatud bitikaartide tõttu umbes 5 MB. Selle faili konverteerimine tekstiks vähendab suuruse ligikaudu 20 kilobaidini. Aeglase 4G mobiiliühenduse (15 megabitti sekundis) kaudu võtab massiivse PDF-i edastamine umbes 2,7 sekundit, samas kui tulemuseks olev tekstifail laaditakse alla murdosa millisekundi jooksul.
Korduma kippuvad küsimused
Kuidas konverteerida skannitud PDF tekstiks kvaliteeti kaotamata?
Kuna skannitud PDF-id salvestavad lehekülgi kadudega või kadudeta rasterpiltidena, toimib OCR-protsess pigem tõlkeetapina kui otsese ümberkodeerimisena. Tekstifailid ei salvesta visuaalset kvaliteeti ega vormingut. Konversiooni täpsus sõltub täielikult lähtebitikaardi eraldusvõimest ja märgituvastusalgoritmide täpsusest.
Mis vahe on skannitud PDF-il ja tekstifailil?
Skannitud PDF on dokumendikonteiner, mis kasutab leheküljepiltide pikslina salvestamiseks binaarseid tihendusalgoritme. Tekstifail on lihttekstifail, mis sisaldab ainult tooreid koodimärke ilma tihenduse, konteineri lisandite, kujunduse ja piltideta.