Beolvasott PDF átalakítása szöveggé
A beolvasott PDF szöveggé alakítása a képalapú dokumentumképeket szerkeszthető egyszerű szöveges karakterekké változtatja.
Formátum-összehasonlítás és műszaki specifikációk
| Specifikáció | SCANNED-PDF | TXT |
|---|---|---|
| MIME-típus | application/pdf | text/plain |
| Típus | scanned bitmap PDF document | plain text |
| Tömörítés | Flate / JBIG2 / DCT compression | none |
| Szabványos specifikáció | ISO 32000-2:2020 | Unicode Standard / UTF-8 RFC 3629 |
| Varázsbájtok fejléc (Magic Bytes) | 25 50 44 46 2D (%PDF-) | UTF-8 / ASCII plain stream |
Formátum áttekintése és alkalmazási területei
A beolvasott PDF lényegében egy dokumentumtárolóba csomagolt digitális képek gyűjteménye. Amikor a felhasználóknak szerkeszteni, keresni vagy indexelni kell a fájlokban lévő szavakat, a standard dokumentumtekintők csődöt mondanak, mivel azok csak pixeleket látnak a betűk helyett. A beolvasott PDF szöveggé alakítása optikai karakterfelismerő szoftverre támaszkodik. Ez a feldolgozási lépés átvizsgálja a pixelrácsokat, azonosítja a betűformákat, és tiszta karakterláncokat ad ki egy univerzális szövegfájlban. A jogi irodák, a történelmi archívumok és a könyvtárak naponta használják ezt a konverziós munkafolyamatot. A laposszkennerrel beolvasott papíralapú feljegyzések tárhelyet foglalnak, és ellenállnak a kulcsszavas keresésnek. Ezen kép-PDF-ek sima szöveggé történő feldolgozása másodpercek alatt kereshetővé teszmilliónyi oldalt. A szoftverfejlesztők ezt a folyamatot is használják gépi tanulási modellek betanítására, valamint a beolvasott nyugtákból, számlákból és kormányzati űrlapokból történő nyers adatok kézi gépelés nélküli kinyerésére.
Műszaki specifikációk és kodek áttekintés
A beolvasott PDF az application/pdf MIME-típust használja, és általában a %PDF varázsbájtalapú aláírással kezdődik, amelyet egy verziószám követ. A tárolón belül az oldal tartalma olyan képtömörítési kodekekre támaszkodik, mint a Flate, a JBIG2 vagy a DCT a raszteres bitképek tárolásához. A szöveggé konvertálás a MIME-típust text/plain formátumra módosítja, varázsbájtok és tömörítés nélkül. Az OCR-motor beolvassa a tömörített bitkép-adatokat, dekódolja a pixelmátrixokat, és nyers ASCII- vagy UTF-8-karakter sorozatokat ad ki. Mivel a TXT nem tartalmaz formázást, stílusokat, betűtípusokat vagy képeket, a kimeneti fájl mérete drasztikusan lecsökken a forrás PDF-hez képest.
OS és böngésző kompatibilitás
Az olyan operációs rendszerek, mint a Windows, a macOS, a Linux, az iOS és az Android, natívan megnyitják a TXT fájlokat a beépített szövegszerkesztőkkel, például a Jegyzettömbbel, a TextEdittel és a Nanóval. A webböngészők bővítmények nélkül azonnal megjelenítik a szöveges dokumentumokat. Ezzel szemben a beolvasott PDF-ek a megfelelő megjelenítéshez dedikált PDF-olvasókat vagy böngésző-megjelenítő motorokat igényelnek. A beolvasott dokumentumok sima szöveggé konvertálása biztosítja a kompatibilitást a régebbi rendszerekkel, a parancssori felületekkel és az egyszerű szövedfeldolgozó parancsfájlokkal.
💡 Hasznos információk
Tartsa a forrásbeolvasás felbontását 300 DPI-n vagy magasabb értéken, hogy az OCR-motor tiszta betűszéleket rögzítsen, és csökkentse a karakterfelismerési hibákat.
Formátum-összehasonlítás és műszaki specifikációk
Egy tipikus, 10 oldalas beolvasott PDF-dokumentum a beágyazott bitképképek miatt körülbelül 5 MB méretű. Ennek a fájlnak a szöveggé konvertálása a méretet körülbelül 20 KB-ra csökkenti. Lassú, 15 megabit/másodperces 4G mobilkapcsolaton a hatalmas PDF átvitele körülbelül 2,7 másodpercet vesz igénybe, míg az így kapott szövegfájl a milliszekundum töredéke alatt letöltődik.
Gyakran Ismételt Kérdések
Hogyan lehet beolvasott PDF-et szöveggé konvertálni minőségromlás nélkül?
Mivel a beolvasott PDF-ek a dokumentumoldalakat veszteséges vagy veszteségmentes raszterképekként tárolják, az OCR-kinyerési folyamat inkább fordítási lépésként, mint közvetlen átkódolásként működik. A szövegfájlok nem tárolják a vizuális minőséget vagy a formázást. A konverzió pontossága teljes egészében a forrásbitkép felbontásától és a karakterfelismerő algoritmusok pontosságától függ.
Mi a különbség a beolvasott PDF és a kinyert szöveg között?
A beolvasott PDF egy dokumentumtároló, amely bináris tömörítési algoritmusokat használ az oldalképek pixelekként történő tárolására. A kinyert szöveg egy egyszerű szövegfájl, amely csak nyers karakterkódokat tartalmaz tömörítés, tárolói többletterhelés, stílusok vagy képek nélkül.