Optiskās rakstzīmju atpazīšanas (OCR) un meklējama PDF ceļvedis
Teksta iegūšana, rakstzīmju ticamības matricas un attēlu atpazīšana.
Jūsu faili tiek apstrādāti pilnībā jūsu tīmekļa pārlūkprogrammā, izmantojot HTML5 Canvas un WebAssembly. Neviens datums nekad neatstāj jūsu ierīci.
Izlaidiet augšupielādes un lejupielādes rindas. Konvertēšana notiek lokāli ar pilnu mašīnas aparatūras ātrumu bez servera ierobežojumiem.
Atbilst oficiālajām ISO, W3C un IETF specifikācijām, lai garantētu rezultātu savietojamību dažādās mūsdienu operētājsistēmās.
Formātu salīdzinājums un tehniskās specifikācijas
| Izvades formāts | MIME tips | Specifikācija | Tips |
|---|---|---|---|
| PDF Skenēts | application/pdf | ISO-32000-2 | Rastra formātā skenēts PDF |
| IMG Skenēts attēls | image/jpeg | W3C-PNG | Skenēts dokumenta attēls |
| TXT Vienkāršs teksts | text/plain | RFC-4180-CSV | Neformatēts vienkāršs teksts |
| DOCX Word dokuments | application/vnd.openxmlformats-officedocument.wordprocessingml.document | ISO-IEC-29500 | Microsoft Word OpenXML dokuments |
| HOCR HTML | text/html | HOCR-SPEC-12 | hOCR telpiskā iezīmēšana |
| PNG attēls | image/png | W3C-PNG | Pārnēsājams tīkla grafikas formāts |
| JPG JPEG attēls | image/jpeg | W3C-PNG | Joint Photographic Experts Group attēlu formāts |
| PDF dokuments | application/pdf | ISO-32000-2 | Pārnēsājams dokumenta formāts |
Tehniskās specifikācijas un kodeku sadalījums
Neredzami teksta slāņi PDF dokumentos
OCR tehnoloģija izveido neredzamu meklējama teksta slāni tieši virs skenētā attēla, nodrošinot kopēšanu un meklēšanu.
0 baitu augšupielādēti ārējos serveros. Visa apstrāde notika lokāli jūsu pārlūkprogrammas smilškastē.