Optinio simbolių atpažinimo (OCR) ir ieškomo PDF vadovas
Teksto išgavimas, simbolių patikimumo matricos ir vaizdų atpažinimas.
Jūsų failai apdorojami tik jūsų interneto naršyklėje naudojant HTML5 Canvas ir WebAssembly. Jokie duomenys niekada nepalieka jūsų įrenginio.
Praleiskite įkėlimo ir atsisiuntimo eiles. Konvertavimas vyksta lokaliai visu įrenginio aparatinės įrangos greičiu be jokių serverio apribojimų.
Atitinka oficialias ISO, W3C ir IETF specifikacijas, užtikrinančias išvesties suderinamumą šiuolaikinėse operacinėse sistemose.
Formatų palyginimas ir techninės specifikacijos
| Išvesties formatas | MIME tipas | Specifikacija | Tipas |
|---|---|---|---|
| PDF Nuskenuotas | application/pdf | ISO-32000-2 | Rastrinis nuskenuotas PDF dokumentas |
| IMG Nuskenuotas paveikslėlis | image/jpeg | W3C-PNG | Nuskenuoto dokumento vaizdas |
| TXT Grynasis tekstas | text/plain | RFC-4180-CSV | Neformatuotas grynas tekstas |
| DOCX Word dokumentas | application/vnd.openxmlformats-officedocument.wordprocessingml.document | ISO-IEC-29500 | Microsoft Word OpenXML dokumentas |
| HOCR HTML | text/html | HOCR-SPEC-12 | hOCR erdvinio žymėjimo formatas |
| PNG paveikslėlis | image/png | W3C-PNG | Nešiojamoji tinklo grafika |
| JPG JPEG paveikslėlis | image/jpeg | W3C-PNG | Jungtinė fotografijos ekspertų grupė |
| PDF PDF | application/pdf | ISO-32000-2 | Nešiojamasis dokumentų formatas |
Techninės specifikacijos ir kodekų apžvalga
Nematomi teksto sluoksniai PDF dokumentuose
OCR technologija sukuria nematomą ieškomo teksto sluoksnį tiesiai virš nuskaityto vaizdo, leidžiantį kopijuoti ir ieškoti.
0 baitų įkelta į išorinius serverius. Visas apdorojimas vyko vietoje, jūsų naršyklės smėlio dėžėje (sandbox).