Vodič za optičko prepoznavanje znakova (OCR) i pretraživi PDF
Ekstrakcija teksta, matrice pouzdanosti znakova i prepoznavanje slika.
Vaše se datoteke obrađuju u potpunosti u vašem web pregledniku pomoću HTML5 Canvasa i WebAssemblyja. Nijedan podatak nikada ne napušta vaš uređaj.
Preskočite redove čekanja za prijenos i preuzimanje. Pretvorbe se odvijaju lokalno pri punoj brzini sklopovlja stroja bez ograničenja poslužitelja.
U skladu sa službenim ISO, W3C i IETF specifikacijama kako bi se zajamčila kompatibilnost izlaza na modernim operativnim sustavima.
Usporedba formata i tehničke specifikacije
| Izlazni format | MIME vrsta | Specifikacija | Vrsta |
|---|---|---|---|
| PDF Skenirani | application/pdf | ISO-32000-2 | Skenirani PDF u obliku bitovne slike |
| IMG Skenirana slika | image/jpeg | W3C-PNG | Slika skeniranog dokumenta |
| TXT Običan tekst | text/plain | RFC-4180-CSV | Neformatirani običan tekst |
| DOCX Word dokument | application/vnd.openxmlformats-officedocument.wordprocessingml.document | ISO-IEC-29500 | Microsoft Word OpenXML dokument |
| HOCR HTML | text/html | HOCR-SPEC-12 | hOCR prostorni označni jezik |
| PNG slika | image/png | W3C-PNG | Portable Network Graphics grafika |
| JPG JPEG slika | image/jpeg | W3C-PNG | Joint Photographic Experts Group format |
| PDF PDF | application/pdf | ISO-32000-2 | Portable Document Format - Format prijenosnog dokumenta |
Tehničke specifikacije i pregled kodeka
Nevidljivi tekstualni slojevi u PDF dokumentima
OCR tehnologija postavlja nevidljivi pretraživi tekst točno preko skenirane slike stranice, omogućujući pretraživanje i kopiranje.
0 bajtova učitano na vanjske poslužitelje. Sva obrada odvijala se lokalno u sandčiću vašeg preglednika.