OCR och skannade dokument: Sökbara PDF-filer och textlager
Optisk teckenläsning (OCR), textextraktion och sökbarhet för skannade dokument.
Dina filer bearbetas helt i din webbläsare med hjälp av HTML5 Canvas och WebAssembly. Ingen data lämnar någonsin din enhet.
Hoppa över köer för upp- och nedladdning. Konverteringar sker lokalt i maskinens fulla hårdvaruhastighet utan serverbegränsningar.
Kompatibel med officiella ISO-, W3C- och IETF-specifikationer för att garantera utdatakompatibilitet över moderna operativsystem.
Formatjämförelse & Tekniska specifikationer
| Utdataformat | MIME-typ | Specifikation | Typ |
|---|---|---|---|
| PDF Skannad | application/pdf | ISO-32000-2 | Rasterbaserad skannad PDF |
| IMG Skannad bild | image/jpeg | W3C-PNG | Skannad dokumentbild |
| TXT Ren text | text/plain | RFC-4180-CSV | Oformaterad textfil |
| DOCX Word-dokument | application/vnd.openxmlformats-officedocument.wordprocessingml.document | ISO-IEC-29500 | Microsoft Word OpenXML-dokument |
| HOCR HTML | text/html | HOCR-SPEC-12 | hOCR-spatialt märksprak |
| PNG bild | image/png | W3C-PNG | Rasterbild med stöd för genomskinlighet |
| JPG JPEG-bild | image/jpeg | W3C-PNG | Komprimerat fotoformat |
| PDF dokument | application/pdf | ISO-32000-2 | Portable Document Format för dokumentvisning |
Tekniska specifikationer & codec-översikt
Så fungerar sökbara PDF-filer
Ett skannat dokument är bara en bild av papper. En OCR-motor känner igen bokstavsformer och lägger till ett osynligt, sökbart textlager direkt ovanpå bilden. När du markerar eller söker efter text i PDF-filen är det detta osynliga textlager du interagerar med.
Den optimala upplösningen på 300 DPI för skanning
Att skanna dokument i 150 DPI leder till trasiga bokstäver och dålig OCR-precision. Att skanna i 600 DPI fyrdubblar filstorleken utan att förbättra textigenkänningen. 300 DPI är den universella standarden för hög OCR-precision och kompakta filstorlekar.
0 byte laddas upp till externa servrar. All bearbetning sker lokalt i webbläsarens sandlåda.