OCR og scannede dokumenter: Søgbare PDF'er og tekstlag
Optisk tegngenkendelse, udtrækning af tekst og søgbarhed i scannede dokumenter.
Dine filer behandles udelukkende i din webbrowser ved hjælp af HTML5 Canvas og WebAssembly. Ingen data forlader nogensinde din enhed.
Spring over upload- og downloadkøer. Konverteringer sker lokalt ved fuld maskin-hardwarehastighed uden serverbegrænsninger.
I overensstemmelse med officielle ISO-, W3C- og IETF-specifikationer for at garantere outputkompatibilitet på tværs af moderne operativsystemer.
Formatsammenligning & tekniske specifikationer
| Outputformat | MIME-type | Specifikation | Type |
|---|---|---|---|
| PDF Scannet | application/pdf | ISO-32000-2 | Bitmap-scannet PDF |
| IMG Scannet billede | image/jpeg | W3C-PNG | Scannet dokumentbillede |
| TXT Almindelig tekst | text/plain | RFC-4180-CSV | Uformateret almindelig tekst |
| DOCX Word-dokument | application/vnd.openxmlformats-officedocument.wordprocessingml.document | ISO-IEC-29500 | Microsoft Word OpenXML-dokument |
| HOCR HTML | text/html | HOCR-SPEC-12 | hOCR-rumlig opstilling |
| PNG billede | image/png | W3C-PNG | Portable Network Graphics |
| JPG JPEG-billede | image/jpeg | W3C-PNG | Joint Photographic Experts Group |
| PDF dokument | application/pdf | ISO-32000-2 | Portable Document Format |
Tekniske specifikationer og codec-oversigt
Hvordan søgbare PDF'er fungerer
Et scannet dokument er blot et billede af papir. En OCR-motor genkender bogstavsformer og indsætter et usynligt, markerbart tekstlag oven på billedet. Når du markerer eller søger efter tekst i PDF'en, interagerer du med dette usynlige tekstlag.
Det optimale punkt på 300 DPI til scanning
Scanning af dokumenter ved 150 DPI medfører brudte bogstaver og dårlig OCR-nøjagtighed. Scanning ved 600 DPI firedobler filstørrelsen uden at forbedre tekstgenkendelsen. 300 DPI er det universelle optimum for høj OCR-nøjagtighed og kompakte filstørrelser.
0 bytes uploadet til eksterne servere. Al behandling foregik lokalt i din browsers sandkasse.