OCR i skenirani dokumenti: Pretraživi PDF-ovi i slojevi teksta
Optičko prepoznavanje znakova, ekstrakcija teksta i mogućnost pretraživanja skeniranih dokumenata.
Ваши фајлови се обрађују искључиво у вашем веб прегледачу помоћу HTML5 Canvas и WebAssembly технологија. Ниједан податак не напушта ваш уређај.
Захваљујући WebAssembly технологији, конверзија се одвија тренутно без чекања на отпремање и преузимање.
Усклађеност са ISO, W3C и IETF спецификацијама обезбеђује компатибилност на различитим оперативним системима.
Тестови и перформансе
| Излазни формат | MIME Тип | Спецификација | Тип |
|---|---|---|---|
| PDF Skenirani | application/pdf | ISO-32000-2 | PDF sa skeniranim bitmap slikama |
| IMG Skenirana slika | image/jpeg | W3C-PNG | Slika skeniranog dokumenta |
| TXT Običan tekst | text/plain | RFC-4180-CSV | Neformatirani običan tekst |
| DOCX Word dokument | application/vnd.openxmlformats-officedocument.wordprocessingml.document | ISO-IEC-29500 | Microsoft Word OpenXML dokument |
| HOCR HTML | text/html | HOCR-SPEC-12 | hOCR prostorno označavanje |
| PNG slika | image/png | W3C-PNG | Portable Network Graphics |
| JPG JPEG slika | image/jpeg | W3C-PNG | Joint Photographic Experts Group |
| PDF PDF | application/pdf | ISO-32000-2 | Portable Document Format |
Техничке спецификације и анализа кодека
Kako rade pretraživi PDF-ovi
Skenirani dokument je samo slika papira. OCR mehanizam prepoznaje oblike slova i umeće nevidljivi, selektujući sloj teksta direktno preko slike. Kada označavate ili pretražujete tekst u PDF-u, vi birate taj nevidljivi sloj teksta.
Idealna tačka od 300 DPI za skeniranje
Skeniranje dokumenata na 150 DPI uzrokuje slomljena slova i lošu tačnost OCR-a. Skeniranje na 600 DPI četvorostruko povećava veličinu datoteke bez poboljšanja prepoznavanja teksta. 300 DPI je univerzalna idealna tačka za visoku tačnost OCR-a i kompaktnu veličinu datoteka.
0 бајтова послато спољним серверима. Сва обрада је извршена локално у безбедном окружењу вашег прегледача.