Водич за оптичко препознавање знакова (OCR) и претраживи PDF
Екстракција текста, матрице поузданости карактера и препознавање слика.
Ваши фајлови се обрађују искључиво у вашем веб прегледачу помоћу HTML5 Canvas и WebAssembly технологија. Ниједан податак не напушта ваш уређај.
Захваљујући WebAssembly технологији, конверзија се одвија тренутно без чекања на отпремање и преузимање.
Усклађеност са ISO, W3C и IETF спецификацијама обезбеђује компатибилност на различитим оперативним системима.
Тестови и перформансе
| Излазни формат | MIME Тип | Спецификација | Тип |
|---|---|---|---|
| PDF Skenirani | application/pdf | ISO-32000-2 | PDF sa skeniranim bitmap slikama |
| IMG Skenirana slika | image/jpeg | W3C-PNG | Slika skeniranog dokumenta |
| TXT Običan tekst | text/plain | RFC-4180-CSV | Neformatirani običan tekst |
| DOCX Word dokument | application/vnd.openxmlformats-officedocument.wordprocessingml.document | ISO-IEC-29500 | Microsoft Word OpenXML dokument |
| HOCR HTML | text/html | HOCR-SPEC-12 | hOCR prostorno označavanje |
| PNG slika | image/png | W3C-PNG | Portable Network Graphics |
| JPG JPEG slika | image/jpeg | W3C-PNG | Joint Photographic Experts Group |
| PDF PDF | application/pdf | ISO-32000-2 | Portable Document Format |
Техничке спецификације и анализа кодека
Невидљиви текстуални слојеви у PDF документима
OCR технологија креира невидљиви претраживи слој текста тачно преко скениране слике странице, омогућавајући копирање и претрагу.
0 бајтова послато спољним серверима. Сва обрада је извршена локално у безбедном окружењу вашег прегледача.