OCR et documents numérisés : PDF interrogeables et couches de texte
Reconnaissance optique de caractères (OCR), extraction de texte et interrogeabilité des documents numérisés.
Vos fichiers sont traités entièrement dans votre navigateur Web grâce à HTML5 Canvas et WebAssembly. Aucune donnée ne quitte jamais votre appareil.
Évitez les files d'attente de téléchargement amont et aval. Les conversions s'effectuent localement à pleine vitesse matérielle, sans limites de serveur.
Conforme aux spécifications officielles ISO, W3C et IETF pour garantir la compatibilité des résultats sur les systèmes d'exploitation modernes.
Comparaison des formats et spécifications techniques
| Format de sortie | Type MIME | Spécification | Type |
|---|---|---|---|
| PDF numérisé | application/pdf | ISO-32000-2 | PDF numérisé de type bitmap |
| IMG Image numérisée | image/jpeg | W3C-PNG | Image de document numérisé |
| TXT Texte brut | text/plain | RFC-4180-CSV | Fichier texte sans mise en forme |
| DOCX Document Word | application/vnd.openxmlformats-officedocument.wordprocessingml.document | ISO-IEC-29500 | Document Microsoft Word OpenXML |
| HOCR HTML | text/html | HOCR-SPEC-12 | Balisage spatial hOCR |
| PNG Image | image/png | W3C-PNG | Portable Network Graphics |
| JPG Image JPEG | image/jpeg | W3C-PNG | Joint Photographic Experts Group |
| PDF Document | application/pdf | ISO-32000-2 | Portable Document Format |
Spécifications techniques et analyse des codecs
Fonctionnement des PDF interrogeables
Un document numérisé n'est qu'une simple image de papier. Un moteur OCR reconnait les formes des lettres et insère une couche de texte invisible et sélectionnable directement par-dessus l'image. Lorsque vous surlignez ou recherchez du texte dans le PDF, vous sélectionnez cette couche de texte invisible.
Le juste milieu de 300 DPI pour la numérisation
La numérisation de documents à 150 DPI entraîne des lettres brisées et une faible précision de l'OCR. Une numérisation à 600 DPI quadruple la taille du fichier sans améliorer la reconnaissance de texte. 300 DPI est le compromis universel idéal pour une haute précision OCR et des tailles de fichiers compactes.
0 octet téléchargé vers des serveurs externes. Tout le traitement a lieu localement dans le bac à sable de votre navigateur.