OCR ומסמכים סרוקים: קובצי PDF הניתנים לחיפוש ושכבות טקסט
זיהוי תווים אופטי (OCR), חילוץ טקסט ויכולת חיפוש במסמכים סרוקים.
הקבצים שלך מעובדים במלואם בדפדפן האינטרנט שלך באמצעות HTML5 Canvas ו-WebAssembly. שום נתון אינו עוזב את המכשיר שלך.
דלג על תורים של העלאה והורדה. ההמרות מתבצעות מקומית במהירות החומרה המלאה של המחשב ללא מגבלות שרת.
תואם למפרטים הרשמיים של ISO, W3C ו-IETF כדי להבטיח תאימות פלט בכל מערכות ההפעלה המודרניות.
השוואת פורמטים ומפרטים טכניים
| פורמט פלט | סוג MIME | מפרט | סוג |
|---|---|---|---|
| PDF סרוק | application/pdf | ISO-32000-2 | קובץ PDF סרוק מבוסס מפת סיביות |
| IMG תמונה סרוקה | image/jpeg | W3C-PNG | תמונת מסמך סרוקה |
| TXT טקסט רגיל | text/plain | RFC-4180-CSV | טקסט רגיל ללא עיצוב |
| DOCX מסמך Word | application/vnd.openxmlformats-officedocument.wordprocessingml.document | ISO-IEC-29500 | מסמך OpenXML של Microsoft Word |
| HOCR HTML | text/html | HOCR-SPEC-12 | תיוג מרחבי מסוג hOCR |
| PNG תמונת | image/png | W3C-PNG | גרפיקת רשת ניידת |
| JPG תמונת JPEG | image/jpeg | W3C-PNG | פורמט תמונה של Joint Photographic Experts Group |
| PDF מסמך | application/pdf | ISO-32000-2 | פורמט מסמכים נייד |
מפרטים טכניים ופירוט מקודדים
כיצד פועלים קובצי PDF הניתנים לחיפוש
מסמך סרוק הוא בסך הכל תמונה של נייר. מנוע OCR מזהה צורות אותיות ומוסיף שכבת טקסט בלתי נראית הניתנת לבחירה ישירות על גבי התמונה. כאשר אתם מסמנים או מחפשים טקסט בקובץ ה-PDF, אתם למעשה בוחרים את שכבת הטקסט הבלתי נראית הזו.
נקודת האופטימום של 300 DPI לסריקה
סריקת מסמכים ברזולוציה של 150 DPI גורמת לאותיות שבורות ולדיוק OCR נמוך. סריקת מסמכים ברזולוציה של 600 DPI מכפילה את גודל הקובץ פי ארבעה מבלי לשפר את זיהוי הטקסט. רזולוציית 300 DPI היא נקודת האופטימום האוניברסלית להשגת דיוק OCR גבוה וגדלי קבצים קומפקטיים.
0 בייט הועלו לשרתים חיצוניים. כל העיבוד מתבצע באופן מקומי בארגז החול של הדפדפן שלך.