ממיר PDF סרוק לטקסט מחולץ

המרת קובץ PDF סרוק לטקסט מחולץ הופכת תמונות מסמך המבוססות על פיקסלים לתווים ערוכים של טקסט פשוט.

בחר או גרור קבצים

בחר או גרור קבצים לכאן

המרה פרטית ב-100% בתוך הדפדפן - הקבצים לעולם אינם עוזבים את המכשיר שלך

או הדבק Ctrl+V
הבטחת פרטיות ללא העברה ברשת: 0 בייט הועלו לשרתים חיצוניים. כל העיבוד מתבצע באופן מקומי בארגז החול של הדפדפן שלך.

השוואת פורמטים ומפרטים טכניים

מפרטSCANNED-PDFTXT
סוג MIMEapplication/pdftext/plain
סוגscanned bitmap PDF documentplain text
דחיסהFlate / JBIG2 / DCT compressionnone
מפרט תקניISO 32000-2:2020Unicode Standard / UTF-8 RFC 3629
כותרת ביתים קסומים (Magic Bytes)25 50 44 46 2D (%PDF-)UTF-8 / ASCII plain stream

סקירת פורמטים ושימושים

קובץ PDF סרוק הוא בעצם אוסף של תמונות דיגיטליות העטופות בתוך מעטפת מסמך. כאשר משתמשים צריכים לערוך, לחפש או לאנדקס מילים בתוך קבצי תמונה אלו, מציגי מסמכים סטנדרטיים נכשלים כיוון שהם מזהים פיקסלים בלבד ולא אותיות. המרת PDF סרוק לטקסט מחולץ מסתמכת על תוכנת זיהוי תווים אופטי (OCR). שלב עיבוד זה סורק את רשתות הפיקסלים, מזהה את צורות האותיות ומוציא את המחרוזות הנקיות לקובץ טקסט אוניברסלי. משרדי עורכים דין, ארכיונים היסטוריים וספריות משתמשים בתהליך עבודה זה מדי יום. רשומות נייר המומרות לסריקות שטוחות תופסות מקום אחסון ועמידות בפני חיפושי מילות מפתח. עיבוד קבצי תמונה אלו של PDF לטקסט רגיל הופך מיליוני עמודים לניתנים לחיפוש בשניות. מפתחי תוכנה משתמשים בצינור זה כדי לאמן מודלים של למידת מכונה ולחלץ נתונים גולמיים מקבלות סרוקות, חשבוניות וטפסים ממשלתיים ללא הקלדה ידנית.

מפרטים טכניים ופירוט מקודדים

PDF סרוק משתמש בסוג ה-MIME application/pdf ובדרך כלל מתחיל בחתימת הבית המוביל %PDF, ואחריו מספר גרסה. בתוך המעטפת, תוכן העמודים מתבסס על קודקי דחיסת תמונות כגון Flate, JBIG2 או DCT לאחסון מפות סיביות רסטריות. המרה לטקסט מחולץ משנה את סוג ה-MIME ל-text/plain ללא בית מוביל או דחיסה. מנוע ה-OCR קורא את נתוני מפת הסיביות הדחוסים, מפענח את מטריצות הפיקסלים ומוציא רצפי תווים גולמיים מסוג ASCII או UTF-8. מכיוון שקובץ TXT אינו מכיל עיצוב, סגנונות, גופנים או תמונות, גודל קובץ הפלט יורד דרסטית בהשוואה ל-PDF המקור.

תאימות למערכות הפעלה ודפדפנים

מערכות הפעלה כמו חלונות, macOS, לינוקס, iOS ואנדרואיד פותחות קבצי TXT באופן טבעי באמצעות עורכי טקסט מובנים כגון פנקס רשימות (Notepad), TextEdit ו-Nano. דפדפני אינטרנט מציגים מסמכי טקסט באופן מיידי ללא תוספים. בניגוד לכך, קובצי PDF סרוקים דורשים קוראי PDF ייעודיים או מנועי רינדור בדפדפן כדי להוצג כראוי. המרת מסמכים סרוקים לטקסט רגיל מבטיחה תאימות בין מערכות מדור קודם, ממשקי שורת פקודה וסקריפטים פשוטים לעיבוד טקסט.

💡 מידע שימושי

שמור על רזולוציית הסריקה המקורית ב-300 DPI או יותר כדי לסייע למנוע ה-OCR ללכוד קצוות אותיות נקיים ולהפחית שגיאות זיהוי תווים.

השוואת פורמטים ומפרטים טכניים

מסמך PDF סרוק טיפוסי בן 10 עמודים שוקל כ-5 מגה-בייט עקב תמונות מפת סיביות משובצות. המרת קובץ זה לטקסט מחולץ מקטינה את הגודל לכ-20 קילו-בייט. בחיבור סלולרי איטי 4G במהירות 15 מגה-ביט לשנייה, העברת ה-PDF העצום לוקחת כ-2.7 שניות, בעוד קובץ הטקסט המתקבל יורד בשבריר אלפית השנייה.

שאלות נפוצות

כיצד ממירים PDF סרוק לטקסט מחולץ ללא איבוד איכות?

מכיוון שקובצי PDF סרוקים מאחסנים דפי מסמך כתמונות רסטר מאבדות או לא מאבדות נתונים, תהליך חילוץ ה-OCR פועל כשלב תרגום ולא כהמרת קידוד ישירה. קבצי טקסט אינם מאחסנים איכות ויזואלית או עיצוב. דיוק ההמרה תלוי לחלוטין ברזולוציית מפת הסיביות המקורית ובדיוק אלגוריתמי זיהוי התווים.

מה ההבדל בין PDF סרוק לבין טקסט מחולץ?

PDF סרוק הוא מעטפת מסמך המשתמשת באלגוריתמי דחיסה בינאריים לאחסון תמונות עמוד כפיקסלים. טקסט מחולץ הוא קובץ טקסט פשוט המכיל קודי תווים גולמיים בלבד ללא דחיסה, עומס מעטפת, עיצוב או תמונות.