مبدل PDF اسکن شده به متن استخراج شده
تبدیل یک PDF اسکن شده به متن استخراج شده، تصاویر مبتنی بر عکس اسناد را به کاراکترهای متنی ساده و قابل ویرایش تبدیل میکند.
مقایسه فرمتها و مشخصات فنی
| مشخصات | SCANNED-PDF | TXT |
|---|---|---|
| نوع MIME | application/pdf | text/plain |
| نوع | scanned bitmap PDF document | plain text |
| فشردهسازی | Flate / JBIG2 / DCT compression | none |
| مشخصات استاندارد | ISO 32000-2:2020 | Unicode Standard / UTF-8 RFC 3629 |
| هدر بایتهای جادویی | 25 50 44 46 2D (%PDF-) | UTF-8 / ASCII plain stream |
نمای کلی فرمت و کاربردها
یک PDF اسکن شده در اصل مجموعهای از تصاویر دیجیتالی است که در یک کانتینر سند قرار گرفتهاند. هنگامی که کاربران نیاز به ویرایش، جستجو یا نمایهسازی کلمات داخل این فایلهای تصویری دارند، نمایشگرهای استاندارد اسناد شکست میخورند زیرا آنها فقط پیکسلها را میبینند نه حروف را. تبدیل یک PDF اسکن شده به متن استخراج شده بر روی نرمافزار تشخیص نوری کاراکتر (OCR) متکی است. این مرحله پردازشی، شبکههای پیکسلی را اسکن میکند، اشکال حروف را شناسایی میکند و رشتههای تمیز را به یک فایل متنی جهانی خروجی میدهد. دفاتر حقوقی، آرشیوهای تاریخی و کتابخانهها روزانه از این چرخه کاری تبدیل استفاده میکنند. سوابق کاغذی که به اسکنهای تخت تبدیل میشوند، فضای ذخیرهسازی را اشغال میکنند و در برابر جستجوی کلمات کلیدی مقاومت میکنند. پردازش این فایلهای PDF تصویری به متن ساده، میلیونها صفحه را در چند ثانیه قابل جستجو میکند. توسعهدهندگان نرمافزار همچنین از این پایپلاین برای آموزش مدلهای یادگیری ماشین و استخراج دادههای خام از رسیدهای اسکن شده، فاکتورها و فرمهای دولتی بدون تایپ دستی استفاده میکنند.
مشخصات فنی و تحلیل کدک
یک PDF اسکن شده از نوع MIME application/pdf استفاده میکند و معمولاً با امضای بایت جادویی %PDF و به دنبال آن شماره نسخه شروع میشود. در داخل کانتینر، محتوای صفحه بر روی کدهای فشردهسازی تصویر مانند Flate، JBIG2 یا DCT برای ذخیره بیتمپهای رستر شده متکی است. تبدیل به متن استخراج شده، نوع MIME را به text/plain بدون بایتهای جادویی یا فشردهسازی تغییر میدهد. موتور OCR دادههای بیتمپ فشرده شده را میخواند، ماتریسهای پیکسلی را دیکد میکند و توالیهای کاراکتری خام ASCII یا UTF-8 را خروجی میدهد. از آنجا که TXT صفر فرمتبندی، سبکها، فونتها یا تصاویر دارد، اندازه فایل خروجی در مقایسه با PDF منبع به طور چشمگیری کاهش مییابد.
سازگاری با سیستمعامل و مرورگر
سیستمعاملهایی مانند ویندوز، مکاوس، لینوکس، iOS و اندروید به طور بومی فایلهای TXT را با استفاده از ویرایشگرهای متنی داخلی مانند Notepad، TextEdit و Nano باز میکنند. مرورگرهای وب اسناد متنی را فوراً و بدون نیاز به افزونه نمایش میدهند. در مقابل، فایلهای PDF اسکن شده برای نمایش صحیح به خوانندههای اختصاصی PDF یا موتورهای رندر مرورگر نیاز دارند. تبدیل اسناد اسکن شده به متن ساده، سازگاری را در سیستمهای قدیمی، رابطهای خط فرمان و اسکریپتهای پردازش متن ساده تضمین میکند.
💡 اطلاعات مفید
رزولوشن اسکن منبع را روی 300 DPI یا بالاتر نگه دارید تا به موتور OCR کمک کنید لبههای تمیز حروف را بگیرد و خطاهای تشخیص کاراکتر را کاهش دهد.
مقایسه فرمتها و مشخصات فنی
یک سند PDF اسکن شده معمولی ۱۰ صفحهای به دلیل تصاویر بیتمپ جاسازی شده حدود ۵ مگابایت اندازه دارد. تبدیل این فایل به متن استخراج شده، اندازه را به حدود ۲۰ کیلوبایت کاهش میدهد. از طریق یک اتصال موبایل 4G کند با سرعت ۱۵ مگابیت بر ثانیه، انتقال PDF حجیم حدود ۲.۷ ثانیه طول میکشد، در حالی که فایل متنی حاصل در کسری از میلیثانیه دانلود میشود.
پرسشهای متداول
چگونه PDF اسکن شده را بدون افت کیفیت به متن استخراج شده تبدیل کنیم؟
از آنجا که PDFهای اسکن شده صفحات سند را به عنوان تصاویر رستر با افت کیفیت یا بدون افت کیفیت ذخیره میکنند، فرآیند استخراج OCR به عنوان یک مرحله ترجمه عمل میکند تا یک ترامکد مستقیم. فایلهای متنی کیفیت بصری یا قالببندی را ذخیره نمیکنند. دقت تبدیل کاملاً به وضوح بیتمپ منبع و دقت الگوریتمهای تشخیص کاراکتر بستگی دارد.
تفاوت بین PDF اسکن شده و متن استخراج شده چیست؟
یک PDF اسکن شده یک کانتینر سند است که از الگوریتمهای فشردهسازی باینری برای ذخیره تصاویر صفحه به صورت پیکسل استفاده میکند. متن استخراج شده یک فایل متنی ساده است که فقط شامل کدهای کاراکتری خام بدون هیچگونه فشردهسازی، سربار کانتینر، استایلدهی یا تصاویر است.