مبدل PDF اسکن شده به متن استخراج شده

تبدیل یک PDF اسکن شده به متن استخراج شده، تصاویر مبتنی بر عکس اسناد را به کاراکترهای متنی ساده و قابل ویرایش تبدیل می‌کند.

انتخاب یا کشیدن فایل‌ها

انتخاب یا رها کردن فایل‌ها در اینجا

تبدیل ۱۰۰٪ خصوصی در مرورگر - فایل‌ها هرگز دستگاه شما را ترک نمی‌کنند

یا جای‌گذاری کنید Ctrl+V
تضمین حریم خصوصی بدون انتقال شبکه: صفر بایت به سرورهای خارجی آپلود می‌شود. تمام پردازش‌ها به صورت محلی در سندباکس مرورگر شما انجام شد.

مقایسه فرمت‌ها و مشخصات فنی

مشخصاتSCANNED-PDFTXT
نوع MIMEapplication/pdftext/plain
نوعscanned bitmap PDF documentplain text
فشرده‌سازیFlate / JBIG2 / DCT compressionnone
مشخصات استانداردISO 32000-2:2020Unicode Standard / UTF-8 RFC 3629
هدر بایت‌های جادویی25 50 44 46 2D (%PDF-)UTF-8 / ASCII plain stream

نمای کلی فرمت و کاربردها

یک PDF اسکن شده در اصل مجموعه‌ای از تصاویر دیجیتالی است که در یک کانتینر سند قرار گرفته‌اند. هنگامی که کاربران نیاز به ویرایش، جستجو یا نمایه‌سازی کلمات داخل این فایل‌های تصویری دارند، نمایشگرهای استاندارد اسناد شکست می‌خورند زیرا آنها فقط پیکسل‌ها را می‌بینند نه حروف را. تبدیل یک PDF اسکن شده به متن استخراج شده بر روی نرم‌افزار تشخیص نوری کاراکتر (OCR) متکی است. این مرحله پردازشی، شبکه‌های پیکسلی را اسکن می‌کند، اشکال حروف را شناسایی می‌کند و رشته‌های تمیز را به یک فایل متنی جهانی خروجی می‌دهد. دفاتر حقوقی، آرشیوهای تاریخی و کتابخانه‌ها روزانه از این چرخه کاری تبدیل استفاده می‌کنند. سوابق کاغذی که به اسکن‌های تخت تبدیل می‌شوند، فضای ذخیره‌سازی را اشغال می‌کنند و در برابر جستجوی کلمات کلیدی مقاومت می‌کنند. پردازش این فایل‌های PDF تصویری به متن ساده، میلیون‌ها صفحه را در چند ثانیه قابل جستجو می‌کند. توسعه‌دهندگان نرم‌افزار همچنین از این پایپ‌لاین برای آموزش مدل‌های یادگیری ماشین و استخراج داده‌های خام از رسیدهای اسکن شده، فاکتورها و فرم‌های دولتی بدون تایپ دستی استفاده می‌کنند.

مشخصات فنی و تحلیل کدک

یک PDF اسکن شده از نوع MIME application/pdf استفاده می‌کند و معمولاً با امضای بایت جادویی %PDF و به دنبال آن شماره نسخه شروع می‌شود. در داخل کانتینر، محتوای صفحه بر روی کدهای فشرده‌سازی تصویر مانند Flate، JBIG2 یا DCT برای ذخیره بیت‌مپ‌های رستر شده متکی است. تبدیل به متن استخراج شده، نوع MIME را به text/plain بدون بایت‌های جادویی یا فشرده‌سازی تغییر می‌دهد. موتور OCR داده‌های بیت‌مپ فشرده شده را می‌خواند، ماتریس‌های پیکسلی را دیکد می‌کند و توالی‌های کاراکتری خام ASCII یا UTF-8 را خروجی می‌دهد. از آنجا که TXT صفر فرمت‌بندی، سبک‌ها، فونت‌ها یا تصاویر دارد، اندازه فایل خروجی در مقایسه با PDF منبع به طور چشمگیری کاهش می‌یابد.

سازگاری با سیستم‌عامل و مرورگر

سیستم‌عامل‌هایی مانند ویندوز، مک‌اوس، لینوکس، iOS و اندروید به طور بومی فایل‌های TXT را با استفاده از ویرایشگرهای متنی داخلی مانند Notepad، TextEdit و Nano باز می‌کنند. مرورگرهای وب اسناد متنی را فوراً و بدون نیاز به افزونه نمایش می‌دهند. در مقابل، فایل‌های PDF اسکن شده برای نمایش صحیح به خواننده‌های اختصاصی PDF یا موتورهای رندر مرورگر نیاز دارند. تبدیل اسناد اسکن شده به متن ساده، سازگاری را در سیستم‌های قدیمی، رابط‌های خط فرمان و اسکریپت‌های پردازش متن ساده تضمین می‌کند.

💡 اطلاعات مفید

رزولوشن اسکن منبع را روی 300 DPI یا بالاتر نگه دارید تا به موتور OCR کمک کنید لبه‌های تمیز حروف را بگیرد و خطاهای تشخیص کاراکتر را کاهش دهد.

مقایسه فرمت‌ها و مشخصات فنی

یک سند PDF اسکن شده معمولی ۱۰ صفحه‌ای به دلیل تصاویر بیت‌مپ جاسازی شده حدود ۵ مگابایت اندازه دارد. تبدیل این فایل به متن استخراج شده، اندازه را به حدود ۲۰ کیلوبایت کاهش می‌دهد. از طریق یک اتصال موبایل 4G کند با سرعت ۱۵ مگابیت بر ثانیه، انتقال PDF حجیم حدود ۲.۷ ثانیه طول می‌کشد، در حالی که فایل متنی حاصل در کسری از میلی‌ثانیه دانلود می‌شود.

پرسش‌های متداول

چگونه PDF اسکن شده را بدون افت کیفیت به متن استخراج شده تبدیل کنیم؟

از آنجا که PDFهای اسکن شده صفحات سند را به عنوان تصاویر رستر با افت کیفیت یا بدون افت کیفیت ذخیره می‌کنند، فرآیند استخراج OCR به عنوان یک مرحله ترجمه عمل می‌کند تا یک ترامکد مستقیم. فایل‌های متنی کیفیت بصری یا قالب‌بندی را ذخیره نمی‌کنند. دقت تبدیل کاملاً به وضوح بیت‌مپ منبع و دقت الگوریتم‌های تشخیص کاراکتر بستگی دارد.

تفاوت بین PDF اسکن شده و متن استخراج شده چیست؟

یک PDF اسکن شده یک کانتینر سند است که از الگوریتم‌های فشرده‌سازی باینری برای ذخیره تصاویر صفحه به صورت پیکسل استفاده می‌کند. متن استخراج شده یک فایل متنی ساده است که فقط شامل کدهای کاراکتری خام بدون هیچ‌گونه فشرده‌سازی، سربار کانتینر، استایل‌دهی یا تصاویر است.