Scanned PDF to Extracted Text Converter

Converting a scanned PDF to extracted text transforms image-based document pictures into editable plain text characters.

ফাইল নির্বাচন করুন বা ড্রাগ করুন

এখানে ফাইল নির্বাচন করুন বা ড্রপ করুন

১০০% প্রাইভেট ব্রাউজার-মধ্যস্থ কনভার্শন - ফাইল কখনো আপনার ডিভাইস ছেড়ে যায় না

অথবা পেস্ট করুন Ctrl+V
জিরো-নেটওয়ার্ক-ট্রান্সমিশন প্রাইভেসি গ্যারান্টি: বাহ্যিক সার্ভারে ০ বাইট আপলোড করা হয়েছে। সমস্ত প্রক্রিয়াকরণ আপনার ব্রাউজার স্যান্ডবক্সে স্থানীয়ভাবে ঘটেছে।

ফরম্যাট তুলনা এবং প্রযুক্তিগত বৈশিষ্ট্য

বৈশিষ্ট্যSCANNED-PDFTXT
MIME টাইপapplication/pdftext/plain
ধরনscanned bitmap PDF documentplain text
কম্প্রেশনFlate / JBIG2 / DCT compressionnone
স্ট্যান্ডার্ড বৈশিষ্ট্যISO 32000-2:2020Unicode Standard / UTF-8 RFC 3629
ম্যাজিক বাইটস হেডার25 50 44 46 2D (%PDF-)UTF-8 / ASCII plain stream

ফরম্যাটের ওভারভিউ এবং ব্যবহার

একটি স্ক্যান করা পিডিএফ মূলত একটি ডকুমেন্ট কন্টেইনারের ভেতরে মোড়ানো ডিজিটাল ছবির একটি সংগ্রহ। ব্যবহারকারীদের যখন এই ইমেজ ফাইলের ভেতরের শব্দগুলি সম্পাদনা, অনুসন্ধান বা ইনডেক্স করতে হয়, তখন স্ট্যান্ডার্ড ডকুমেন্ট ভিউয়ারগুলি ব্যর্থ হয় কারণ তারা অক্ষর দেখার পরিবর্তে কেবল পিক্সেল দেখতে পায়। স্ক্যান করা পিডিএফ থেকে টেক্সট নিষ্কাশন করা অপটিক্যাল ক্যারেক্টার রিকগনিশন সফটওয়্যারের উপর নির্ভর করে। এই প্রসেসিং ধাপটি পিক্সেল গ্রিড স্ক্যান করে, অক্ষরের আকার চিহ্নিত করে এবং পরিচ্ছন্ন স্ট্রিংগুলিকে একটি ইউনিভার্সাল টেক্সট ফাইলে আউটপুট করে। আইনি অফিস, ঐতিহাসিক আর্কাইভ এবং লাইব্রেরিগুলি প্রতিদিন এই রূপান্তর প্রক্রিয়াটি ব্যবহার করে। ফ্ল্যাটবেড স্ক্যানে রূপান্তরিত কাগজের রেকর্ডগুলি স্টোরেজ স্পেস নেয় এবং কিওয়ার্ড অনুসন্ধানে বাধা সৃষ্টি করে। এই ইমেজ পিডিএফগুলিকে সাধারণ টেক্সটে প্রক্রিয়া করলে লক্ষ লক্ষ পৃষ্ঠা সেকেন্ডের মধ্যে অনুসন্ধানযোগ্য হয়ে ওঠে। সফটওয়্যার ডেভেলপাররাও ম্যানুয়াল টাইপিং ছাড়াই স্ক্যান করা রসিদ, চালান এবং সরকারি ফর্ম থেকে কাঁচা ডেটা নিষ্কাশন করতে এবং মেশিন লার্নিং মডেলগুলিকে প্রশিক্ষণ দিতে এই পাইপলাইন ব্যবহার করেন।

প্রযুক্তিগত বৈশিষ্ট্য এবং কোডেক বিভাজন

একটি স্ক্যান করা পিডিএফ application/pdf MIME টাইপ ব্যবহার করে এবং সাধারণত একটি সংস্করণ নম্বর দ্বারা অনুসৃত ম্যাজিক বাইট স্বাক্ষর %PDF দিয়ে শুরু হয়। কন্টেইনারের ভিতরে, পৃষ্ঠার সামগ্রীগুলি রাস্টারাইজড বিটম্যাপ সংরক্ষণ করার জন্য Flate, JBIG2, বা DCT-এর মতো ইমেজ কম্প্রেশন কোডেকগুলির উপর নির্ভর করে। Extracted Text-এ রূপান্তর করলে MIME টাইপ text/plain-এ পরিবর্তিত হয় যার কোনো ম্যাজিক বাইট বা কম্প্রেশন থাকে না। OCR ইঞ্জিন কম্প্রেসড বিটম্যাপ ডেটা পড়ে, পিক্সেল ম্যাট্রিক্স ডিকোড করে এবং র ASCII বা UTF-8 ক্যারেক্টার সিকোয়েন্স আউটপুট করে। যেহেতু TXT-এ কোনো ফরম্যাটিং, স্টাইল, ফন্ট বা ছবি থাকে না, তাই সোর্স পিডিএফের তুলনায় আউটপুট ফাইলের সাইজ নাটকীয়ভাবে কমে যায়।

OS এবং ব্রাউজার সামঞ্জস্য

উইন্ডোজ, ম্যাকওএস, লিনাক্স, আইওএস এবং অ্যান্ড্রয়েডের মতো অপারেটিং সিস্টেমগুলি নোটপ্যাড, টেক্সটএডিট এবং ন্যানোর মতো বিল্ট-ইন টেক্সট এডিটর ব্যবহার করে নেটিভভাবে TXT ফাইল ওপেন করে। ওয়েব ব্রাউজারগুলি প্লাগইন ছাড়াই তাৎক্ষণিকভাবে টেক্সট ডকুমেন্ট প্রদর্শন করে। বিপরীতে, স্ক্যান করা পিডিএফগুলি সঠিকভাবে প্রদর্শন করার জন্য ডেডিকেটেড পিডিএফ রিডার বা ব্রাউজার রেন্ডারিং ইঞ্জিনের প্রয়োজন হয়। স্ক্যান করা ডকুমেন্টগুলিকে সাধারণ টেক্সটে রূপান্তর করলে লেগ্যাসি সিস্টেম, কমান্ড-লাইন ইন্টারফেস এবং সহজ টেক্সট প্রসেসিং স্ক্রিপ্ট জুড়ে সামঞ্জস্যতা নিশ্চিত হয়।

💡 উপকারী তথ্য

OCR ইঞ্জিনকে অক্ষরের স্পষ্ট প্রান্ত ধরতে সাহায্য করতে এবং অক্ষর শনাক্তকরণের ত্রুটি কমাতে সোর্স স্ক্যান রেজোলিউশন ৩০০ DPI বা তার বেশি রাখুন।

ফরম্যাট তুলনা এবং প্রযুক্তিগত বৈশিষ্ট্য

একটি সাধারণ ১০-পৃষ্ঠার স্ক্যান করা পিডিএফ ডকুমেন্টের সাইজ এমবেডেড বিটম্যাপ ইমেজের কারণে প্রায় ৫ এমবি হয়। এই ফাইলটিকে Extracted Text-এ রূপান্তর করলে সাইজ কমে প্রায় ২০ কিলোবাইটে দাঁড়ায়। প্রতি সেকেন্ডে ১৫ মেগাবিট গতির একটি ধীরগতির 4G মোবাইল সংযোগে, বিশাল পিডিএফ স্থানান্তর করতে প্রায় ২.৭ সেকেন্ড সময় লাগে, যেখানে ফলাফলস্বরূপ টেক্সট ফাইলটি এক মিলিসেকেন্ডের ভগ্নাংশে ডাউনলোড হয়ে যায়।

সচরাচর জিজ্ঞাসিত প্রশ্নাবলী

কোয়ালিটি না কমিয়ে কীভাবে Scanned PDF থেকে Extracted Text-এ রূপান্তর করবেন?

যেহেতু স্ক্যান করা পিডিএফ ডকুমেন্ট পেজগুলিকে লসি বা লসলেস রাস্টার ইমেজ হিসেবে সংরক্ষণ করে, তাই OCR নিষ্কাশন প্রক্রিয়াটি সরাসরি ট্রান্সকোড করার পরিবর্তে একটি অনুবাদ পদক্ষেপ হিসেবে কাজ করে। টেক্সট ফাইলগুলি ভিজ্যুয়াল কোয়ালিটি বা ফরম্যাটিং সংরক্ষণ করে না। রূপান্তরটির নির্ভুলতা সম্পূর্ণভাবে সোর্স বিটম্যাপের রেজোলিউশন এবং ক্যারেক্টার রিকগনিশন অ্যালগরিদমের নির্ভুলতার উপর নির্ভর করে।

Scanned PDF এবং Extracted Text-এর মধ্যে পার্থক্য কী?

স্ক্যান করা পিডিএফ হলো পিক্সেল হিসেবে পৃষ্ঠার ছবি সংরক্ষণ করার জন্য বাইনারি কম্প্রেশন অ্যালগরিদম ব্যবহার করা একটি ডকুমেন্ট কন্টেইনার। Extracted Text হলো কোনো কম্প্রেশন, কন্টেইনার ওভারহেড, স্টাইলিং বা ছবি ছাড়াই শুধুমাত্র কাঁচা ক্যারেক্টার কোড ধারণকারী একটি সাধারণ টেক্সট ফাইল।