Scanned PDF to Extracted Text Converter
Converting a scanned PDF to extracted text transforms image-based document pictures into editable plain text characters.
ফরম্যাট তুলনা এবং প্রযুক্তিগত বৈশিষ্ট্য
| বৈশিষ্ট্য | SCANNED-PDF | TXT |
|---|---|---|
| MIME টাইপ | application/pdf | text/plain |
| ধরন | scanned bitmap PDF document | plain text |
| কম্প্রেশন | Flate / JBIG2 / DCT compression | none |
| স্ট্যান্ডার্ড বৈশিষ্ট্য | ISO 32000-2:2020 | Unicode Standard / UTF-8 RFC 3629 |
| ম্যাজিক বাইটস হেডার | 25 50 44 46 2D (%PDF-) | UTF-8 / ASCII plain stream |
ফরম্যাটের ওভারভিউ এবং ব্যবহার
একটি স্ক্যান করা পিডিএফ মূলত একটি ডকুমেন্ট কন্টেইনারের ভেতরে মোড়ানো ডিজিটাল ছবির একটি সংগ্রহ। ব্যবহারকারীদের যখন এই ইমেজ ফাইলের ভেতরের শব্দগুলি সম্পাদনা, অনুসন্ধান বা ইনডেক্স করতে হয়, তখন স্ট্যান্ডার্ড ডকুমেন্ট ভিউয়ারগুলি ব্যর্থ হয় কারণ তারা অক্ষর দেখার পরিবর্তে কেবল পিক্সেল দেখতে পায়। স্ক্যান করা পিডিএফ থেকে টেক্সট নিষ্কাশন করা অপটিক্যাল ক্যারেক্টার রিকগনিশন সফটওয়্যারের উপর নির্ভর করে। এই প্রসেসিং ধাপটি পিক্সেল গ্রিড স্ক্যান করে, অক্ষরের আকার চিহ্নিত করে এবং পরিচ্ছন্ন স্ট্রিংগুলিকে একটি ইউনিভার্সাল টেক্সট ফাইলে আউটপুট করে। আইনি অফিস, ঐতিহাসিক আর্কাইভ এবং লাইব্রেরিগুলি প্রতিদিন এই রূপান্তর প্রক্রিয়াটি ব্যবহার করে। ফ্ল্যাটবেড স্ক্যানে রূপান্তরিত কাগজের রেকর্ডগুলি স্টোরেজ স্পেস নেয় এবং কিওয়ার্ড অনুসন্ধানে বাধা সৃষ্টি করে। এই ইমেজ পিডিএফগুলিকে সাধারণ টেক্সটে প্রক্রিয়া করলে লক্ষ লক্ষ পৃষ্ঠা সেকেন্ডের মধ্যে অনুসন্ধানযোগ্য হয়ে ওঠে। সফটওয়্যার ডেভেলপাররাও ম্যানুয়াল টাইপিং ছাড়াই স্ক্যান করা রসিদ, চালান এবং সরকারি ফর্ম থেকে কাঁচা ডেটা নিষ্কাশন করতে এবং মেশিন লার্নিং মডেলগুলিকে প্রশিক্ষণ দিতে এই পাইপলাইন ব্যবহার করেন।
প্রযুক্তিগত বৈশিষ্ট্য এবং কোডেক বিভাজন
একটি স্ক্যান করা পিডিএফ application/pdf MIME টাইপ ব্যবহার করে এবং সাধারণত একটি সংস্করণ নম্বর দ্বারা অনুসৃত ম্যাজিক বাইট স্বাক্ষর %PDF দিয়ে শুরু হয়। কন্টেইনারের ভিতরে, পৃষ্ঠার সামগ্রীগুলি রাস্টারাইজড বিটম্যাপ সংরক্ষণ করার জন্য Flate, JBIG2, বা DCT-এর মতো ইমেজ কম্প্রেশন কোডেকগুলির উপর নির্ভর করে। Extracted Text-এ রূপান্তর করলে MIME টাইপ text/plain-এ পরিবর্তিত হয় যার কোনো ম্যাজিক বাইট বা কম্প্রেশন থাকে না। OCR ইঞ্জিন কম্প্রেসড বিটম্যাপ ডেটা পড়ে, পিক্সেল ম্যাট্রিক্স ডিকোড করে এবং র ASCII বা UTF-8 ক্যারেক্টার সিকোয়েন্স আউটপুট করে। যেহেতু TXT-এ কোনো ফরম্যাটিং, স্টাইল, ফন্ট বা ছবি থাকে না, তাই সোর্স পিডিএফের তুলনায় আউটপুট ফাইলের সাইজ নাটকীয়ভাবে কমে যায়।
OS এবং ব্রাউজার সামঞ্জস্য
উইন্ডোজ, ম্যাকওএস, লিনাক্স, আইওএস এবং অ্যান্ড্রয়েডের মতো অপারেটিং সিস্টেমগুলি নোটপ্যাড, টেক্সটএডিট এবং ন্যানোর মতো বিল্ট-ইন টেক্সট এডিটর ব্যবহার করে নেটিভভাবে TXT ফাইল ওপেন করে। ওয়েব ব্রাউজারগুলি প্লাগইন ছাড়াই তাৎক্ষণিকভাবে টেক্সট ডকুমেন্ট প্রদর্শন করে। বিপরীতে, স্ক্যান করা পিডিএফগুলি সঠিকভাবে প্রদর্শন করার জন্য ডেডিকেটেড পিডিএফ রিডার বা ব্রাউজার রেন্ডারিং ইঞ্জিনের প্রয়োজন হয়। স্ক্যান করা ডকুমেন্টগুলিকে সাধারণ টেক্সটে রূপান্তর করলে লেগ্যাসি সিস্টেম, কমান্ড-লাইন ইন্টারফেস এবং সহজ টেক্সট প্রসেসিং স্ক্রিপ্ট জুড়ে সামঞ্জস্যতা নিশ্চিত হয়।
💡 উপকারী তথ্য
OCR ইঞ্জিনকে অক্ষরের স্পষ্ট প্রান্ত ধরতে সাহায্য করতে এবং অক্ষর শনাক্তকরণের ত্রুটি কমাতে সোর্স স্ক্যান রেজোলিউশন ৩০০ DPI বা তার বেশি রাখুন।
ফরম্যাট তুলনা এবং প্রযুক্তিগত বৈশিষ্ট্য
একটি সাধারণ ১০-পৃষ্ঠার স্ক্যান করা পিডিএফ ডকুমেন্টের সাইজ এমবেডেড বিটম্যাপ ইমেজের কারণে প্রায় ৫ এমবি হয়। এই ফাইলটিকে Extracted Text-এ রূপান্তর করলে সাইজ কমে প্রায় ২০ কিলোবাইটে দাঁড়ায়। প্রতি সেকেন্ডে ১৫ মেগাবিট গতির একটি ধীরগতির 4G মোবাইল সংযোগে, বিশাল পিডিএফ স্থানান্তর করতে প্রায় ২.৭ সেকেন্ড সময় লাগে, যেখানে ফলাফলস্বরূপ টেক্সট ফাইলটি এক মিলিসেকেন্ডের ভগ্নাংশে ডাউনলোড হয়ে যায়।
সচরাচর জিজ্ঞাসিত প্রশ্নাবলী
কোয়ালিটি না কমিয়ে কীভাবে Scanned PDF থেকে Extracted Text-এ রূপান্তর করবেন?
যেহেতু স্ক্যান করা পিডিএফ ডকুমেন্ট পেজগুলিকে লসি বা লসলেস রাস্টার ইমেজ হিসেবে সংরক্ষণ করে, তাই OCR নিষ্কাশন প্রক্রিয়াটি সরাসরি ট্রান্সকোড করার পরিবর্তে একটি অনুবাদ পদক্ষেপ হিসেবে কাজ করে। টেক্সট ফাইলগুলি ভিজ্যুয়াল কোয়ালিটি বা ফরম্যাটিং সংরক্ষণ করে না। রূপান্তরটির নির্ভুলতা সম্পূর্ণভাবে সোর্স বিটম্যাপের রেজোলিউশন এবং ক্যারেক্টার রিকগনিশন অ্যালগরিদমের নির্ভুলতার উপর নির্ভর করে।
Scanned PDF এবং Extracted Text-এর মধ্যে পার্থক্য কী?
স্ক্যান করা পিডিএফ হলো পিক্সেল হিসেবে পৃষ্ঠার ছবি সংরক্ষণ করার জন্য বাইনারি কম্প্রেশন অ্যালগরিদম ব্যবহার করা একটি ডকুমেন্ট কন্টেইনার। Extracted Text হলো কোনো কম্প্রেশন, কন্টেইনার ওভারহেড, স্টাইলিং বা ছবি ছাড়াই শুধুমাত্র কাঁচা ক্যারেক্টার কোড ধারণকারী একটি সাধারণ টেক্সট ফাইল।