ตัวแปลง PDF ที่สแกนเป็นข้อความที่ดึงออกมา
การแปลง PDF ที่สแกนเป็นข้อความที่ดึงออกมา จะเปลี่ยนรูปภาพเอกสารให้กลายเป็นตัวอักษรข้อความธรรมดาที่สามารถแก้ไขได้
การเปรียบเทียบรูปแบบและข้อกำหนดทางเทคนิค
| ข้อกำหนด | SCANNED-PDF | TXT |
|---|---|---|
| ประเภท MIME | application/pdf | text/plain |
| ประเภท | scanned bitmap PDF document | plain text |
| การบีบอัด | Flate / JBIG2 / DCT compression | none |
| ข้อกำหนดมาตรฐาน | ISO 32000-2:2020 | Unicode Standard / UTF-8 RFC 3629 |
| ส่วนหัว Magic Bytes | 25 50 44 46 2D (%PDF-) | UTF-8 / ASCII plain stream |
ภาพรวมรูปแบบและการใช้งาน
PDF ที่สแกนคือชุดของภาพดิจิทัลที่รวมอยู่ภายในคอนเทนเนอร์เอกสาร เมื่อผู้ใช้ต้องการแก้ไข ค้นหา หรือจัดทำดัชนีคำภายในไฟล์รูปภาพเหล่านี้ โปรแกรมดูเอกสารทั่วไปจะใช้งานไม่ได้เนื่องจากโปรแกรมจะมองเห็นเพียงพิกเซลไม่ใช่ตัวอักษร การแปลง PDF ที่สแกนเป็นข้อความที่ดึงออกมาอาศัยซอฟต์แวร์การรู้จำอักขระด้วยแสง ขั้นตอนการประมวลผลนี้จะสแกนกริดพิกเซล ระบุรูปร่างของตัวอักษร และส่งออกสตริงที่สะอาดลงในไฟล์ข้อความสากล สำนักงานกฎหมาย คลังเก็บประวัติศาสตร์ และห้องสมุดใช้ขั้นตอนการทำงานแปลงนี้ทุกวัน บันทึกกระดาษที่แปลงเป็นการสแกนแบบแท่นนอนจะใช้พื้นที่จัดเก็บและไม่สามารถค้นหาด้วยคีย์เวิร์ดได้ การประมวลผล PDF รูปภาพเหล่านี้ให้เป็นข้อความธรรมดาทำให้หน้าเอกสารนับล้านหน้าสามารถค้นหาได้ภายในไม่กี่วินาที นอกจากนี้ นักพัฒนาซอฟต์แวร์ยังใช้ไปพไลน์นี้เพื่อฝึกฝนโมเดลการเรียนรู้ของเครื่องและดึงข้อมูลดิบจากใบเสร็จที่สแกน ใบแจ้งหนี้ และแบบฟอร์มของรัฐบาลโดยไม่ต้องพิมพ์ด้วยมือ
ข้อมูลทางเทคนิคและรายละเอียดตัวแปลงสัญญาณ (Codec)
PDF ที่สแกนใช้ประเภท MIME application/pdf และมักจะเริ่มต้นด้วยลายเซ็นไบต์เวทมนตร์ %PDF ตามด้วยหมายเลขรุ่น ภายในคอนเทนเนอร์ เนื้อหาของหน้าจะอาศัยตัวแปลงสัญญาณการบีบอัดภาพ เช่น Flate, JBIG2 หรือ DCT เพื่อจัดเก็บพิกเซลบิตแมป การแปลงเป็นข้อความที่ดึงออกมาจะเปลี่ยนประเภท MIME เป็น text/plain โดยไม่มีไบต์เวทมนตร์หรือการบีบอัดใดๆ เอ็นจิ้น OCR จะอ่านข้อมูลบิตแมปที่บีบอัด ถอดรหัสเมทริกซ์พิกเซล และส่งออกลำดับอักขระ ASCII หรือ UTF-8 ดิบ เนื่องจาก TXT ไม่มีรูปแบบ รูปแบบตัวอักษร แบบอักษร หรือรูปภาพ ขนาดไฟล์ผลลัพธ์จึงลดลงอย่างมากเมื่อเทียบกับ PDF ต้นทาง
ความเข้ากันได้ของระบบปฏิบัติการและเบราว์เซอร์
ระบบปฏิบัติการ เช่น Windows, macOS, Linux, iOS และ Android เปิดไฟล์ TXT ได้โดยตรงโดยใช้โปรแกรมแก้ไขข้อความในตัว เช่น Notepad, TextEdit และ Nano เว็บเบราว์เซอร์แสดงเอกสารข้อความได้ทันทีโดยไม่ต้องใช้ปลั๊กอิน ในทางตรงกันข้าม PDF ที่สแกนต้องอาศัยโปรแกรมอ่าน PDF หรือเอ็นจิ้นการเรนเดอร์ของเบราว์เซอร์โดยเฉพาะจึงจะแสดงผลได้อย่างถูกต้อง การแปลงเอกสารที่สแกนเป็นข้อความธรรมดาช่วยให้มั่นใจได้ถึงความเข้ากันได้ข้ามระบบรุ่นเก่า อินเทอร์เฟซบรรทัดคำสั่ง และสคริปต์ประมวลผลข้อความอย่างง่าย
💡 ข้อมูลที่เป็นประโยชน์
รักษาความละเอียดในการสแกนต้นทางไว้ที่ 300 DPI หรือสูงกว่า เพื่อช่วยให้เอ็นจิ้น OCR จับขอบตัวอักษรที่สะอาดและลดข้อผิดพลาดในการรู้จำอักขระ
การเปรียบเทียบรูปแบบและข้อกำหนดทางเทคนิค
เอกสาร PDF ที่สแกนทั่วไปความยาว 10 หน้า มีขนาดประมาณ 5 MB เนื่องจากมีภาพบิตแมปฝังอยู่ การแปลงไฟล์นี้เป็นข้อความที่ดึงออกมาจะช่วยลดขนาดลงเหลือประมาณ 20 KB ผ่านการเชื่อมต่อมือถือ 4G ที่ช้าที่ 15 เมกะบิตต่อวินาที การถ่ายโอน PDF ขนาดใหญ่จะใช้เวลาประมาณ 2.7 秒 ในขณะที่ไฟล์ข้อความที่ได้จะดาวน์โหลดเสร็จภายในเสี้ยวของมิลลิวินาที
คำถามที่พบบ่อย
จะแปลง PDF ที่สแกนเป็นข้อความที่ดึงออกมาโดยไม่สูญเสียคุณภาพได้อย่างไร
เนื่องจาก PDF ที่สแกนจะจัดเก็บหน้าเอกสารเป็นภาพแรสเตอร์แบบสูญเสียข้อมูลหรือไม่สูญเสียข้อมูล กระบวนการดึงข้อมูล OCR จึงทำหน้าที่เป็นขั้นตอนการแปลงมากกว่าการแปลงรหัสโดยตรง ไฟล์ข้อความไม่ได้จัดเก็บคุณภาพภาพหรือรูปแบบ ความแม่นยำของการแปลงขึ้นอยู่กับความละเอียดของบิตแมปต้นทางและความแม่นยำของอัลกอริทึมการรู้จำอักขระอย่างสมบูรณ์
PDF ที่สแกนและข้อความที่ดึงออกมาแตกต่างกันอย่างไร
PDF ที่สแกนคือคอนเทนเนอร์เอกสารที่ใช้อัลกอริทึมการบีบอัดไบนารีเพื่อจัดเก็บภาพหน้าเป็นพิกเซล ข้อความที่ดึงออกมาคือไฟล์ข้อความธรรมดาที่มีรหัสอักขระดิบเท่านั้น โดยไม่มีการบีบอัด ค่าใช้จ่ายส่วนเกินของคอนเทนเนอร์ การจัดรูปแบบ หรือรูปภาพ