ตัวแปลง PDF ที่สแกนเป็นข้อความที่ดึงออกมา

การแปลง PDF ที่สแกนเป็นข้อความที่ดึงออกมา จะเปลี่ยนรูปภาพเอกสารให้กลายเป็นตัวอักษรข้อความธรรมดาที่สามารถแก้ไขได้

เลือกหรือลากไฟล์

เลือกหรือวางไฟล์ที่นี่

การแปลงไฟล์แบบส่วนตัว 100% ในเบราว์เซอร์ - ไฟล์จะไม่ rời ออกจากอุปกรณ์ของคุณ

หรือวาง Ctrl+V
การรับประกันความเป็นส่วนตัวแบบไม่มีการส่งผ่านเครือข่าย: อัปโหลด 0 ไบต์ไปยังเซิร์ฟเวอร์ภายนอก การประมวลผลทั้งหมดเกิดขึ้นภายในแซนด์บ็อกซ์ของเบราว์เซอร์ของคุณ

การเปรียบเทียบรูปแบบและข้อกำหนดทางเทคนิค

ข้อกำหนดSCANNED-PDFTXT
ประเภท MIMEapplication/pdftext/plain
ประเภทscanned bitmap PDF documentplain text
การบีบอัดFlate / JBIG2 / DCT compressionnone
ข้อกำหนดมาตรฐานISO 32000-2:2020Unicode Standard / UTF-8 RFC 3629
ส่วนหัว Magic Bytes25 50 44 46 2D (%PDF-)UTF-8 / ASCII plain stream

ภาพรวมรูปแบบและการใช้งาน

PDF ที่สแกนคือชุดของภาพดิจิทัลที่รวมอยู่ภายในคอนเทนเนอร์เอกสาร เมื่อผู้ใช้ต้องการแก้ไข ค้นหา หรือจัดทำดัชนีคำภายในไฟล์รูปภาพเหล่านี้ โปรแกรมดูเอกสารทั่วไปจะใช้งานไม่ได้เนื่องจากโปรแกรมจะมองเห็นเพียงพิกเซลไม่ใช่ตัวอักษร การแปลง PDF ที่สแกนเป็นข้อความที่ดึงออกมาอาศัยซอฟต์แวร์การรู้จำอักขระด้วยแสง ขั้นตอนการประมวลผลนี้จะสแกนกริดพิกเซล ระบุรูปร่างของตัวอักษร และส่งออกสตริงที่สะอาดลงในไฟล์ข้อความสากล สำนักงานกฎหมาย คลังเก็บประวัติศาสตร์ และห้องสมุดใช้ขั้นตอนการทำงานแปลงนี้ทุกวัน บันทึกกระดาษที่แปลงเป็นการสแกนแบบแท่นนอนจะใช้พื้นที่จัดเก็บและไม่สามารถค้นหาด้วยคีย์เวิร์ดได้ การประมวลผล PDF รูปภาพเหล่านี้ให้เป็นข้อความธรรมดาทำให้หน้าเอกสารนับล้านหน้าสามารถค้นหาได้ภายในไม่กี่วินาที นอกจากนี้ นักพัฒนาซอฟต์แวร์ยังใช้ไปพไลน์นี้เพื่อฝึกฝนโมเดลการเรียนรู้ของเครื่องและดึงข้อมูลดิบจากใบเสร็จที่สแกน ใบแจ้งหนี้ และแบบฟอร์มของรัฐบาลโดยไม่ต้องพิมพ์ด้วยมือ

ข้อมูลทางเทคนิคและรายละเอียดตัวแปลงสัญญาณ (Codec)

PDF ที่สแกนใช้ประเภท MIME application/pdf และมักจะเริ่มต้นด้วยลายเซ็นไบต์เวทมนตร์ %PDF ตามด้วยหมายเลขรุ่น ภายในคอนเทนเนอร์ เนื้อหาของหน้าจะอาศัยตัวแปลงสัญญาณการบีบอัดภาพ เช่น Flate, JBIG2 หรือ DCT เพื่อจัดเก็บพิกเซลบิตแมป การแปลงเป็นข้อความที่ดึงออกมาจะเปลี่ยนประเภท MIME เป็น text/plain โดยไม่มีไบต์เวทมนตร์หรือการบีบอัดใดๆ เอ็นจิ้น OCR จะอ่านข้อมูลบิตแมปที่บีบอัด ถอดรหัสเมทริกซ์พิกเซล และส่งออกลำดับอักขระ ASCII หรือ UTF-8 ดิบ เนื่องจาก TXT ไม่มีรูปแบบ รูปแบบตัวอักษร แบบอักษร หรือรูปภาพ ขนาดไฟล์ผลลัพธ์จึงลดลงอย่างมากเมื่อเทียบกับ PDF ต้นทาง

ความเข้ากันได้ของระบบปฏิบัติการและเบราว์เซอร์

ระบบปฏิบัติการ เช่น Windows, macOS, Linux, iOS และ Android เปิดไฟล์ TXT ได้โดยตรงโดยใช้โปรแกรมแก้ไขข้อความในตัว เช่น Notepad, TextEdit และ Nano เว็บเบราว์เซอร์แสดงเอกสารข้อความได้ทันทีโดยไม่ต้องใช้ปลั๊กอิน ในทางตรงกันข้าม PDF ที่สแกนต้องอาศัยโปรแกรมอ่าน PDF หรือเอ็นจิ้นการเรนเดอร์ของเบราว์เซอร์โดยเฉพาะจึงจะแสดงผลได้อย่างถูกต้อง การแปลงเอกสารที่สแกนเป็นข้อความธรรมดาช่วยให้มั่นใจได้ถึงความเข้ากันได้ข้ามระบบรุ่นเก่า อินเทอร์เฟซบรรทัดคำสั่ง และสคริปต์ประมวลผลข้อความอย่างง่าย

💡 ข้อมูลที่เป็นประโยชน์

รักษาความละเอียดในการสแกนต้นทางไว้ที่ 300 DPI หรือสูงกว่า เพื่อช่วยให้เอ็นจิ้น OCR จับขอบตัวอักษรที่สะอาดและลดข้อผิดพลาดในการรู้จำอักขระ

การเปรียบเทียบรูปแบบและข้อกำหนดทางเทคนิค

เอกสาร PDF ที่สแกนทั่วไปความยาว 10 หน้า มีขนาดประมาณ 5 MB เนื่องจากมีภาพบิตแมปฝังอยู่ การแปลงไฟล์นี้เป็นข้อความที่ดึงออกมาจะช่วยลดขนาดลงเหลือประมาณ 20 KB ผ่านการเชื่อมต่อมือถือ 4G ที่ช้าที่ 15 เมกะบิตต่อวินาที การถ่ายโอน PDF ขนาดใหญ่จะใช้เวลาประมาณ 2.7 秒 ในขณะที่ไฟล์ข้อความที่ได้จะดาวน์โหลดเสร็จภายในเสี้ยวของมิลลิวินาที

คำถามที่พบบ่อย

จะแปลง PDF ที่สแกนเป็นข้อความที่ดึงออกมาโดยไม่สูญเสียคุณภาพได้อย่างไร

เนื่องจาก PDF ที่สแกนจะจัดเก็บหน้าเอกสารเป็นภาพแรสเตอร์แบบสูญเสียข้อมูลหรือไม่สูญเสียข้อมูล กระบวนการดึงข้อมูล OCR จึงทำหน้าที่เป็นขั้นตอนการแปลงมากกว่าการแปลงรหัสโดยตรง ไฟล์ข้อความไม่ได้จัดเก็บคุณภาพภาพหรือรูปแบบ ความแม่นยำของการแปลงขึ้นอยู่กับความละเอียดของบิตแมปต้นทางและความแม่นยำของอัลกอริทึมการรู้จำอักขระอย่างสมบูรณ์

PDF ที่สแกนและข้อความที่ดึงออกมาแตกต่างกันอย่างไร

PDF ที่สแกนคือคอนเทนเนอร์เอกสารที่ใช้อัลกอริทึมการบีบอัดไบนารีเพื่อจัดเก็บภาพหน้าเป็นพิกเซล ข้อความที่ดึงออกมาคือไฟล์ข้อความธรรมดาที่มีรหัสอักขระดิบเท่านั้น โดยไม่มีการบีบอัด ค่าใช้จ่ายส่วนเกินของคอนเทนเนอร์ การจัดรูปแบบ หรือรูปภาพ