Trình chuyển đổi PDF quét sang văn bản trích xuất

Chuyển đổi tệp PDF đã quét thành văn bản được trích xuất giúp biến các hình ảnh tài liệu thành các ký tự văn bản thuần túy có thể chỉnh sửa.

Chọn hoặc kéo tệp

Chọn hoặc thả tệp vào đây

Chuyển đổi 100% riêng tư trong trình duyệt - tệp không bao giờ rời khỏi thiết bị của bạn

hoặc dán Ctrl+V
Cam kết bảo mật không truyền tải qua mạng: 0 byte được tải lên máy chủ bên ngoài. Toàn bộ quá trình xử lý diễn ra cục bộ trong hộp cát trình duyệt của bạn.

So sánh định dạng & Thông số kỹ thuật

Thông số kỹ thuậtSCANNED-PDFTXT
Kiểu MIMEapplication/pdftext/plain
Loạiscanned bitmap PDF documentplain text
NénFlate / JBIG2 / DCT compressionnone
Thông số chuẩnISO 32000-2:2020Unicode Standard / UTF-8 RFC 3629
Phần đầu Magic Bytes25 50 44 46 2D (%PDF-)UTF-8 / ASCII plain stream

Tổng quan định dạng & Ứng dụng

Một tệp PDF được quét về cơ bản là một tập hợp các hình ảnh kỹ thuật số được bọc bên trong một vùng chứa tài liệu. Khi người dùng cần chỉnh sửa, tìm kiếm hoặc lập chỉ mục các từ bên trong các tệp hình ảnh này, các trình xem tài liệu tiêu chuẩn sẽ thất bại vì chúng chỉ nhận diện điểm ảnh thay vì chữ cái. Việc chuyển đổi PDF đã quét sang văn bản trích xuất dựa vào phần mềm Nhận dạng ký tự quang học. Bước xử lý này quét các lưới điểm ảnh, nhận diện hình dạng chữ cái và xuất các chuỗi sạch thành một tệp văn bản phổ quát. Các văn phòng pháp lý, kho lưu trữ lịch sử và thư viện sử dụng quy trình chuyển đổi này hàng ngày. Các bản ghi giấy được chuyển đổi thành bản quét mặt phẳng chiếm không gian lưu trữ và khó tìm kiếm từ khóa. Việc xử lý các tệp PDF hình ảnh này thành văn bản thuần túy giúp hàng triệu trang có thể tìm kiếm trong vài giây. Các nhà phát triển phần mềm cũng sử dụng đường ống này để huấn luyện các mô hình học máy và trích xuất dữ liệu thô từ biên lai, hóa đơn và biểu mẫu chính phủ đã quét mà không cần gõ thủ công.

Thông số kỹ thuật & Phân tích codec

Tệp PDF đã quét sử dụng loại MIME application/pdf và thường bắt đầu bằng chữ ký byte nhận dạng %PDF, theo sau là số phiên bản. Bên trong vùng chứa, nội dung trang dựa trên các codec nén hình ảnh như Flate, JBIG2 hoặc DCT để lưu trữ các bản đồ điểm ảnh dạng raster. Việc chuyển đổi sang văn bản trích xuất thay đổi loại MIME thành text/plain mà không có byte nhận dạng hoặc nén. Công cụ OCR đọc dữ liệu bản đồ điểm ảnh đã nén, giải mã các ma trận điểm ảnh và xuất các chuỗi ký tự ASCII hoặc UTF-8 thô. Do TXT hoàn toàn không chứa định dạng, kiểu dáng, phông chữ hoặc hình ảnh, kích thước tệp đầu ra giảm đi đáng kể so với tệp PDF nguồn.

Khả năng tương thích hệ điều hành & trình duyệt

Các hệ điều hành như Windows, macOS, Linux, iOS và Android mở nguyên bản các tệp TXT bằng các trình soạn thảo văn bản tích hợp sẵn như Notepad, TextEdit và Nano. Trình duyệt web hiển thị tài liệu văn bản ngay lập tức mà không cần tiện ích bổ sung. Ngược lại, các tệp PDF đã quét yêu cầu các trình đọc PDF chuyên dụng hoặc công cụ kết xuất trình duyệt để hiển thị đúng cách. Việc chuyển đổi tài liệu quét sang văn bản thuần túy đảm bảo tính tương thích trên các hệ thống cũ, giao diện dòng lệnh và các tập lệnh xử lý văn bản đơn giản.

💡 Thông tin hữu ích

Giữ độ phân giải quét nguồn ở mức 300 DPI trở lên để giúp công cụ OCR nắm bắt các cạnh chữ sạch sẽ và giảm lỗi nhận dạng ký tự.

So sánh định dạng & Thông số kỹ thuật

Một tài liệu PDF quét 10 trang điển hình có dung lượng khoảng 5 MB do các hình ảnh bitmap nhúng. Việc chuyển đổi tệp này sang văn bản trích xuất làm giảm dung lượng xuống khoảng 20 KB. Qua kết nối di động 4G chậm ở tốc độ 15 megabit mỗi giây, việc truyền tệp PDF cồng kềnh mất khoảng 2,7 giây, trong khi tệp văn bản kết quả được tải xuống trong một phần nghìn giây.

Câu hỏi thường gặp

Làm thế nào để chuyển đổi PDF đã quét sang văn bản trích xuất mà không làm giảm chất lượng?

Bởi vì các tệp PDF quét lưu trữ các trang tài liệu dưới dạng hình ảnh raster có tổn hao hoặc không tổn hao, quá trình trích xuất OCR hoạt động như một bước dịch thay vì mã hóa chuyển đổi trực tiếp. Các tệp văn bản không lưu trữ chất lượng trực quan hoặc định dạng. Độ chính xác của việc chuyển đổi phụ thuộc hoàn toàn vào độ phân giải của bitmap nguồn và độ chính xác của các thuật toán nhận dạng ký tự.

Sự khác biệt giữa PDF đã quét và văn bản trích xuất là gì?

PDF quét là một vùng chứa tài liệu sử dụng các thuật toán nén nhị phân để lưu trữ hình ảnh trang dưới dạng điểm ảnh. Văn bản trích xuất là một tệp văn bản thuần túy chỉ chứa các mã ký tự thô mà không có nén, chi phí vùng chứa, kiểu dáng hoặc hình ảnh.