Taranmış PDF'ten Metin Çıkarma Dönüştürücüsü

Taranmış bir PDF'i metne dönüştürmek, belge resimlerini düzenlenebilir düz metin karakterlerine dönüştürür.

Dosya seçin veya sürükleyin

Dosyaları buraya seçin veya bırakın

Kesinlikle %100 tarayıcı içi gizli dönüşüm - dosyalar asla cihazınızdan ayrılmaz

veya yapıştırın Ctrl+V
Sıfır Ağ Aktarımı Gizlilik Garantisi: Harici sunuculara 0 bayt yüklendi. Tüm işlemler tarayıcınızın korumalı alanında (sandbox) yerel olarak gerçekleştirildi.

Format Karşılaştırması ve Teknik Özellikler

ÖzellikSCANNED-PDFTXT
MIME Türüapplication/pdftext/plain
Türscanned bitmap PDF documentplain text
SıkıştırmaFlate / JBIG2 / DCT compressionnone
Standart ŞartnameISO 32000-2:2020Unicode Standard / UTF-8 RFC 3629
Sihirli Bayt Başlığı (Magic Bytes)25 50 44 46 2D (%PDF-)UTF-8 / ASCII plain stream

Format Genel Bakışı ve Kullanım Alanları

Taranmış bir PDF, temelde bir belge kapsayıcısının içine sarılmış dijital resimlerden oluşan bir koleksiyondur. Kullanıcıların bu resim dosyalarındaki kelimeleri düzenlemesi, araması veya indekslemesi gerektiğinde, standart belge görüntüleyicileri harfler yerine yalnızca pikselleri gördükleri için başarısız olur. Taranmış bir PDF'i metne dönüştürmek, Optik Karakter Tanıma yazılımına dayanır. Bu işlem adımı piksel ızgaralarını tarar, harf şekillerini tanımlar ve temiz dizeleri evrensel bir metin dosyasına aktarır. Hukuk büroları, tarih arşivleri ve kütüphaneler bu dönüştürme iş akışını günlük olarak kullanır. Düz yataklı tarayıcılardan geçirilen kağıt kayıtlar depolama alanı kaplar ve anahtar kelime aramalarına direnir. Bu resim PDF'lerini düz metne dönüştürmek, milyonlarca sayfanın saniyeler içinde aranabilmesini sağlar. Yazılım geliştiriciler ayrıca bu hattı, makine öğrenimi modellerini eğitmek ve taranmış fişlerden, faturalardan ve devlet formlarından manuel yazma gerektirmeden ham veri çıkarmak için kullanır.

Teknik Özellikler ve Kodek Ayrıntıları

Taranmış bir PDF, application/pdf MIME türünü kullanır ve tipik olarak %PDF sihirli bayt imzasıyla başlar, ardından bir sürüm numarası gelir. Kapsayıcının içinde sayfa içeriği, taranmış bitmap'leri depolamak için Flate, JBIG2 veya DCT gibi resim sıkıştırma codec bileşenlerine dayanır. Metne dönüştürme işlemi, MIME türünü sihirli baytlar veya sıkıştırma olmadan text/plain olarak değiştirir. OCR motoru sıkıştırılmış bitmap verilerini okur, piksel matrislerinin kodunu çözer ve ham ASCII veya UTF-8 karakter dizileri üretir. TXT sıfır biçimlendirme, stil, yazı tipi veya resim içerdiğinden, çıktı dosyası boyutu kaynak PDF'ye kıyasla önemli ölçüde düşer.

İşletim Sistemi ve Tarayıcı Uyumluluğu

Windows, macOS, Linux, iOS ve Android gibi işletim sistemleri; Notepad, TextEdit ve Nano gibi yerleşik metin düzenleyicileri kullanarak TXT dosyalarını yerel olarak açar. Web tarayıcıları metin belgelerini eklenti gerektirmeden anında görüntüler. Buna karşılık, taranmış PDF'ler düzgün bir şekilde görüntülenmek için özel PDF okuyuculara veya tarayıcı işleme motorlarına ihtiyaç duyar. Taranmış belgeleri düz metne dönüştürmek, eski sistemlerde, komut satırı arayüzlerinde ve basit metin işleme betiklerinde uyumluluk sağlar.

💡 Faydalı bilgiler

OCR motorunun temiz harf kenarlarını yakalamasına yardımcı olmak ve karakter tanıma hatalarını azaltmak için kaynak tarama çözünürlüğünü 300 DPI veya daha yüksek tutun.

Format Karşılaştırması ve Teknik Özellikler

Tipik 10 sayfalık taranmış bir PDF belgesi, gömülü bitmap resimler nedeniyle yaklaşık 5 MB boyutundadır. Bu dosyayı metne dönüştürmek boyutu yaklaşık 20 KB'a düşürür. Saniyede 15 megabit hızındaki yavaş bir 4G mobil bağlantı üzerinden, devasa PDF'yi aktarmak yaklaşık 2.7 sürerken, ortaya çıkan metin dosyası milisaniyenin küçük bir kısmında indirilir.

Sıkça Sorulan Sorular

Taranmış PDF'i kalite kaybetmeden metne nasıl dönüştürebilirim?

Taranmış PDF'ler belge sayfalarını kayıplı veya kayıpsız raster resimler olarak depoladığından, OCR çıkarma süreci doğrudan bir kod dönüştürmeden ziyade bir çeviri adımı görevi görür. Metin dosyaları görsel kaliteyi veya biçimlendirmeyi depolamaz. Dönüştürmenin doğruluğu tamamen kaynak bitmap'in çözünürlüğüne ve karakter tanıma algoritmalarının hassasiyetine bağlıdır.

Taranmış PDF ile Metin arasındaki fark nedir?

Taranmış PDF, sayfa resimlerini piksel olarak depolamak için ikili sıkıştırma algoritmaları kullanan bir belge kapsayıcısıdır. Çıkarılan Metin ise herhangi bir sıkıştırma, kapsayıcı yükü, biçimlendirme veya resim içermeyen, yalnızca ham karakter kodlarını barındıran düz bir metin dosyasıdır.