PDF'i Metne Çevirme (Düzenleme ve Analiz İçin Ham Metin Çıkarın)
Herhangi bir PDF'ten ham metni düzenleme, betik ya da analiz için düz bir .txt dosyasına çıkarın — ücretsiz, kayıt yok. PDF taramaysa ne yapılacağı dahil.

Bazen PDF, tam anlamıyla yanlış kaptır. Fontları, kenar boşluklarını ya da iki sütunlu yerleşimi istemezsiniz — ham madde olarak kelimeleri istersiniz: bir düzenleyiciye yapıştırmak, bir betikten geçirmek, saymak, çevirmek, içinde arama yapmak, bir analize beslemek için. PDF'i düz metne çevirmek, içerik dışındaki her şeyi soyar — ve amaç da tam olarak budur.
İnsanların bunu yapmasının tipik nedenleri:
- Düzenleme — PDF düzenleyicilerle boğuşmadan sözleşme kalıplarını ya da rapor metnini yeniden işlemek.
- Betik ve analiz — grep, kelime frekansları, veri boru hatları, düz metin yiyen araçlara belge beslemek.
- Çeviri — çoğu çeviri iş akışı stilli belge değil, temiz metin ister.
- Erişilebilirlik ve taşınabilirlik — bir .txt, 30 yıllık bir makineye kadar her şeyde açılır.
Başlamadan bir not: pdfty'deki Metin çıkarma aynı motordur — ikisi de PDF'teki gömülü metni çeker. Hangisine önce ulaşırsanız aynı kelimeleri verir; PDF'ten TXT'ye onları indirilebilir bir .txt dosyası olarak geri verir.
PDF'i metne çevirme — adım adım
Aracı açın
pdfty.com/tr/tools/pdf-to-txt adresine gidin. 20 MB ve 50 sayfaya kadar ücretsiz, hesap gerekmez.
PDF'inizi yükleyin
Sürükleyin. Parola korumalıysa önce Kilit Açma uygulayın.
Çevirin
Gömülü metin katmanı her sayfadan sırayla okunur. Birkaç saniye.
.txt'yi indirin
Belgenin tam metnini içeren tek bir düz metin dosyası. Yüklemeler 1 saat sonra otomatik silinir.
Çıktıyı gözden geçirin
Bir kez tarayın. Boş ya da anlamsızsa PDF'iniz bir taramadır — aşağıdaki OCR bölümüne bakın.

Tarama sorunu: çıkarılacak metin olmadığında
PDF metin çıkarmada en yaygın sürpriz budur. Bir PDF, metnini iki bambaşka biçimde içerebilir:
- Dijital PDF'ler (Word'den, bir web sitesinden, bir fatura sisteminden dışa aktarılanlar) gerçek bir metin katmanı taşır. Çıkarma anında ve doğrudur.
- Taranmış PDF'ler (tarayıcıdan ya da telefon kamerasından) yalnızca metnin resimlerini içerir. Çıkarılacak kelimenin tam anlamıyla hiçbir şey yoktur — çıktı boş olur.
Taramaların çaresi OCR'dır — optik karakter tanıma — pikselleri okur ve bir metin katmanı kurar. Taramanızı önce OCR aracından geçirin, sonra sonucu metne çevirin. Doğruluk tarama kalitesine bağlıdır.
Düz metin, Word veya HTML — ne kadar yapı gerekiyor?
Düz metin bir yelpazenin bir ucudur. Nereye konacağınıza bilinçli karar verin:
| İhtiyacınız | Doğru araç | Sağ kalan |
|---|---|---|
| Betik ya da düzenleme için sadece kelimeler | PDF'ten TXT'ye | Tüm metin, okuma sırasında — sıfır yerleşim, sıfır stil |
| Biçimli, düzenlenebilir bir belge | PDF'ten Word'e | [PDF'ten Word'e](/tr/tools/pdf-to-word) paragrafları, fontları, tabloları korur |
| Başlıklı ve bağlantılı, web'e hazır işaretleme | PDF'ten HTML'e | [PDF'ten HTML'e](/tr/tools/pdf-to-html) içeriği yapılandırır |
| Üzerinde hesap yapacağınız tablolar | PDF'ten Excel'e | [PDF'ten Excel'e](/tr/tools/pdf-to-excel) özellikle tablo verisini hedefler |
Pratik kural: içeriği okuyacak ya da işleyecekseniz TXT alın. Bir insanın biçimi görmesi gerekiyorsa Word ya da HTML alın.
Ücretsiz yerel alternatifler
Tek seferlik işlerde tarayıcı en hızlısıdır, ama çıkarma günlük alet çantanızın parçasıysa — ya da belgeler makinenizden çıkamıyorsa — şu yerel yollar sağlamdır:
pdftotext (poppler-utils — ücretsiz, tüm platformlar). Komut satırı çıkarmanın altın standardı:
pdftotext input.pdf output.txt
Orijinal sütun konumlarını boşluklarla yaklaşık korumak için -layout
ekleyin — tablomsu metin için gerçekten faydalıdır. macOS'ta Homebrew,
Linux'ta paket yöneticinizle kurulur.
Görüntüleyiciden kopyala-yapıştır. Bir iki sayfa için PDF görüntüleyicinizde tümünü seçip bir düzenleyiciye yapıştırmak iş görür. Satır sonlarını ve ara sıra karışan sütunları temizlemeyi bekleyin.
Microsoft Word. Word, PDF'leri açıp düzenlenebilir belgelere çevirir; oradan .txt olarak kaydedebilirsiniz. Daha yavaştır ve yolda belgeyi yeniden akıtır — sadece ham metin istediğinizde abartıdır.
Pratik tuzaklar
- Yerleşim gider — tasarım gereği. Çok sütunlu sayfalar doğrusal
metin olarak çıkar, tablolar satırlara çöker ve metin kutuları
içerik akışında denk geldikleri yere düşer. Sütunlar kötü iç içe
geçiyorsa, karmaşık yerleşimleri
pdftotext -layoutya da PDF'ten Word'e daha iyi işler. - Üst bilgiler, alt bilgiler ve sayfa numaraları tekrarlanır. Yinelenen başlıklar çıktıda sayfa başına bir kez görünür. Hızlı bir bul-sil geçişi (ya da tek satırlık bir betik) temizler.
- Heceleme. İki yana yaslı metinde satır sonunda bölünen kelimeler ("bel-ge") bölünmüş kalır. "- " artı küçük harf üzerinde bul-değiştir ile düzeltilebilir — kusursuz değil ama hızlı.
- Ligatürler ve semboller. Süslü tipografi (fi, fl, akıllı tırnaklar), PDF'in gerçekte kodladığı karakterler olarak gelir — UTF-8'de genellikle sorunsuzdur; analizden önce ara sıra bir normalleştirme geçişine değer.
- Boş ya da bozuk çıktı neredeyse her zaman tarama demektir (önce OCR) ya da nadiren, font kodlamaları kasıtlı karartılmış bir PDF. İkincisinde çare ironik biçimde yine OCR'dır: pikselleri okutun.
Sık sorulan sorular
Çıktı dosyam neden boş?
PDF'iniz neredeyse kesin bir taramadır — metin katmanı olmayan sayfa resimleri. Önce OCR aracından geçirin, sonra çıkarın. 5 saniyelik test: bir PDF görüntüleyicide metin seçemiyorsanız, metin yoktur.
Çıktı kalını, başlıkları ve fontları korur mu?
Hayır — .txt dosyaları biçimi hiç temsil edemez; saf karakterler alırsınız. Özellik de budur: düzenlerken ya da betik yazarken boğuşacak bir şey kalmaz. Biçim için PDF'ten Word'e kullanın.
Tablolara ne olur?
Düz satırlara yassılaşır ve sütun hizası genellikle kaybolur. Üzerinde çalışmanız gereken tablolar için PDF'ten Excel'e tam bunun için yapılmıştır.
Bu, Metin çıkarma aracıyla aynı mı?
Evet — Metin çıkarma aynı motoru çalıştırır. İkisi de belgenin metnini çeker; önce hangisini bulursanız onu kullanın.
Yalnızca birkaç sayfadan metin çıkarabilir miyim?
Önce PDF'i gereken sayfalara Bölme ile ayırın, sonra çevirin. Çıktıyı odaklı ve 50 sayfalık ücretsiz sınır içinde tutar.
Parola korumalı PDF'te çalışır mı?
Önce parolayı Kilit Açma ile kaldırın (parolayı bilmeniz gerekir), sonra normal şekilde çevirin.
Belgem güvende mi?
Yüklemeler yalnızca HTTPS ile gider, hesap yoktur ve dosyalar 1 saat
sonra otomatik silinir. Yükleyemeyeceğiniz belgeler için pdftotext
tamamen çevrimdışı çalışır.
Ücretsiz sınırlar nedir?
Dosya başına 20 MB, 50 sayfa, günde 10 işlem — kayıt yok, filigran yok. Pro (ayda 9 $) sınırları kaldırır.
pdfty ekibi gizlilik odaklı çevrimiçi PDF araçları geliştirir — sıkıştırma, dönüştürme, OCR, imzalama ve koruma. Dosyalar 1 saat içinde silinir. Hakkımızda →