guide·pdfty ekibi··6 dk okuma

PDF'i Metne Çevirme (Düzenleme ve Analiz İçin Ham Metin Çıkarın)

Herhangi bir PDF'ten ham metni düzenleme, betik ya da analiz için düz bir .txt dosyasına çıkarın — ücretsiz, kayıt yok. PDF taramaysa ne yapılacağı dahil.

PDF'ten ham metni düz metin dosyasına çıkarma
PDF girer → ham, düzenlenebilir metin çıkar

Bazen PDF, tam anlamıyla yanlış kaptır. Fontları, kenar boşluklarını ya da iki sütunlu yerleşimi istemezsiniz — ham madde olarak kelimeleri istersiniz: bir düzenleyiciye yapıştırmak, bir betikten geçirmek, saymak, çevirmek, içinde arama yapmak, bir analize beslemek için. PDF'i düz metne çevirmek, içerik dışındaki her şeyi soyar — ve amaç da tam olarak budur.

İnsanların bunu yapmasının tipik nedenleri:

  • Düzenleme — PDF düzenleyicilerle boğuşmadan sözleşme kalıplarını ya da rapor metnini yeniden işlemek.
  • Betik ve analiz — grep, kelime frekansları, veri boru hatları, düz metin yiyen araçlara belge beslemek.
  • Çeviri — çoğu çeviri iş akışı stilli belge değil, temiz metin ister.
  • Erişilebilirlik ve taşınabilirlik — bir .txt, 30 yıllık bir makineye kadar her şeyde açılır.

Başlamadan bir not: pdfty'deki Metin çıkarma aynı motordur — ikisi de PDF'teki gömülü metni çeker. Hangisine önce ulaşırsanız aynı kelimeleri verir; PDF'ten TXT'ye onları indirilebilir bir .txt dosyası olarak geri verir.

PDF'i metne çevirme — adım adım

1

Aracı açın

pdfty.com/tr/tools/pdf-to-txt adresine gidin. 20 MB ve 50 sayfaya kadar ücretsiz, hesap gerekmez.

Drop PDF here
2

PDF'inizi yükleyin

Sürükleyin. Parola korumalıysa önce Kilit Açma uygulayın.

Drop PDF here
3

Çevirin

Gömülü metin katmanı her sayfadan sırayla okunur. Birkaç saniye.

Compressing…69%~2 seconds remaining
4

.txt'yi indirin

Belgenin tam metnini içeren tek bir düz metin dosyası. Yüklemeler 1 saat sonra otomatik silinir.

contract_draft.pdfDownload
5

Çıktıyı gözden geçirin

Bir kez tarayın. Boş ya da anlamsızsa PDF'iniz bir taramadır — aşağıdaki OCR bölümüne bakın.

All done — file readyAuto-deleted in 1 hour
🔒 pdfty.com/en/tools/pdf-to-txt
pdfty PDF'ten TXT'ye aracı
pdfty PDF'ten TXT'ye: belgenin kelimeleri, başka hiçbir şey

Tarama sorunu: çıkarılacak metin olmadığında

PDF metin çıkarmada en yaygın sürpriz budur. Bir PDF, metnini iki bambaşka biçimde içerebilir:

  1. Dijital PDF'ler (Word'den, bir web sitesinden, bir fatura sisteminden dışa aktarılanlar) gerçek bir metin katmanı taşır. Çıkarma anında ve doğrudur.
  2. Taranmış PDF'ler (tarayıcıdan ya da telefon kamerasından) yalnızca metnin resimlerini içerir. Çıkarılacak kelimenin tam anlamıyla hiçbir şey yoktur — çıktı boş olur.

Taramaların çaresi OCR'dır — optik karakter tanıma — pikselleri okur ve bir metin katmanı kurar. Taramanızı önce OCR aracından geçirin, sonra sonucu metne çevirin. Doğruluk tarama kalitesine bağlıdır.

Düz metin, Word veya HTML — ne kadar yapı gerekiyor?

Düz metin bir yelpazenin bir ucudur. Nereye konacağınıza bilinçli karar verin:

İhtiyacınızDoğru araçSağ kalan
Betik ya da düzenleme için sadece kelimelerPDF'ten TXT'yeTüm metin, okuma sırasında — sıfır yerleşim, sıfır stil
Biçimli, düzenlenebilir bir belgePDF'ten Word'e[PDF'ten Word'e](/tr/tools/pdf-to-word) paragrafları, fontları, tabloları korur
Başlıklı ve bağlantılı, web'e hazır işaretlemePDF'ten HTML'e[PDF'ten HTML'e](/tr/tools/pdf-to-html) içeriği yapılandırır
Üzerinde hesap yapacağınız tablolarPDF'ten Excel'e[PDF'ten Excel'e](/tr/tools/pdf-to-excel) özellikle tablo verisini hedefler

Pratik kural: içeriği okuyacak ya da işleyecekseniz TXT alın. Bir insanın biçimi görmesi gerekiyorsa Word ya da HTML alın.

Ücretsiz yerel alternatifler

Tek seferlik işlerde tarayıcı en hızlısıdır, ama çıkarma günlük alet çantanızın parçasıysa — ya da belgeler makinenizden çıkamıyorsa — şu yerel yollar sağlamdır:

pdftotext (poppler-utils — ücretsiz, tüm platformlar). Komut satırı çıkarmanın altın standardı:

pdftotext input.pdf output.txt

Orijinal sütun konumlarını boşluklarla yaklaşık korumak için -layout ekleyin — tablomsu metin için gerçekten faydalıdır. macOS'ta Homebrew, Linux'ta paket yöneticinizle kurulur.

Görüntüleyiciden kopyala-yapıştır. Bir iki sayfa için PDF görüntüleyicinizde tümünü seçip bir düzenleyiciye yapıştırmak iş görür. Satır sonlarını ve ara sıra karışan sütunları temizlemeyi bekleyin.

Microsoft Word. Word, PDF'leri açıp düzenlenebilir belgelere çevirir; oradan .txt olarak kaydedebilirsiniz. Daha yavaştır ve yolda belgeyi yeniden akıtır — sadece ham metin istediğinizde abartıdır.

Pratik tuzaklar

  • Yerleşim gider — tasarım gereği. Çok sütunlu sayfalar doğrusal metin olarak çıkar, tablolar satırlara çöker ve metin kutuları içerik akışında denk geldikleri yere düşer. Sütunlar kötü iç içe geçiyorsa, karmaşık yerleşimleri pdftotext -layout ya da PDF'ten Word'e daha iyi işler.
  • Üst bilgiler, alt bilgiler ve sayfa numaraları tekrarlanır. Yinelenen başlıklar çıktıda sayfa başına bir kez görünür. Hızlı bir bul-sil geçişi (ya da tek satırlık bir betik) temizler.
  • Heceleme. İki yana yaslı metinde satır sonunda bölünen kelimeler ("bel-ge") bölünmüş kalır. "- " artı küçük harf üzerinde bul-değiştir ile düzeltilebilir — kusursuz değil ama hızlı.
  • Ligatürler ve semboller. Süslü tipografi (fi, fl, akıllı tırnaklar), PDF'in gerçekte kodladığı karakterler olarak gelir — UTF-8'de genellikle sorunsuzdur; analizden önce ara sıra bir normalleştirme geçişine değer.
  • Boş ya da bozuk çıktı neredeyse her zaman tarama demektir (önce OCR) ya da nadiren, font kodlamaları kasıtlı karartılmış bir PDF. İkincisinde çare ironik biçimde yine OCR'dır: pikselleri okutun.

Sık sorulan sorular

Çıktı dosyam neden boş?

PDF'iniz neredeyse kesin bir taramadır — metin katmanı olmayan sayfa resimleri. Önce OCR aracından geçirin, sonra çıkarın. 5 saniyelik test: bir PDF görüntüleyicide metin seçemiyorsanız, metin yoktur.

Çıktı kalını, başlıkları ve fontları korur mu?

Hayır — .txt dosyaları biçimi hiç temsil edemez; saf karakterler alırsınız. Özellik de budur: düzenlerken ya da betik yazarken boğuşacak bir şey kalmaz. Biçim için PDF'ten Word'e kullanın.

Tablolara ne olur?

Düz satırlara yassılaşır ve sütun hizası genellikle kaybolur. Üzerinde çalışmanız gereken tablolar için PDF'ten Excel'e tam bunun için yapılmıştır.

Bu, Metin çıkarma aracıyla aynı mı?

Evet — Metin çıkarma aynı motoru çalıştırır. İkisi de belgenin metnini çeker; önce hangisini bulursanız onu kullanın.

Yalnızca birkaç sayfadan metin çıkarabilir miyim?

Önce PDF'i gereken sayfalara Bölme ile ayırın, sonra çevirin. Çıktıyı odaklı ve 50 sayfalık ücretsiz sınır içinde tutar.

Parola korumalı PDF'te çalışır mı?

Önce parolayı Kilit Açma ile kaldırın (parolayı bilmeniz gerekir), sonra normal şekilde çevirin.

Belgem güvende mi?

Yüklemeler yalnızca HTTPS ile gider, hesap yoktur ve dosyalar 1 saat sonra otomatik silinir. Yükleyemeyeceğiniz belgeler için pdftotext tamamen çevrimdışı çalışır.

Ücretsiz sınırlar nedir?

Dosya başına 20 MB, 50 sayfa, günde 10 işlem — kayıt yok, filigran yok. Pro (ayda 9 $) sınırları kaldırır.

pdfty ekibi

pdfty ekibi gizlilik odaklı çevrimiçi PDF araçları geliştirir — sıkıştırma, dönüştürme, OCR, imzalama ve koruma. Dosyalar 1 saat içinde silinir. Hakkımızda →

İlgili yazılar