Metni Çıkar

PDF'deki tüm metni düz metin dosyası olarak çıkar

pdfty'nin çıkarma aracı, bir PDF'teki her karakteri çeker ve temiz bir düz metin dosyası olarak teslim eder. Çok sütunlu düzenleri düzenli olarak karıştıran, metin kutularını atlayan ve uzun belgelerde tıkanan tümünü-seç kopyala-yapıştırdan çok daha iyidir — çıkarma, okuma sırası korunarak 50 sayfanın tamamını tek geçişte işler.

Çıkarma, PDF'in iç metin yapısını doğrudan okuyan ve doğal okuma sırasını yeniden kuran PyMuPDF üzerinde çalışır — iki sütunlu düzenler, tablolar, başlıklar ve dipnotlar dahil. Tam Unicode olduğu gibi gelir: Kiril, ÇJK, Arapça, aksanlı karakterler. Sonuç, belgeleri çeviri araçlarına, arama dizinlerine veya yapay zekâ asistanlarına beslemek, makalelerden alıntı yapmak ve kelime saymak için idealdir.

Önemli bir not: bu, metin katmanı içeren PDF'lerde çalışır. Taranmış belgeler yalnızca metin resimleridir — önce OCR aracımızdan (Tesseract destekli) geçirin, sonra çıkarın. 20 MB ve 50 sayfaya kadar dosyalar için ücretsiz, filigran yok, kayıt yok. Dosyalar 1 saat içinde kalıcı olarak silinir.

Nasıl çalışır

  1. 1

    PDF'inizi yükleyin

    Sürükleyip bırakın veya seçmek için tıklayın. 20 MB ve 50 sayfaya kadar ücretsiz.

  2. 2

    Çıkarın

    PyMuPDF metin katmanını okur ve okuma sırasını yeniden kurar. Çoğu dosya için bir iki saniye.

  3. 3

    Önizleyin

    Çıkarılan metnin ilk sayfalarını ekranda kontrol edin.

  4. 4

    .txt dosyasını indirin

    Sayfa sonları işaretlenmiş tek bir düz metin dosyası.

  5. 5

    1 saatte tamam

    PDF'iniz ve metin dosyası, 1 saat içinde sunucularımızdan silinir.

Sık sorulan sorular

PDF'iniz neredeyse kesinlikle bir tarama — metin katmanı olmayan metin resimleri. Önce OCR aracımızdan geçirin, sonra çıkarın.

İlgili araçlar