Estrai tutto il testo da un PDF come file di testo
Trascina e rilascia qui il tuo file
clicca per sfogliare
Dimensione massima: 20MB
Lo strumento di estrazione di pdfty tira fuori ogni carattere di testo da un PDF e lo consegna come file di testo semplice pulito. Batte il seleziona tutto e copia-incolla, che regolarmente scombina i layout a più colonne, perde le caselle di testo e si inceppa sui documenti lunghi — l'estrazione elabora tutte le 50 pagine in un solo passaggio preservando l'ordine di lettura.
L'estrazione si basa su PyMuPDF, che legge direttamente la struttura interna del testo del PDF e ricostruisce l'ordine di lettura naturale — inclusi layout a due colonne, tabelle, intestazioni e note a piè di pagina. L'Unicode completo arriva intatto: cirillico, CJK, arabo, caratteri accentati. Il risultato è ideale per dare documenti in pasto a strumenti di traduzione, indici di ricerca o assistenti IA, per citare da articoli e per contare le parole.
Una nota importante: funziona sui PDF che contengono un livello di testo. I documenti scansionati sono solo immagini di testo — passali prima nel nostro strumento OCR (basato su Tesseract), poi estrai. Gratis per file fino a 20 MB e 50 pagine, senza filigrana, senza registrazione. I file vengono eliminati definitivamente entro 1 ora.
Trascina il file o clicca per selezionarlo. Fino a 20 MB e 50 pagine gratis.
PyMuPDF legge il livello di testo e ricostruisce l'ordine di lettura. Un secondo o due per la maggior parte dei file.
Controlla a schermo le prime pagine del testo estratto.
Un unico file di testo semplice, con le interruzioni di pagina segnalate.
Il PDF e il file di testo vengono eliminati dai nostri server entro 1 ora.