Convertire PDF in testo (estrai il testo grezzo per modifica e analisi)
Estrai il testo grezzo da qualsiasi PDF in un file .txt da modificare, scriptare o analizzare — gratis, senza registrazione. E cosa fare se il PDF è una scansione.

A volte il PDF è esattamente il contenitore sbagliato. Non vuoi i font, i margini o il layout a due colonne — vuoi le parole, come materia prima: da incollare in un editor, da far passare in uno script, da contare, tradurre, cercare, dare in pasto a un'analisi. Convertire il PDF in testo semplice spoglia tutto tranne il contenuto, ed è esattamente questo il punto.
Le ragioni tipiche per cui si fa:
- Modifica — rilavorare il boilerplate di un contratto o il testo di un report senza combattere con gli editor PDF.
- Scripting e analisi — grep, frequenze di parole, pipeline di dati, documenti dati in pasto a strumenti che mangiano testo semplice.
- Traduzione — la maggior parte dei flussi di traduzione vuole testo pulito, non un documento con stili.
- Accessibilità e portabilità — un .txt si apre su qualsiasi cosa, fino a una macchina di 30 anni fa.
Una nota prima di partire: Estrai testo su pdfty è lo stesso motore — entrambi tirano fuori dal PDF il testo incorporato. Qualunque dei due raggiungi prima ti darà le stesse parole; PDF in TXT te le restituisce come file .txt scaricabile.
Come convertire PDF in testo — passo passo
Apri lo strumento
Vai su pdfty.com/it/tools/pdf-to-txt. Gratis fino a 20 MB e 50 pagine, senza account.
Carica il tuo PDF
Trascinalo. Se è protetto da password, sbloccalo prima.
Converti
Il livello di testo incorporato viene letto da ogni pagina, in ordine. Pochi secondi.
Scarica il .txt
Un unico file di testo semplice con il testo completo del documento. I caricamenti vengono eliminati automaticamente dopo 1 ora.
Controlla l'output
Scorrilo una volta. Se è vuoto o incomprensibile, il tuo PDF è una scansione — vedi la sezione OCR qui sotto.

Il problema delle scansioni: quando non c'è testo da estrarre
È la sorpresa più comune in assoluto nell'estrazione di testo dai PDF. Un PDF può contenere il testo in due modi completamente diversi:
- I PDF digitali (esportati da Word, da un sito, da un sistema di fatturazione) portano un vero livello di testo. L'estrazione è istantanea e accurata.
- I PDF scansionati (da uno scanner o dalla fotocamera del telefono) contengono solo immagini di testo. Non c'è letteralmente nulla da estrarre — l'output sarà vuoto.
Il rimedio per le scansioni è l'OCR — il riconoscimento ottico dei caratteri — che legge i pixel e costruisce un livello di testo. Passa la tua scansione prima da OCR, poi converti il risultato in testo. L'accuratezza dipende dalla qualità della scansione.
Testo semplice vs Word vs HTML — quanta struttura ti serve?
Il testo semplice è un estremo di uno spettro. Scegli con criterio dove atterrare:
| Ti serve | Strumento giusto | Cosa sopravvive |
|---|---|---|
| Solo le parole, per script o modifica | PDF in TXT | Tutto il testo, in ordine di lettura — zero layout, zero stili |
| Un documento modificabile con formattazione | PDF in Word | [PDF in Word](/it/tools/pdf-to-word) conserva paragrafi, font, tabelle |
| Markup pronto per il web con titoli e link | PDF in HTML | [PDF in HTML](/it/tools/pdf-to-html) struttura il contenuto |
| Tabelle su cui farai calcoli | PDF in Excel | [PDF in Excel](/it/tools/pdf-to-excel) punta specificamente ai dati tabellari |
Regola pratica: se il contenuto lo devi leggere o elaborare, prendi il TXT. Se un umano deve vedere la formattazione, prendi Word o HTML.
Alternative locali gratuite
Per i lavori una tantum il browser è il più veloce, ma se l'estrazione fa parte della tua cassetta degli attrezzi quotidiana — o i documenti non possono lasciare la tua macchina — queste vie locali sono solide:
pdftotext (poppler-utils — gratuito, tutte le piattaforme). Lo standard d'oro per l'estrazione da riga di comando:
pdftotext input.pdf output.txt
Aggiungi -layout per approssimare con gli spazi le posizioni
originali delle colonne — davvero utile per il testo tabellare. Si
installa via Homebrew su macOS o col gestore pacchetti su Linux.
Copia-incolla da un visualizzatore. Per una pagina o due, selezionare tutto nel visualizzatore PDF e incollare in un editor funziona. Mettici in conto una pulizia degli a capo e qualche colonna rimescolata.
Microsoft Word. Word apre i PDF e li converte in documenti modificabili, da cui puoi salvare come .txt. Più lento, e lungo la strada reimpagina il documento — eccessivo quando vuoi solo il testo grezzo.
Trappole pratiche
- Il layout sparisce — per scelta. Le pagine multi-colonna escono
come testo lineare, le tabelle collassano in righe, e le caselle di
testo atterrano dove capitano nel flusso del contenuto. Se le colonne
si intrecciano male,
pdftotext -layouto PDF in Word gestiscono meglio i layout complessi. - Intestazioni, piè di pagina e numeri di pagina si ripetono. Le intestazioni correnti compaiono una volta per pagina nell'output. Un rapido giro di trova-ed-elimina (o uno script di una riga) le pulisce.
- Sillabazione. Le parole spezzate a fine riga nel testo giustificato («docu- mento») restano spezzate. Rimediabile con un trova-e-sostituisci su «- » seguito da lettera minuscola — imperfetto ma rapido.
- Legature e simboli. La tipografia ricercata (fi, fl, virgolette tipografiche) arriva come i caratteri che il PDF effettivamente codifica — di solito a posto in UTF-8, ogni tanto vale un passaggio di normalizzazione prima dell'analisi.
- Output vuoto o pasticciato significa quasi sempre una scansione (prima l'OCR) o, raramente, un PDF con codifiche dei font deliberatamente offuscate. Per il secondo caso, l'OCR è ironicamente anche il rimedio: rasterizza mentalmente, leggi i pixel.
Domande frequenti
Perché il mio file di output è vuoto?
Il tuo PDF è quasi certamente una scansione — immagini di pagine, senza livello di testo. Passalo prima da OCR, poi estrai. Il test dei 5 secondi: se non riesci a selezionare testo in un visualizzatore PDF, non c'è testo.
L'output conserva grassetto, titoli e font?
No — i file .txt non possono rappresentare alcuna formattazione, quindi ottieni puri caratteri. È la funzionalità, non il difetto: niente con cui combattere quando modifichi o scripti. Per la formattazione, usa PDF in Word.
Cosa succede alle tabelle?
Si appiattiscono in righe semplici, e l'allineamento delle colonne in genere si perde. Per le tabelle su cui devi lavorare, PDF in Excel è costruito esattamente per quello.
È la stessa cosa dello strumento Estrai testo?
Sì — Estrai testo usa lo stesso motore. Entrambi tirano fuori il testo del documento; usa quello che trovi prima.
Posso estrarre il testo solo da alcune pagine?
Dividi prima il PDF alle pagine che ti servono, poi converti. Tiene l'output mirato e dentro il limite gratuito di 50 pagine.
Funzionerà su un PDF protetto da password?
Rimuovi prima la password con Sblocca (devi conoscerla), poi converti normalmente.
Il mio documento è al sicuro?
I caricamenti sono solo HTTPS, non c'è account, e i file vengono
eliminati automaticamente dopo 1 ora. Per i documenti che non puoi
caricare, pdftotext gira completamente offline.
Quali sono i limiti gratuiti?
20 MB per file, 50 pagine, 10 operazioni al giorno — senza registrazione, senza filigrana. Il Pro (9 $/mese) toglie i tetti.
Il team pdfty crea strumenti PDF online attenti alla privacy — comprimere, convertire, OCR, firmare e proteggere. File eliminati entro 1 ora. Chi siamo →