guide·Team pdfty··7 min di lettura

Convertire PDF in testo (estrai il testo grezzo per modifica e analisi)

Estrai il testo grezzo da qualsiasi PDF in un file .txt da modificare, scriptare o analizzare — gratis, senza registrazione. E cosa fare se il PDF è una scansione.

Estrazione del testo grezzo da un PDF in un file di testo semplice
PDF dentro → testo grezzo e modificabile fuori

A volte il PDF è esattamente il contenitore sbagliato. Non vuoi i font, i margini o il layout a due colonne — vuoi le parole, come materia prima: da incollare in un editor, da far passare in uno script, da contare, tradurre, cercare, dare in pasto a un'analisi. Convertire il PDF in testo semplice spoglia tutto tranne il contenuto, ed è esattamente questo il punto.

Le ragioni tipiche per cui si fa:

  • Modifica — rilavorare il boilerplate di un contratto o il testo di un report senza combattere con gli editor PDF.
  • Scripting e analisi — grep, frequenze di parole, pipeline di dati, documenti dati in pasto a strumenti che mangiano testo semplice.
  • Traduzione — la maggior parte dei flussi di traduzione vuole testo pulito, non un documento con stili.
  • Accessibilità e portabilità — un .txt si apre su qualsiasi cosa, fino a una macchina di 30 anni fa.

Una nota prima di partire: Estrai testo su pdfty è lo stesso motore — entrambi tirano fuori dal PDF il testo incorporato. Qualunque dei due raggiungi prima ti darà le stesse parole; PDF in TXT te le restituisce come file .txt scaricabile.

Come convertire PDF in testo — passo passo

1

Apri lo strumento

Vai su pdfty.com/it/tools/pdf-to-txt. Gratis fino a 20 MB e 50 pagine, senza account.

Drop PDF here
2

Carica il tuo PDF

Trascinalo. Se è protetto da password, sbloccalo prima.

Drop PDF here
3

Converti

Il livello di testo incorporato viene letto da ogni pagina, in ordine. Pochi secondi.

Compressing…69%~2 seconds remaining
4

Scarica il .txt

Un unico file di testo semplice con il testo completo del documento. I caricamenti vengono eliminati automaticamente dopo 1 ora.

contract_draft.pdfDownload
5

Controlla l'output

Scorrilo una volta. Se è vuoto o incomprensibile, il tuo PDF è una scansione — vedi la sezione OCR qui sotto.

All done — file readyAuto-deleted in 1 hour
🔒 pdfty.com/en/tools/pdf-to-txt
Lo strumento PDF in TXT di pdfty
pdfty PDF in TXT: le parole del documento, nient'altro

Il problema delle scansioni: quando non c'è testo da estrarre

È la sorpresa più comune in assoluto nell'estrazione di testo dai PDF. Un PDF può contenere il testo in due modi completamente diversi:

  1. I PDF digitali (esportati da Word, da un sito, da un sistema di fatturazione) portano un vero livello di testo. L'estrazione è istantanea e accurata.
  2. I PDF scansionati (da uno scanner o dalla fotocamera del telefono) contengono solo immagini di testo. Non c'è letteralmente nulla da estrarre — l'output sarà vuoto.

Il rimedio per le scansioni è l'OCR — il riconoscimento ottico dei caratteri — che legge i pixel e costruisce un livello di testo. Passa la tua scansione prima da OCR, poi converti il risultato in testo. L'accuratezza dipende dalla qualità della scansione.

Testo semplice vs Word vs HTML — quanta struttura ti serve?

Il testo semplice è un estremo di uno spettro. Scegli con criterio dove atterrare:

Ti serveStrumento giustoCosa sopravvive
Solo le parole, per script o modificaPDF in TXTTutto il testo, in ordine di lettura — zero layout, zero stili
Un documento modificabile con formattazionePDF in Word[PDF in Word](/it/tools/pdf-to-word) conserva paragrafi, font, tabelle
Markup pronto per il web con titoli e linkPDF in HTML[PDF in HTML](/it/tools/pdf-to-html) struttura il contenuto
Tabelle su cui farai calcoliPDF in Excel[PDF in Excel](/it/tools/pdf-to-excel) punta specificamente ai dati tabellari

Regola pratica: se il contenuto lo devi leggere o elaborare, prendi il TXT. Se un umano deve vedere la formattazione, prendi Word o HTML.

Alternative locali gratuite

Per i lavori una tantum il browser è il più veloce, ma se l'estrazione fa parte della tua cassetta degli attrezzi quotidiana — o i documenti non possono lasciare la tua macchina — queste vie locali sono solide:

pdftotext (poppler-utils — gratuito, tutte le piattaforme). Lo standard d'oro per l'estrazione da riga di comando:

pdftotext input.pdf output.txt

Aggiungi -layout per approssimare con gli spazi le posizioni originali delle colonne — davvero utile per il testo tabellare. Si installa via Homebrew su macOS o col gestore pacchetti su Linux.

Copia-incolla da un visualizzatore. Per una pagina o due, selezionare tutto nel visualizzatore PDF e incollare in un editor funziona. Mettici in conto una pulizia degli a capo e qualche colonna rimescolata.

Microsoft Word. Word apre i PDF e li converte in documenti modificabili, da cui puoi salvare come .txt. Più lento, e lungo la strada reimpagina il documento — eccessivo quando vuoi solo il testo grezzo.

Trappole pratiche

  • Il layout sparisce — per scelta. Le pagine multi-colonna escono come testo lineare, le tabelle collassano in righe, e le caselle di testo atterrano dove capitano nel flusso del contenuto. Se le colonne si intrecciano male, pdftotext -layout o PDF in Word gestiscono meglio i layout complessi.
  • Intestazioni, piè di pagina e numeri di pagina si ripetono. Le intestazioni correnti compaiono una volta per pagina nell'output. Un rapido giro di trova-ed-elimina (o uno script di una riga) le pulisce.
  • Sillabazione. Le parole spezzate a fine riga nel testo giustificato («docu- mento») restano spezzate. Rimediabile con un trova-e-sostituisci su «- » seguito da lettera minuscola — imperfetto ma rapido.
  • Legature e simboli. La tipografia ricercata (fi, fl, virgolette tipografiche) arriva come i caratteri che il PDF effettivamente codifica — di solito a posto in UTF-8, ogni tanto vale un passaggio di normalizzazione prima dell'analisi.
  • Output vuoto o pasticciato significa quasi sempre una scansione (prima l'OCR) o, raramente, un PDF con codifiche dei font deliberatamente offuscate. Per il secondo caso, l'OCR è ironicamente anche il rimedio: rasterizza mentalmente, leggi i pixel.

Domande frequenti

Perché il mio file di output è vuoto?

Il tuo PDF è quasi certamente una scansione — immagini di pagine, senza livello di testo. Passalo prima da OCR, poi estrai. Il test dei 5 secondi: se non riesci a selezionare testo in un visualizzatore PDF, non c'è testo.

L'output conserva grassetto, titoli e font?

No — i file .txt non possono rappresentare alcuna formattazione, quindi ottieni puri caratteri. È la funzionalità, non il difetto: niente con cui combattere quando modifichi o scripti. Per la formattazione, usa PDF in Word.

Cosa succede alle tabelle?

Si appiattiscono in righe semplici, e l'allineamento delle colonne in genere si perde. Per le tabelle su cui devi lavorare, PDF in Excel è costruito esattamente per quello.

È la stessa cosa dello strumento Estrai testo?

Sì — Estrai testo usa lo stesso motore. Entrambi tirano fuori il testo del documento; usa quello che trovi prima.

Posso estrarre il testo solo da alcune pagine?

Dividi prima il PDF alle pagine che ti servono, poi converti. Tiene l'output mirato e dentro il limite gratuito di 50 pagine.

Funzionerà su un PDF protetto da password?

Rimuovi prima la password con Sblocca (devi conoscerla), poi converti normalmente.

Il mio documento è al sicuro?

I caricamenti sono solo HTTPS, non c'è account, e i file vengono eliminati automaticamente dopo 1 ora. Per i documenti che non puoi caricare, pdftotext gira completamente offline.

Quali sono i limiti gratuiti?

20 MB per file, 50 pagine, 10 operazioni al giorno — senza registrazione, senza filigrana. Il Pro (9 $/mese) toglie i tetti.

Team pdfty

Il team pdfty crea strumenti PDF online attenti alla privacy — comprimere, convertire, OCR, firmare e proteggere. File eliminati entro 1 ora. Chi siamo →

Articoli correlati