guide·Équipe pdfty··8 min de lecture

Convertir PDF en texte (extraire le texte brut pour éditer et analyser)

Extrayez le texte brut de n'importe quel PDF en fichier .txt pour édition, scripts ou analyse — gratuit, sans inscription. Et que faire si le PDF est un scan.

Extraction du texte brut d'un PDF vers un fichier texte
Un PDF en entrée → du texte brut et éditable en sortie

Parfois, le PDF est exactement le mauvais contenant. Vous ne voulez ni les polices, ni les marges, ni la mise en page sur deux colonnes — vous voulez les mots, comme matière première : à coller dans un éditeur, à faire passer dans un script, à compter, à traduire, à chercher, à donner à une analyse. Convertir un PDF en texte brut enlève tout sauf le contenu, et c'est précisément le but.

Les raisons typiques de le faire :

  • L'édition — retravailler des clauses types de contrat ou le texte d'un rapport sans se battre avec des éditeurs de PDF.
  • Les scripts et l'analyse — grep, fréquences de mots, pipelines de données, documents envoyés à des outils qui mangent du texte brut.
  • La traduction — la plupart des flux de traduction veulent du texte propre, pas un document stylé.
  • L'accessibilité et la portabilité — un .txt s'ouvre sur n'importe quoi, jusqu'à une machine de 30 ans.

Une précision avant de commencer : Extraire le texte sur pdfty est le même moteur — les deux sortent le texte incorporé du PDF. Celui que vous trouverez en premier donnera les mêmes mots ; PDF en TXT les rend sous forme de fichier .txt téléchargeable.

Comment convertir PDF en texte — étape par étape

1

Ouvrez l'outil

Allez sur pdfty.com/fr/tools/pdf-to-txt. Gratuit jusqu'à 20 Mo et 50 pages, sans compte.

Drop PDF here
2

Téléversez votre PDF

Glissez-le. S'il est protégé par mot de passe, Déverrouillez-le d'abord.

Drop PDF here
3

Convertissez

La couche de texte incorporée est lue sur chaque page, dans l'ordre. Quelques secondes.

Compressing…69%~2 seconds remaining
4

Téléchargez le .txt

Un fichier texte brut avec le texte complet du document. Les téléversements sont supprimés automatiquement après 1 heure.

contract_draft.pdfDownload
5

Vérifiez la sortie

Parcourez-la une fois. Si elle est vide ou incompréhensible, votre PDF est un scan — voir la section OCR plus bas.

All done — file readyAuto-deleted in 1 hour
🔒 pdfty.com/en/tools/pdf-to-txt
L'outil PDF en TXT de pdfty
pdfty PDF en TXT : les mots du document, rien d'autre

Le problème du scan : quand il n'y a pas de texte à extraire

C'est la surprise la plus courante de l'extraction de texte PDF. Un PDF peut contenir son texte de deux façons complètement différentes :

  1. Les PDF numériques (exportés de Word, d'un site web, d'un système de facturation) portent une vraie couche de texte. L'extraction est instantanée et précise.
  2. Les PDF scannés (d'un scanner ou d'un appareil photo de téléphone) ne contiennent que des images de texte. Il n'y a littéralement rien à extraire — la sortie sera vide.

Le remède pour les scans est l'OCR — la reconnaissance optique de caractères — qui lit les pixels et construit une couche de texte. Passez d'abord votre scan par OCR, puis convertissez le résultat en texte. La précision dépend de la qualité du scan.

Texte brut vs Word vs HTML — combien de structure vous faut-il ?

Le texte brut est une extrémité du spectre. Choisissez délibérément où atterrir :

Votre besoinBon outilCe qui survit
Juste les mots, pour scripts ou éditionPDF en TXTTout le texte, dans l'ordre de lecture — zéro mise en page, zéro style
Un document éditable avec mise en formePDF en Word[PDF en Word](/fr/tools/pdf-to-word) garde paragraphes, polices et tableaux
Du balisage web avec titres et liensPDF en HTML[PDF en HTML](/fr/tools/pdf-to-html) structure le contenu pour le web
Des tableaux à calculerPDF en Excel[PDF en Excel](/fr/tools/pdf-to-excel) cible spécifiquement les données tabulaires

Règle simple : si vous allez lire ou traiter le contenu, prenez le TXT. Si un humain doit voir la mise en forme, prenez Word ou HTML.

Alternatives locales gratuites

Pour un travail ponctuel, le navigateur est le plus rapide, mais si l'extraction fait partie de votre boîte à outils quotidienne — ou que les documents ne peuvent pas quitter votre machine — ces voies locales sont solides :

pdftotext (poppler-utils — gratuit, toutes plateformes). L'étalon-or de l'extraction en ligne de commande :

pdftotext input.pdf output.txt

Ajoutez -layout pour approcher les positions de colonnes d'origine avec des espaces — vraiment utile pour du texte tabulaire. Installé via Homebrew sur macOS ou votre gestionnaire de paquets sur Linux.

Copier-coller depuis une visionneuse. Pour une page ou deux, tout sélectionner dans votre lecteur PDF et coller dans un éditeur fonctionne. Attendez-vous à nettoyer des sauts de ligne et une colonne mélangée de temps en temps.

Microsoft Word. Word ouvre les PDF et les convertit en documents éditables, d'où vous pouvez enregistrer en .txt. Plus lent, et il recompose le document au passage — surdimensionné quand vous voulez juste du texte brut.

Pièges pratiques

  • La mise en page disparaît — c'est voulu. Les pages multicolonnes sortent en texte linéaire, les tableaux s'aplatissent en lignes, et les zones de texte atterrissent là où elles tombent dans le flux de contenu. Si les colonnes s'entremêlent mal, pdftotext -layout ou PDF en Word gèrent mieux les mises en page complexes.
  • En-têtes, pieds de page et numéros de page se répètent. Les en-têtes courants apparaissent une fois par page dans la sortie. Une passe rapide de rechercher-supprimer (ou un script d'une ligne) les nettoie.
  • La coupure des mots. Les mots coupés en fin de ligne dans du texte justifié (« docu- ment ») restent coupés. Réparable au rechercher-remplacer sur « - » suivi d'une minuscule — imparfait mais rapide.
  • Ligatures et symboles. La typographie soignée (fi, fl, guillemets courbes) ressort avec les caractères que le PDF encode réellement — généralement sans problème en UTF-8, parfois à normaliser avant une analyse.
  • Une sortie vide ou incompréhensible signifie presque toujours un scan (OCR d'abord) ou, rarement, un PDF aux encodages de polices délibérément brouillés. Pour ce dernier cas, l'OCR est ironiquement aussi le remède : on rastérise mentalement et on lit les pixels.

Questions fréquentes

Pourquoi mon fichier de sortie est-il vide ?

Votre PDF est presque certainement un scan — des images de pages, sans couche de texte. Passez-le d'abord par OCR, puis extrayez. Le test des 5 secondes : si vous ne pouvez pas sélectionner le texte dans une visionneuse, il n'y a pas de texte.

La sortie garde-t-elle le gras, les titres et les polices ?

Non — les fichiers .txt ne peuvent représenter aucune mise en forme, donc vous obtenez des caractères purs. C'est la fonctionnalité : rien contre quoi se battre en éditant ou en scriptant. Pour la mise en forme, utilisez PDF en Word.

Qu'arrive-t-il aux tableaux ?

Ils s'aplatissent en lignes simples, et l'alignement des colonnes est généralement perdu. Pour des tableaux à exploiter, PDF en Excel est fait exactement pour ça.

Est-ce la même chose que l'outil Extraire le texte ?

Oui — Extraire le texte utilise le même moteur. Les deux sortent le texte du document ; utilisez celui que vous trouvez en premier.

Puis-je extraire le texte de quelques pages seulement ?

Divisez d'abord le PDF sur les pages voulues, puis convertissez. La sortie reste ciblée et dans la limite gratuite de 50 pages.

Ça marche sur un PDF protégé par mot de passe ?

Retirez d'abord le mot de passe avec Déverrouiller (il faut connaître le mot de passe), puis convertissez normalement.

Mon document est-il en sécurité ?

Les téléversements passent uniquement en HTTPS, il n'y a pas de compte, et les fichiers sont supprimés automatiquement après 1 heure. Pour les documents que vous ne pouvez pas téléverser, pdftotext tourne entièrement hors ligne.

Quelles sont les limites gratuites ?

20 Mo par fichier, 50 pages, 10 opérations par jour — sans inscription, sans filigrane. Le Pro (9 $/mois) supprime les plafonds.

Équipe pdfty

L'équipe pdfty crée des outils PDF en ligne respectueux de la vie privée — compresser, convertir, OCR, signer et protéger. Fichiers supprimés sous 1 heure. À propos →

Articles associés