OCR PDF

Rendez les PDF numérisés interrogeables grâce à la reconnaissance de texte

L'outil OCR de pdfty transforme les PDF composés d'images (scans, photos de documents) en texte interrogeable et copiable. Nous utilisons Tesseract 5 avec des modèles optimisés pour l'anglais, le russe, le français, l'allemand et l'espagnol — y compris le cyrillique et les caractères accentués.

Après l'OCR, votre PDF a le même aspect visuel, mais vous pouvez désormais copier le texte, faire des recherches et convertir en Word avec la mise en page d'origine conservée. Utile pour les contrats scannés, les documents d'archives, les tableaux blancs photographiés ou les fax.

Jusqu'à 50 pages et 20 Mo en gratuit. Pro lève les limites. Les pages mêlant plusieurs alphabets fonctionnent — l'OCR détecte l'alphabet zone par zone. Nous n'entraînons jamais de modèles sur vos données.

Comment ça marche

  1. 1

    Déposez le scan

    Glissez un PDF scanné ou composé d'images. Jusqu'à 20 Mo en gratuit.

  2. 2

    Choisissez les langues

    Sélectionnez une ou plusieurs langues parmi anglais, russe, français, allemand, espagnol.

  3. 3

    Lancez l'OCR

    Tesseract traite chaque page. Comptez généralement 1 à 3 secondes par page.

  4. 4

    Téléchargez le PDF interrogeable

    Même apparence, avec une couche de texte invisible. Vous pouvez maintenant copier, chercher, convertir.

  5. 5

    Terminé

    Les fichiers sont supprimés sous 1 heure.

Questions fréquentes

Sur des scans propres à 300 DPI, plus de 98 % pour les alphabets latins et plus de 95 % pour le cyrillique. Une résolution plus faible ou des scans bruités réduisent la précision.

Outils associés

Guides et tutoriels