Tekst extraheren

Alle tekst uit een PDF als tekstbestand extraheren

De extractietool van pdfty haalt elk teken tekst uit een PDF en levert het als een schoon plattetekstbestand. Het verslaat alles-selecteren-en-plakken, dat lay-outs met meerdere kolommen regelmatig door elkaar husselt, tekstvakken overslaat en vastloopt op lange documenten — de extractie verwerkt alle 50 pagina's in één keer met behoud van de leesvolgorde.

De extractie draait op PyMuPDF, dat de interne tekststructuur van de PDF direct leest en de natuurlijke leesvolgorde reconstrueert — inclusief tweekolomslay-outs, tabellen, kopteksten en voetnoten. Volledige Unicode komt intact door: Cyrillisch, CJK, Arabisch, letters met accenten. Het resultaat is ideaal om documenten in vertaaltools, zoekindexen of AI-assistenten te voeren, om uit papers te citeren en voor woordtellingen.

Eén belangrijke opmerking: dit werkt bij PDF's die een tekstlaag bevatten. Gescande documenten zijn slechts plaatjes van tekst — haal ze eerst door onze OCR-tool (aangedreven door Tesseract) en extraheer daarna. Gratis voor bestanden tot 20 MB en 50 pagina's, geen watermerk, geen registratie. Bestanden worden binnen 1 uur permanent verwijderd.

Hoe het werkt

  1. 1

    Upload je PDF

    Sleep het bestand hierheen of klik om te selecteren. Tot 20 MB en 50 pagina's gratis.

  2. 2

    Extraheer

    PyMuPDF leest de tekstlaag en reconstrueert de leesvolgorde. Een seconde of twee voor de meeste bestanden.

  3. 3

    Bekijk het voorbeeld

    Controleer de eerste pagina's geëxtraheerde tekst op het scherm.

  4. 4

    Download de .txt

    Eén plattetekstbestand, met gemarkeerde pagina-einden.

  5. 5

    Klaar binnen 1 uur

    Je PDF en het tekstbestand worden binnen 1 uur van onze servers verwijderd.

Veelgestelde vragen

Je PDF is vrijwel zeker een scan — afbeeldingen van tekst zonder tekstlaag. Haal hem eerst door onze OCR-tool en extraheer daarna.

Gerelateerde tools