Alle tekst uit een PDF als tekstbestand extraheren
Sleep je bestand hierheen
klik om te bladeren
Max bestandsgrootte: 20MB
De extractietool van pdfty haalt elk teken tekst uit een PDF en levert het als een schoon plattetekstbestand. Het verslaat alles-selecteren-en-plakken, dat lay-outs met meerdere kolommen regelmatig door elkaar husselt, tekstvakken overslaat en vastloopt op lange documenten — de extractie verwerkt alle 50 pagina's in één keer met behoud van de leesvolgorde.
De extractie draait op PyMuPDF, dat de interne tekststructuur van de PDF direct leest en de natuurlijke leesvolgorde reconstrueert — inclusief tweekolomslay-outs, tabellen, kopteksten en voetnoten. Volledige Unicode komt intact door: Cyrillisch, CJK, Arabisch, letters met accenten. Het resultaat is ideaal om documenten in vertaaltools, zoekindexen of AI-assistenten te voeren, om uit papers te citeren en voor woordtellingen.
Eén belangrijke opmerking: dit werkt bij PDF's die een tekstlaag bevatten. Gescande documenten zijn slechts plaatjes van tekst — haal ze eerst door onze OCR-tool (aangedreven door Tesseract) en extraheer daarna. Gratis voor bestanden tot 20 MB en 50 pagina's, geen watermerk, geen registratie. Bestanden worden binnen 1 uur permanent verwijderd.
Sleep het bestand hierheen of klik om te selecteren. Tot 20 MB en 50 pagina's gratis.
PyMuPDF leest de tekstlaag en reconstrueert de leesvolgorde. Een seconde of twee voor de meeste bestanden.
Controleer de eerste pagina's geëxtraheerde tekst op het scherm.
Eén plattetekstbestand, met gemarkeerde pagina-einden.
Je PDF en het tekstbestand worden binnen 1 uur van onze servers verwijderd.