guide·pdfty team··7 min leestijd

PDF naar tekst omzetten (ruwe tekst voor bewerken & analyse)

Haal ruwe tekst uit elke PDF naar een plat .txt-bestand voor bewerken, scripten of analyse — gratis, zonder account. Plus wat te doen bij een scan.

Ruwe tekst uit een PDF halen naar een plat tekstbestand
PDF erin → ruwe, bewerkbare tekst eruit

Soms is een PDF precies de verkeerde verpakking. Je wilt niet de fonts, de marges of de tweekolomslay-out — je wilt de woorden, als grondstof: om in een editor te plakken, door een script te halen, te tellen, te vertalen, te doorzoeken, in een analyse te voeren. PDF naar platte tekst omzetten stript alles weg behalve de inhoud, en dat is precies de bedoeling.

Typische redenen waarom mensen dit doen:

  • Bewerken — standaardteksten uit contracten of rapporten herwerken zonder met PDF-editors te vechten.
  • Scripten en analyse — grep, woordfrequenties, datapipelines, documenten voeren aan tooling die platte tekst eet.
  • Vertalen — de meeste vertaalworkflows willen schone tekst, geen gestileerd document.
  • Toegankelijkheid en draagbaarheid — een .txt opent op alles, tot een machine van 30 jaar oud aan toe.

Eén opmerking vooraf: Tekst extraheren op pdfty is dezelfde engine — beide halen de ingesloten tekst uit de PDF. Welke je ook als eerste pakt, je krijgt dezelfde woorden; PDF naar TXT geeft ze terug als downloadbaar .txt-bestand.

PDF naar tekst omzetten — stap voor stap

1

Open de tool

Ga naar pdfty.com/nl/tools/pdf-to-txt. Gratis tot 20 MB en 50 pagina's, zonder account.

Drop PDF here
2

Upload je PDF

Sleep hem erin. Met wachtwoord beveiligd? Ontgrendel hem eerst.

Drop PDF here
3

Omzetten

De ingesloten tekstlaag wordt van elke pagina uitgelezen, op volgorde. Een paar seconden.

Compressing…69%~2 seconds remaining
4

Download de .txt

Eén plat tekstbestand met de volledige tekst van het document. Uploads worden na 1 uur automatisch verwijderd.

contract_draft.pdfDownload
5

Controleer de output even

Scan hem één keer door. Is hij leeg of wartaal, dan is je PDF een scan — zie de OCR-sectie hieronder.

All done — file readyAuto-deleted in 1 hour
🔒 pdfty.com/en/tools/pdf-to-txt
De pdfty PDF naar TXT tool
pdfty PDF naar TXT: de woorden van het document, niets anders

Het scanprobleem: wanneer er geen tekst is om te extraheren

Dit is dé meest voorkomende verrassing bij PDF-tekstextractie. Een PDF kan zijn tekst op twee totaal verschillende manieren bevatten:

  1. Digitale PDF's (geëxporteerd uit Word, een website, een factuursysteem) dragen een echte tekstlaag. Extractie is direct en accuraat.
  2. Gescande PDF's (uit een scanner of telefooncamera) bevatten alleen plaatjes van tekst. Er valt letterlijk niets te extraheren — de output zal leeg zijn.

De oplossing voor scans is OCR — optische tekenherkenning — die de pixels leest en een tekstlaag opbouwt. Haal je scan eerst door OCR en converteer het resultaat daarna naar tekst. De nauwkeurigheid hangt af van de scankwaliteit.

Platte tekst vs Word vs HTML — hoeveel structuur heb je nodig?

Platte tekst is één uiteinde van een spectrum. Kies bewust waar je landt:

Je hebt nodigJuiste toolWat overleeft
Alleen de woorden, voor scripts of bewerkenPDF naar TXTAlle tekst, in leesvolgorde — nul lay-out, nul stilering
Een bewerkbaar document met opmaakPDF naar Word[PDF naar Word](/nl/tools/pdf-to-word) behoudt alinea's, fonts en tabellen
Web-klare opmaak met koppen en linksPDF naar HTML[PDF naar HTML](/nl/tools/pdf-to-html) structureert de inhoud
Tabellen om op te rekenenPDF naar Excel[PDF naar Excel](/nl/tools/pdf-to-excel) richt zich specifiek op tabeldata

Vuistregel: ga je de inhoud lezen of verwerken, neem TXT. Moet een mens opmaak zien, neem Word of HTML.

Gratis lokale alternatieven

Voor eenmalige klussen is de browser het snelst, maar hoort extractie bij je dagelijkse gereedschap — of mogen de documenten je machine niet verlaten — dan zijn deze lokale routes degelijk:

pdftotext (poppler-utils — gratis, alle platforms). De gouden standaard voor extractie via de opdrachtregel:

pdftotext input.pdf output.txt

Voeg -layout toe om de oorspronkelijke kolomposities met spaties te benaderen — oprecht nuttig voor tabelachtige tekst. Installeren via Homebrew op macOS of je pakketbeheerder op Linux.

Kopiëren-plakken uit een viewer. Voor een pagina of twee werkt alles selecteren in je PDF-viewer en in een editor plakken. Reken op het opschonen van regeleinden en een incidenteel verhaspelde kolom.

Microsoft Word. Word opent PDF's en converteert ze naar bewerkbare documenten, waaruit je als .txt kunt opslaan. Trager, en het herstroomt het document onderweg — overkill wanneer je alleen ruwe tekst wilt.

Praktische valkuilen

  • Lay-out is weg — bewust. Pagina's met meerdere kolommen komen eruit als lineaire tekst, tabellen zakken in tot regels, en tekstvakken landen waar ze in de inhoudsstroom vallen. Lopen kolommen lelijk door elkaar, dan verwerken pdftotext -layout of PDF naar Word complexe lay-outs beter.
  • Kopteksten, voetteksten en paginanummers herhalen. Doorlopende kopteksten verschijnen in de output één keer per pagina. Een snelle zoek-en-verwijder-ronde (of een éénregelscript) ruimt ze op.
  • Woordafbreking. Woorden die in uitgevulde tekst over regels gesplitst zijn ("docu- ment") blijven gesplitst. Te repareren met zoeken-en-vervangen op "- " gevolgd door een kleine letter — imperfect maar snel.
  • Ligaturen en symbolen. Chique typografie (fi, fl, gekrulde aanhalingstekens) komt door als de tekens die de PDF werkelijk codeert — meestal prima in UTF-8, af en toe een normalisatieronde waard vóór analyse.
  • Lege of verhaspelde output betekent vrijwel altijd een scan (eerst OCR) of, zelden, een PDF met bewust versluierde fontcoderingen. Voor dat laatste is OCR ironisch genoeg ook de oplossing: renderen en de pixels lezen.

Veelgestelde vragen

Waarom is mijn outputbestand leeg?

Je PDF is vrijwel zeker een scan — plaatjes van pagina's, zonder tekstlaag. Haal hem eerst door OCR en extraheer daarna. De 5-secondentest: kun je in een PDF-viewer geen tekst selecteren, dan is er geen tekst.

Behoudt de output vet, koppen en lettertypen?

Nee — .txt-bestanden kunnen opmaak helemaal niet weergeven, dus je krijgt pure tekens. Dat is juist de feature: niets om tegen te vechten bij bewerken of scripten. Voor opmaak gebruik je PDF naar Word.

Wat gebeurt er met tabellen?

Die worden platgeslagen tot gewone regels, en kolomuitlijning gaat doorgaans verloren. Voor tabellen waarmee je moet werken is PDF naar Excel precies daarvoor gebouwd.

Is dit hetzelfde als de tool Tekst extraheren?

Ja — Tekst extraheren draait dezelfde engine. Beide halen de tekst van het document eruit; gebruik welke je het eerst vindt.

Kan ik tekst uit maar een paar pagina's halen?

Splits de PDF eerst tot de pagina's die je nodig hebt, en converteer daarna. Houdt de output gericht en binnen de gratis limiet van 50 pagina's.

Werkt het op een PDF met wachtwoord?

Verwijder eerst het wachtwoord met Ontgrendelen (je moet het wachtwoord kennen), en converteer daarna normaal.

Is mijn document veilig?

Uploads gaan uitsluitend via HTTPS, er is geen account, en bestanden worden na 1 uur automatisch verwijderd. Voor documenten die je niet mag uploaden draait pdftotext volledig offline.

Wat zijn de gratis limieten?

20 MB per bestand, 50 pagina's, 10 bewerkingen per dag — zonder account, zonder watermerk. Pro ($9/mnd) heft de plafonds op.

pdfty team

Het pdfty-team bouwt privacyvriendelijke online PDF-tools — comprimeren, converteren, OCR, ondertekenen en beveiligen. Bestanden worden binnen 1 uur verwijderd. Over ons →

Gerelateerde artikelen