guide·pdfty team··8 min leestijd

PDF omzetten naar HTML (schone webpagina's)

Maak van een PDF een schone HTML-pagina: tekst extraheren, pdftohtml of Calibre gebruiken, of insluiten. Een eerlijke blik op wat de conversie overleeft.

Een PDF-bestand omzetten naar een schone HTML-webpagina
PDF → HTML: wat de reis werkelijk overleeft

Wil je een PDF omzetten naar HTML, dan meteen het eerlijke nieuws: geen enkele tool maakt van een willekeurige PDF automatisch schone, responsieve HTML. PDF is een printformaat — het slaat op ‘zet dit teken op x=142, y=380’, niet ‘dit is een kop’. HTML is het tegenovergestelde. Elke conversie is een vertaling tussen twee filosofieën, en er gaat altijd iets verloren.

Dat betekent niet dat het moeilijk is. Het betekent dat je je methode moet kiezen op basis van wat je echt nodig hebt: schone markup, snel eenmalig resultaat, of het document überhaupt op een webpagina krijgen. Hier zijn alle drie, plus het pleidooi voor niet converteren.

Waarom zou je van een PDF überhaupt een webpagina maken?

Drie redenen komen telkens terug:

  • SEO. Zoekmachines indexeren PDF's, maar ranken echte HTML-pagina's veel beter: HTML heeft structuur (koppen, links, alt-teksten), laadt sneller en werkt op mobiel. Content die in een PDF begraven ligt, is content die de meeste zoekers nooit vinden.
  • Toegankelijkheid. Schermlezers gaan veel beter om met semantische HTML dan met de gemiddelde ongetagde PDF. Als het document voor iedereen telt, is HTML het toegankelijke formaat.
  • Gebruikerservaring. Een PDF-link op mobiel betekent downloaden → openen in een andere app → knijpzoomen op een vaste A4-lay-out. Een HTML-pagina leest gewoon.

Methode 1 — Extraheren en opnieuw opbouwen (schoonste markup)

Voor content waar je echt om geeft — een rapport dat op je site komt, een gids, documentatie — verslaat dit elke automatische converter. Je haalt het ruwe materiaal uit de PDF en schrijft er zelf de simpele HTML omheen.

1

Haal de tekst eruit

Sleep de PDF in Tekst extraheren. Je krijgt de volledige tekstinhoud, gratis tot 20 MB en 50 pagina's, zonder account.

Drop PDF here
2

Haal de afbeeldingen eruit

Haal dezelfde PDF door Afbeeldingen extraheren — elke ingesloten afbeelding komt er als apart bestand uit, op originele resolutie, klaar voor img-tags.

▾WebPrintPrepress
3

Breng de structuur aan

Plak de tekst in je editor en voeg de semantiek toe die de PDF nooit had: h2 voor sectietitels, p voor alinea's, ul voor lijsten, table waar nodig. Dit is het handwerk — doorgaans 15-30 minuten voor een document van 10 pagina's.

Compressing…69%~2 seconds remaining
4

Zet de afbeeldingen terug

Voeg img-tags met echte alt-teksten toe waar de figuren horen. Comprimeer de afbeeldingen meteen even voor het web.

contract_draft.pdfDownload
5

Publiceer

Het resultaat is HTML van handwerk-kwaliteit: responsief, toegankelijk, indexeerbaar — en dat levert geen enkele automatische converter je op.

All done — file readyAuto-deleted in 1 hour

Ja, het is handwerk. Maar het resultaat is HTML die je echt wilt onderhouden, en voor alles wat voor echte lezers bedoeld is, is die ruil het waard.

Methode 2 — pdftohtml en Calibre (voor het commandline-volk)

Wil je automatisering en kun je leven met rommeliger resultaat:

pdftohtml (onderdeel van de Poppler-utilities, voorgeïnstalleerd of één pakket verwijderd op Linux/Mac):

pdftohtml -s -noframes document.pdf output.html

De vlag -s geeft één doorlopend HTML-document in plaats van één bestand per pagina. De vlag -c schakelt de complexe modus in, die de lay-out nabootst met absoluut gepositioneerde divs — visueel dichter bij de PDF, maar de markup is voor niets anders bruikbaar dan weergave en breekt volledig op mobiel.

Calibre (gratis, cross-platform) behandelt de PDF als een e-book: open Calibre → voeg de PDF toe → Converteer → kies HTMLZ als uitvoer. Het werkt het best op eenkoloms, tekstzware PDF's en worstelt met meerkoloms lay-outs, die het vaak in de verkeerde volgorde leest.

Betaalde converters (Adobe Acrobat Pro's export naar HTML, diverse online diensten van $6-20/maand) doen het beter met tabellen en behouden meer opmaak, maar hun uitvoer blijft gegenereerde markup — honderden inline styles en geneste spans. Prima als je de content vandaag gewoon online wilt hebben; pijnlijk als je hem ooit bewerkt.

Methode 3 — Niet converteren: de PDF insluiten of linken

Soms is het juiste antwoord op ‘hoe zet ik deze PDF op mijn website’ om de PDF op je website te zetten:

<embed src="/files/report.pdf" type="application/pdf" width="100%" height="800px" />

Of gewoon een kale link met een groottevermelding: <a href="/files/report.pdf">Jaarverslag (PDF, 2,4 MB)</a>.

De nadelen: ingesloten PDF's blijven zwak voor SEO en onhandig op telefoons. Een gebruikelijke middenweg is allebei — een HTML-samenvatting van de kerninhoud op de pagina, met daaronder de link naar de volledige PDF.

Welke methode past bij jouw situatie?

SituatieBeste methodeWaarom
Content die langdurig op je site komtExtraheren + opbouwenSchoon, responsief, bewerkbaar, indexeerbaar
Eenmalig, intern, niemand bewerkt hetpdftohtml / CalibreSnel en gratis; rommeligheid maakt niet uit
Batch van 200 PDF's die online moetenpdftohtml gescriptDe enige automatiseerbare optie op die schaal
De vaste lay-out is het punt (formulieren, certificaten)PDF insluiten of linkenConversie kan deze alleen maar slechter maken
Gescande PDF (afbeeldingen van pagina's)Eerst OCR, dan opbouwenEr is geen tekstlaag om te extraheren totdat OCR heeft gedraaid
SEO is het doelExtraheren + opbouwenZoekmachines ranken gestructureerde HTML, geen gepositioneerde divs

Eerlijke verwachtingen: wat overleeft en wat niet

Welke methode je ook kiest, stel je verwachtingen bij:

  • Platte tekst: overleeft overal. Dit is de makkelijke 90%.
  • Fonts: worden meestal vervangen door websafe- of systeemfonts, tenzij je zelf webfonts toevoegt.
  • Meerkoloms lay-outs: de klassieke mislukking. Converters persen de kolommen ofwel plat tot één verwarrende stroom, ofwel bevriezen ze met absolute positionering.
  • Tabellen: wisselvallig. Simpele rasters converteren vaak; samengevoegde cellen en geneste tabellen zelden.
  • Kop- en voetteksten, paginanummers: komen mee als rommeltekst die elke ‘pagina’ terugkeert — die verwijder je met de hand.
  • Interactieve formuliervelden: overleven geen enkele converter. Bouw ze opnieuw als HTML-formulier.

Wil je de andere kant op — je hebt een webpagina en wilt er een PDF van — dan is dat een veel beter opgelost probleem; kijk daarvoor naar onze HTML-naar-PDF-tools.

~90%
Van de platte tekst overleeft elke conversiemethode
15-30 min
Om een gemiddelde PDF van 10 pagina's met de hand als schone HTML op te bouwen
$0
Kosten van extraheren-en-opbouwen met pdfty + je editor
1 uur
Totdat pdfty je bestanden van onze server verwijdert

Veelgestelde vragen

Bestaat er een echt gratis online PDF-naar-HTML-converter?

Gratis automatische converters bestaan, maar de uitvoer is gegenereerde markup — gepositioneerde divs en inline styles. De werkelijk gratis route naar schone HTML is tekst en afbeeldingen extraheren met pdfty (gratis tot 20 MB, 10 bewerkingen per dag, zonder account) en de markup zelf schrijven.

Mijn PDF is een scan — extractie levert niets op. Waarom?

Een gescande PDF bestaat uit plaatjes van pagina's, zonder tekstlaag erin. Draai er eerst OCR op; daarna werkt tekstextractie normaal. Zonder OCR kan geen converter ter wereld tekst vinden die er niet is.

pdftohtml behoudt de meeste linkannotaties als a-tags. In de extraheren-en-opbouwen-werkwijze laat platte tekstextractie ze vallen — kopieer belangrijke URL's handmatig uit de PDF terwijl je de markup schrijft.

Hoe krijg ik de afbeeldingen er op volle kwaliteit uit?

Gebruik Afbeeldingen extraheren — die haalt de ingesloten originelen eruit in plaats van pagina's te screenshotten, dus je krijgt de resolutie die daadwerkelijk in de PDF zat. Comprimeer ze daarna voor het web voordat je publiceert.

Indexeert Google PDF's überhaupt?

Ja — Google indexeert en rankt PDF's. Maar HTML-pagina's met dezelfde content presteren consequent beter: betere mobiele ervaring, snellere laadtijden, echte kopstructuur en interne links voeden allemaal de ranking. Telt de content voor zoekverkeer, publiceer hem dan als HTML.

Kan Word PDF naar HTML omzetten?

Min of meer. Word opent veel PDF's (Bestand → Openen), giet ze om tot een bewerkbaar document en kan Opslaan als → Webpagina. De HTML die het uitspuugt is berucht opgeblazen — bruikbaar als startpunt, niet als productiemarkup.

En PDF naar Markdown in plaats van HTML?

Vaak slimmer. Extraheer de tekst, voeg Markdown-syntaxis voor koppen en lijsten toe (sneller te typen dan tags) en laat je sitegenerator de HTML produceren. Dezelfde werkwijze als methode 1, met minder typen.

Is een ingesloten PDF slecht voor toegankelijkheid?

Meestal wel. Ondersteuning voor schermlezers in browser-PDF-viewers is wisselvallig, en ongetagde PDF's lezen overal slecht. Telt toegankelijkheid, bied de content dan aan als echte HTML — desnoods een vereenvoudigde versie naast de embed.

pdfty team

Het pdfty-team bouwt privacyvriendelijke online PDF-tools — comprimeren, converteren, OCR, ondertekenen en beveiligen. Bestanden worden binnen 1 uur verwijderd. Over ons →

Gerelateerde artikelen