guide·Zespół pdfty··8 min czytania

Jak przekonwertować plik PDF do HTML (czyste strony WWW)

Jak zamienić PDF w czystą stronę HTML: wyodrębnij tekst, użyj pdftohtml lub Calibre albo osadź plik. Szczerze o tym, co przetrwa konwersję, a co nie.

Konwersja pliku PDF na czystą stronę HTML
PDF → HTML: co naprawdę przetrwa tę podróż

Jeśli chcesz przekonwertować plik PDF do HTML, szczera wiadomość na początek: żadne narzędzie nie zamieni dowolnego PDF-a w czysty, responsywny HTML automatycznie. PDF to format drukarski — zapisuje „postaw ten glif w punkcie x=142, y=380”, a nie „to jest nagłówek”. HTML jest jego przeciwieństwem. Każda konwersja to tłumaczenie między dwiema filozofiami i zawsze coś ginie po drodze.

To nie znaczy, że jest trudno. To znaczy, że metodę trzeba dobrać do tego, czego naprawdę potrzebujesz: czystych znaczników, szybkiego jednorazowego wyniku albo po prostu umieszczenia dokumentu na stronie. Oto wszystkie trzy, plus argument za niekonwertowaniem.

Po co w ogóle zamieniać PDF w stronę WWW?

Trzy powody wracają nieustannie:

  • SEO. Wyszukiwarki indeksują PDF-y, ale prawdziwe strony HTML rankują znacznie lepiej: HTML ma strukturę (nagłówki, linki, teksty alternatywne), ładuje się szybciej i działa na telefonach. Treść zakopana w PDF-ie to treść, której większość szukających nigdy nie znajdzie.
  • Dostępność. Czytniki ekranu radzą sobie z semantycznym HTML-em znacznie lepiej niż z przeciętnym nieotagowanym PDF-em. Jeśli dokument ma docierać do wszystkich, HTML jest formatem dostępnym.
  • Wygoda użytkownika. Link do PDF-a na telefonie oznacza: pobierz → otwórz w innej aplikacji → powiększaj palcami sztywny układ A4. Stronę HTML po prostu się czyta.

Metoda 1 — wyodrębnij i odbuduj (najczystsze znaczniki)

Dla treści, na których naprawdę Ci zależy — raportu wchodzącego na stronę, poradnika, dokumentacji — to bije każdy automatyczny konwerter. Wyciągasz surowy materiał z PDF-a i sam piszesz wokół niego prosty HTML.

1

Wyciągnij tekst

Wrzuć PDF do Wyodrębnij tekst. Dostajesz pełną treść tekstową, za darmo do 20 MB i 50 stron, bez rejestracji.

Drop PDF here
2

Wyciągnij obrazy

Ten sam PDF przepuść przez Wyodrębnij obrazy — każdy osadzony obraz wychodzi jako osobny plik w oryginalnej rozdzielczości, gotowy do znaczników img.

▾WebPrintPrepress
3

Oznacz strukturę

Wklej tekst do edytora i dodaj semantykę, której PDF nigdy nie miał: h2 dla tytułów sekcji, p dla akapitów, ul dla list, table tam, gdzie trzeba. To jest część ręczna — zwykle 15-30 minut dla 10-stronicowego dokumentu.

Compressing…69%~2 seconds remaining
4

Wstaw obrazy z powrotem

Dodaj znaczniki img z prawdziwym tekstem alt tam, gdzie należą ilustracje. Przy okazji skompresuj obrazy pod web.

contract_draft.pdfDownload
5

Opublikuj

Wynik to HTML jakości ręcznej roboty: responsywny, dostępny, indeksowalny — niczego z tego nie da Ci automatyczny konwerter.

All done — file readyAuto-deleted in 1 hour

Tak, to praca ręczna. Ale na wyjściu dostajesz HTML, który naprawdę chce się utrzymywać, i dla wszystkiego, co trafia do prawdziwych czytelników, ta wymiana się opłaca.

Metoda 2 — pdftohtml i Calibre (dla fanów wiersza poleceń)

Jeśli chcesz automatyzacji i przełkniesz bardziej chaotyczny wynik:

pdftohtml (część narzędzi Poppler, preinstalowany albo o jeden pakiet od instalacji na Linuksie/Macu):

pdftohtml -s -noframes document.pdf output.html

Flaga -s daje jeden ciągły dokument HTML zamiast osobnego pliku na stronę. Flaga -c włącza „tryb złożony”, który odtwarza układ za pomocą absolutnie pozycjonowanych div-ów — wizualnie bliżej PDF-a, ale znaczniki nie nadają się do niczego poza wyświetlaniem i kompletnie rozpadają się na telefonach.

Calibre (darmowy, wieloplatformowy) traktuje PDF jak e-booka: otwórz Calibre → Dodaj PDF → Konwertuj → wybierz wyjście HTMLZ. Najlepiej działa na jednokolumnowych, tekstowych PDF-ach, a męczy się z układami wielokolumnowymi, które często czyta w złej kolejności.

Konwertery płatne (eksport do HTML w Adobe Acrobat Pro, różne usługi online za $6-20/miesiąc) lepiej radzą sobie z tabelami i zachowują więcej formatowania, ale ich wynik to nadal wygenerowane znaczniki — setki stylów inline i zagnieżdżonych spanów. W porządku, jeśli treść ma być online już dziś; bolesne, jeśli kiedykolwiek będziesz ją edytować.

Metoda 3 — nie konwertuj: osadź lub podlinkuj PDF

Czasem właściwą odpowiedzią na „jak umieścić ten PDF na mojej stronie” jest umieszczenie PDF-a na stronie:

<embed src="/files/report.pdf" type="application/pdf" width="100%" height="800px" />

Albo po prostu zwykły link z podpowiedzią rozmiaru: <a href="/files/report.pdf">Raport roczny (PDF, 2,4 MB)</a>.

Wady: osadzone PDF-y wciąż są słabe dla SEO i niewygodne na telefonach. Częsty złoty środek to jedno i drugie — streszczenie kluczowej treści w HTML-u na stronie i pełny PDF podlinkowany poniżej.

Która metoda pasuje do Twojego przypadku?

SytuacjaNajlepsza metodaDlaczego
Treść na Twoją stronę na dłużejWyodrębnij + odbudujCzysto, responsywnie, edytowalnie, indeksowalnie
Jednorazowo, wewnętrznie, nikt nie edytujepdftohtml / CalibreSzybko i za darmo; bałagan nie przeszkadza
Paczka 200 PDF-ów do wrzucenia onlinepdftohtml w skrypcieJedyna automatyzowalna opcja w tej skali
Stały układ jest sednem (formularze, certyfikaty)Osadź lub podlinkuj PDFKonwersja może je tylko pogorszyć
Zeskanowany PDF (obrazy stron)Najpierw OCR, potem odbudowaNie ma warstwy tekstowej do wyciągnięcia, dopóki nie przejdzie OCR
Celem jest SEOWyodrębnij + odbudujWyszukiwarki rankują ustrukturyzowany HTML, nie pozycjonowane divy

Szczere oczekiwania: co przetrwa, a co nie

Niezależnie od metody, skalibruj oczekiwania:

  • Zwykły tekst: przetrwa wszędzie. To te łatwe 90%.
  • Czcionki: zwykle zastępowane webowymi lub systemowymi, chyba że ręcznie dodasz webfonty.
  • Układy wielokolumnowe: klasyczna porażka. Konwertery albo spłaszczają kolumny w jeden mylący strumień, albo zamrażają je absolutnym pozycjonowaniem.
  • Tabele: różnie. Proste siatki często się konwertują; scalone komórki i tabele zagnieżdżone — rzadko.
  • Nagłówki, stopki, numery stron: przechodzą jako śmieciowy tekst powtarzany na każdej „stronie” — będziesz je usuwać ręcznie.
  • Interaktywne pola formularzy: nie przetrwają żadnego konwertera. Odbuduj je jako formularz HTML.

Jeśli idziesz w drugą stronę — masz stronę WWW i chcesz z niej PDF — to problem rozwiązany znacznie lepiej; poszukaj konwersji HTML do PDF.

~90%
Zwykłego tekstu przetrwa dowolną metodę konwersji
15-30 min
Ręczna odbudowa typowego 10-stronicowego PDF-a jako czysty HTML
0 zł
Koszt metody wyodrębnij-i-odbuduj z pdfty i Twoim edytorem
1 godzina
Po tym czasie pdfty usuwa Twoje pliki z serwera

Najczęstsze pytania

Czy istnieje naprawdę darmowy konwerter PDF do HTML online?

Darmowe konwertery automatyczne istnieją, ale ich wynik to wygenerowane znaczniki — pozycjonowane divy i style inline. Naprawdę darmowa droga do czystego HTML-a to wyodrębnienie tekstu i obrazów przez pdfty (za darmo do 20 MB, 10 operacji dziennie, bez rejestracji) i napisanie znaczników samodzielnie.

Mój PDF to skan — ekstrakcja nic nie zwraca. Dlaczego?

Zeskanowany PDF to obrazki stron, bez warstwy tekstowej w środku. Najpierw przepuść go przez OCR; potem ekstrakcja tekstu działa normalnie. Bez OCR żaden konwerter na świecie nie znajdzie tekstu, którego tam nie ma.

Czy hiperłącza z PDF-a przetrwają konwersję?

pdftohtml zachowuje większość adnotacji linków jako znaczniki a. W metodzie wyodrębnij-i-odbuduj ekstrakcja czystego tekstu je gubi — ważne adresy URL kopiuj z PDF-a ręcznie podczas oznaczania.

Jak wyciągnąć obrazy w pełnej jakości?

Użyj Wyodrębnij obrazy — wyciąga osadzone oryginały zamiast robić zrzuty stron, więc dostajesz rozdzielczość, która faktycznie była zapisana w PDF-ie. Potem skompresuj je pod web przed publikacją.

Czy Google w ogóle indeksuje PDF-y?

Tak — Google indeksuje i rankuje PDF-y. Ale strony HTML z tą samą treścią konsekwentnie je wyprzedzają: lepsze doświadczenie mobilne, szybsze ładowanie, prawdziwa struktura nagłówków i linki wewnętrzne — wszystko to zasila ranking. Jeśli treść ma znaczenie dla wyszukiwania, publikuj ją jako HTML.

Czy Word potrafi zrobić PDF do HTML?

W pewnym sensie. Word otwiera wiele PDF-ów (Plik → Otwórz), przelewa je do edytowalnego dokumentu i umie Zapisz jako → Strona sieci Web. HTML, który generuje, jest notorycznie rozdęty — nadaje się jako punkt wyjścia, nie jako znaczniki produkcyjne.

A może PDF do Markdown zamiast HTML?

Często to mądrzejsze. Wyodrębnij tekst, dodaj składnię nagłówków i list Markdown (szybciej się ją pisze niż znaczniki) i pozwól swojemu generatorowi stron wyprodukować HTML. Ten sam proces co Metoda 1, tylko mniej pisania.

Czy osadzony PDF szkodzi dostępności?

Zwykle tak. Obsługa czytników ekranu w przeglądarkowych czytnikach PDF jest niespójna, a nieotagowane PDF-y czytają się źle wszędzie. Jeśli dostępność ma znaczenie, udostępnij treść jako prawdziwy HTML — choćby wersję uproszczoną obok osadzenia.

Zespół pdfty

Zespół pdfty tworzy przyjazne prywatności narzędzia PDF online — kompresja, konwersja, OCR, podpis i ochrona. Pliki usuwane w ciągu 1 godziny. O nas →

Powiązane artykuły