PDFをテキストに変換する方法(編集・分析用に生テキストを抽出)
どんなPDFからも生テキストを.txtファイルとして抽出する方法。編集・スクリプト処理・分析に。無料・登録不要。スキャンPDFの対処法も解説します。

PDFがまさに間違った容れ物であることもあります。フォントも余白も2段組みレイアウトも要らない——欲しいのは素材としての言葉です。エディタに貼る、スクリプトに流す、数える、翻訳する、横断検索する、分析に食わせる。PDFをプレーンテキストに変換すると、コンテンツ以外のすべてが剥ぎ取られます。そしてそれこそが狙いです。
よくある動機はこうです。
- 編集 — PDFエディタと格闘せずに、契約書の定型文やレポートの文面を手直しする。
- スクリプトと分析 — grep、単語頻度、データパイプライン、プレーンテキストを食べるツールへの入力。
- 翻訳 — ほとんどの翻訳ワークフローは、装飾された文書ではなくきれいなテキストを求めます。
- アクセシビリティと可搬性 — .txtは30年前のマシンでも開けます。
始める前にひとつ。pdftyのテキスト抽出は同じエンジンです——どちらもPDFに埋め込まれたテキストを引き出します。先に見つけたほうを使えば同じ言葉が手に入ります。PDF→TXTはそれをダウンロード可能な.txtファイルとして返します。
PDFをテキストに変換する——手順
ツールを開く
pdfty.com/ja/tools/pdf-to-txtを開きます。20MB・50ページまで無料、アカウント不要です。
PDFをアップロード
ドラッグで追加します。パスワード付きなら先にロック解除を。
変換する
埋め込まれたテキストレイヤーが全ページから順番に読み出されます。数秒です。
.txtをダウンロード
文書の全テキストが入った1つのプレーンテキストファイル。アップロードは1時間後に自動削除されます。
出力をざっと確認
一度流し読みしてください。空か文字化けなら、そのPDFはスキャンです——下のOCRセクションへ。

スキャン問題:抽出すべきテキストが存在しないとき
PDFのテキスト抽出で最もよくある驚きがこれです。PDFは、テキストをまったく異なる2つの方法で持ちえます。
- デジタルPDF(Word・Webサイト・請求書システムからの書き出し)は本物のテキストレイヤーを持っています。抽出は即座で正確です。
- スキャンPDF(スキャナーやスマホカメラ由来)が含むのはテキストの写真だけ。抽出できるものは文字どおり何もなく、出力は空になります。
スキャンの解決策はOCR——光学文字認識——で、ピクセルを読んでテキストレイヤーを構築します。スキャンを先にOCRに通し、その結果をテキストに変換してください。精度はスキャン品質に依存します。
プレーンテキスト vs Word vs HTML——どれだけ構造が必要か
プレーンテキストはスペクトラムの一方の端です。どこに着地するか意図して選びましょう。
| 必要なもの | 正しいツール | 生き残るもの |
|---|---|---|
| 言葉だけ——スクリプトや編集用 | PDF→TXT | 全テキストが読み順で。レイアウトゼロ・装飾ゼロ |
| 書式付きの編集可能な文書 | PDF→Word | [PDF→Word](/ja/tools/pdf-to-word)が段落・フォント・表を保持 |
| 見出しとリンク付きのWeb対応マークアップ | PDF→HTML | [PDF→HTML](/ja/tools/pdf-to-html)がコンテンツを構造化 |
| 計算に使う表 | PDF→Excel | [PDF→Excel](/ja/tools/pdf-to-excel)は表データに特化 |
経験則:コンテンツを読む・処理するならTXT。人が書式を見る必要があるならWordかHTMLです。
無料のローカル代替手段
単発の作業ならブラウザが最速ですが、抽出が日々の道具箱の一部なら——あるいは文書がマシンの外に出せないなら——次のローカルの道が堅実です。
pdftotext(poppler-utils、無料・全プラットフォーム)。 コマンドライン抽出のゴールドスタンダードです。
pdftotext input.pdf output.txt
-layoutを付けると元の段組みの位置をスペースで近似します——表形式のテキストには本当に便利です。macOSならHomebrew、Linuxならパッケージマネージャーでインストールできます。
ビューアからコピペ。 1〜2ページなら、PDFビューアで全選択してエディタに貼り付ければ十分です。改行の掃除と、たまに崩れる段組みの手直しは覚悟してください。
Microsoft Word。 WordはPDFを開いて編集可能な文書に変換でき、そこから.txtとして保存できます。遅いうえに途中で文書を再フローします——生テキストが欲しいだけなら大げさです。
実用上の注意点
- レイアウトは消えます——仕様です。 段組みページは一直線のテキストになり、表は行に潰れ、テキストボックスはコンテンツストリーム内の位置に落ちます。段組みがひどく混ざる場合は、
pdftotext -layoutかPDF→Wordのほうが複雑なレイアウトをうまく扱います。 - ヘッダー・フッター・ページ番号は繰り返されます。 柱(ランニングヘッダー)は出力にページごとに現れます。検索して削除する一手間(または1行スクリプト)できれいになります。
- ハイフネーション。 両端揃えのテキストで行をまたいで分割された単語は、分割されたままです。「- 」+小文字を探す置換でだいたい直せます——完璧ではないが速い方法です。
- 合字と記号。 凝ったタイポグラフィ(fi、fl、スマートクォート)は、PDFが実際にエンコードしている文字として出てきます——UTF-8なら普通は問題なく、分析前に正規化する価値があることもたまにあります。
- 空か文字化けの出力は、ほぼ確実にスキャン(まずOCR)か、まれに意図的に難読化されたフォントエンコーディングのPDFです。後者の場合も、皮肉なことにOCRが解決策になります。ラスタライズして、ピクセルを読むのです。
よくある質問
出力ファイルが空なのはなぜ?
そのPDFはほぼ確実にスキャンです——テキストレイヤーのないページの写真です。先にOCRに通してから抽出してください。5秒テスト:PDFビューアでテキストを選択できなければ、テキストは存在しません。
出力に太字・見出し・フォントは残りますか?
いいえ——.txtファイルは書式を一切表現できないので、純粋な文字だけが手に入ります。それが特長です。編集やスクリプト処理で格闘する相手がいません。書式が必要ならPDF→Wordを。
表はどうなりますか?
プレーンな行に潰れ、桁揃えはおおむね失われます。作業に使う表なら、まさにそのために作られたPDF→Excelがあります。
テキスト抽出ツールと同じもの?
はい——テキスト抽出は同じエンジンで動いています。どちらも文書のテキストを引き出します。先に見つけたほうをどうぞ。
一部のページだけ抽出できますか?
先に分割ツールで必要なページに絞ってから変換してください。出力が焦点を保ち、無料プランの50ページ上限にも収まります。
パスワード付きPDFでも動きますか?
まずロック解除でパスワードを外してから(パスワードを知っている必要があります)、普通に変換してください。
文書は安全ですか?
アップロードはHTTPSのみ、アカウントはなく、ファイルは1時間後に自動削除されます。アップロードできない文書には、pdftotextが完全オフラインで動きます。
無料プランの制限は?
1ファイル20MB、50ページ、1日10回まで——登録不要・透かしなし。Pro(月額9ドル)で上限がなくなります。
pdfty チームはプライバシー重視のオンライン PDF ツール(圧縮・変換・OCR・署名・保護)を開発しています。ファイルは 1 時間以内に削除されます。 私たちについて →