guide·pdfty チーム··12 分で読めます

PDFをテキストに変換する方法(編集・分析用に生テキストを抽出)

どんなPDFからも生テキストを.txtファイルとして抽出する方法。編集・スクリプト処理・分析に。無料・登録不要。スキャンPDFの対処法も解説します。

PDFから生テキストをプレーンテキストファイルに抽出
PDFを入れると、生の編集可能なテキストが出てくる

PDFがまさに間違った容れ物であることもあります。フォントも余白も2段組みレイアウトも要らない——欲しいのは素材としての言葉です。エディタに貼る、スクリプトに流す、数える、翻訳する、横断検索する、分析に食わせる。PDFをプレーンテキストに変換すると、コンテンツ以外のすべてが剥ぎ取られます。そしてそれこそが狙いです。

よくある動機はこうです。

  • 編集 — PDFエディタと格闘せずに、契約書の定型文やレポートの文面を手直しする。
  • スクリプトと分析 — grep、単語頻度、データパイプライン、プレーンテキストを食べるツールへの入力。
  • 翻訳 — ほとんどの翻訳ワークフローは、装飾された文書ではなくきれいなテキストを求めます。
  • アクセシビリティと可搬性 — .txtは30年前のマシンでも開けます。

始める前にひとつ。pdftyのテキスト抽出は同じエンジンです——どちらもPDFに埋め込まれたテキストを引き出します。先に見つけたほうを使えば同じ言葉が手に入ります。PDF→TXTはそれをダウンロード可能な.txtファイルとして返します。

PDFをテキストに変換する——手順

1

ツールを開く

pdfty.com/ja/tools/pdf-to-txtを開きます。20MB・50ページまで無料、アカウント不要です。

Drop PDF here
2

PDFをアップロード

ドラッグで追加します。パスワード付きなら先にロック解除を。

Drop PDF here
3

変換する

埋め込まれたテキストレイヤーが全ページから順番に読み出されます。数秒です。

Compressing…69%~2 seconds remaining
4

.txtをダウンロード

文書の全テキストが入った1つのプレーンテキストファイル。アップロードは1時間後に自動削除されます。

contract_draft.pdfDownload
5

出力をざっと確認

一度流し読みしてください。空か文字化けなら、そのPDFはスキャンです——下のOCRセクションへ。

All done — file readyAuto-deleted in 1 hour
🔒 pdfty.com/en/tools/pdf-to-txt
pdftyのPDF→TXT変換ツール
pdftyのPDF→TXT:文書の言葉だけを、ほかには何もなしで。

スキャン問題:抽出すべきテキストが存在しないとき

PDFのテキスト抽出で最もよくある驚きがこれです。PDFは、テキストをまったく異なる2つの方法で持ちえます。

  1. デジタルPDF(Word・Webサイト・請求書システムからの書き出し)は本物のテキストレイヤーを持っています。抽出は即座で正確です。
  2. スキャンPDF(スキャナーやスマホカメラ由来)が含むのはテキストの写真だけ。抽出できるものは文字どおり何もなく、出力は空になります。

スキャンの解決策はOCR——光学文字認識——で、ピクセルを読んでテキストレイヤーを構築します。スキャンを先にOCRに通し、その結果をテキストに変換してください。精度はスキャン品質に依存します。

プレーンテキスト vs Word vs HTML——どれだけ構造が必要か

プレーンテキストはスペクトラムの一方の端です。どこに着地するか意図して選びましょう。

必要なもの正しいツール生き残るもの
言葉だけ——スクリプトや編集用PDF→TXT全テキストが読み順で。レイアウトゼロ・装飾ゼロ
書式付きの編集可能な文書PDF→Word[PDF→Word](/ja/tools/pdf-to-word)が段落・フォント・表を保持
見出しとリンク付きのWeb対応マークアップPDF→HTML[PDF→HTML](/ja/tools/pdf-to-html)がコンテンツを構造化
計算に使う表PDF→Excel[PDF→Excel](/ja/tools/pdf-to-excel)は表データに特化

経験則:コンテンツを読む・処理するならTXT。人が書式を見る必要があるならWordかHTMLです。

無料のローカル代替手段

単発の作業ならブラウザが最速ですが、抽出が日々の道具箱の一部なら——あるいは文書がマシンの外に出せないなら——次のローカルの道が堅実です。

pdftotext(poppler-utils、無料・全プラットフォーム)。 コマンドライン抽出のゴールドスタンダードです。

pdftotext input.pdf output.txt

-layoutを付けると元の段組みの位置をスペースで近似します——表形式のテキストには本当に便利です。macOSならHomebrew、Linuxならパッケージマネージャーでインストールできます。

ビューアからコピペ。 1〜2ページなら、PDFビューアで全選択してエディタに貼り付ければ十分です。改行の掃除と、たまに崩れる段組みの手直しは覚悟してください。

Microsoft Word。 WordはPDFを開いて編集可能な文書に変換でき、そこから.txtとして保存できます。遅いうえに途中で文書を再フローします——生テキストが欲しいだけなら大げさです。

実用上の注意点

  • レイアウトは消えます——仕様です。 段組みページは一直線のテキストになり、表は行に潰れ、テキストボックスはコンテンツストリーム内の位置に落ちます。段組みがひどく混ざる場合は、pdftotext -layoutかPDF→Wordのほうが複雑なレイアウトをうまく扱います。
  • ヘッダー・フッター・ページ番号は繰り返されます。 柱(ランニングヘッダー)は出力にページごとに現れます。検索して削除する一手間(または1行スクリプト)できれいになります。
  • ハイフネーション。 両端揃えのテキストで行をまたいで分割された単語は、分割されたままです。「- 」+小文字を探す置換でだいたい直せます——完璧ではないが速い方法です。
  • 合字と記号。 凝ったタイポグラフィ(fi、fl、スマートクォート)は、PDFが実際にエンコードしている文字として出てきます——UTF-8なら普通は問題なく、分析前に正規化する価値があることもたまにあります。
  • 空か文字化けの出力は、ほぼ確実にスキャン(まずOCR)か、まれに意図的に難読化されたフォントエンコーディングのPDFです。後者の場合も、皮肉なことにOCRが解決策になります。ラスタライズして、ピクセルを読むのです。

よくある質問

出力ファイルが空なのはなぜ?

そのPDFはほぼ確実にスキャンです——テキストレイヤーのないページの写真です。先にOCRに通してから抽出してください。5秒テスト:PDFビューアでテキストを選択できなければ、テキストは存在しません。

出力に太字・見出し・フォントは残りますか?

いいえ——.txtファイルは書式を一切表現できないので、純粋な文字だけが手に入ります。それが特長です。編集やスクリプト処理で格闘する相手がいません。書式が必要ならPDF→Wordを。

表はどうなりますか?

プレーンな行に潰れ、桁揃えはおおむね失われます。作業に使う表なら、まさにそのために作られたPDF→Excelがあります。

テキスト抽出ツールと同じもの?

はい——テキスト抽出は同じエンジンで動いています。どちらも文書のテキストを引き出します。先に見つけたほうをどうぞ。

一部のページだけ抽出できますか?

先に分割ツールで必要なページに絞ってから変換してください。出力が焦点を保ち、無料プランの50ページ上限にも収まります。

パスワード付きPDFでも動きますか?

まずロック解除でパスワードを外してから(パスワードを知っている必要があります)、普通に変換してください。

文書は安全ですか?

アップロードはHTTPSのみ、アカウントはなく、ファイルは1時間後に自動削除されます。アップロードできない文書には、pdftotextが完全オフラインで動きます。

無料プランの制限は?

1ファイル20MB、50ページ、1日10回まで——登録不要・透かしなし。Pro(月額9ドル)で上限がなくなります。

pdfty チーム

pdfty チームはプライバシー重視のオンライン PDF ツール(圧縮・変換・OCR・署名・保護)を開発しています。ファイルは 1 時間以内に削除されます。 私たちについて →

関連記事