テキスト抽出

PDFからすべてのテキストをプレーンテキストとして抽出

pdftyの抽出ツールは、PDFからすべての文字を取り出し、きれいなプレーンテキストファイルとしてお渡しします。全選択してのコピー&ペーストは、段組みレイアウトを頻繁に崩し、テキストボックスを取りこぼし、長い文書で破綻しがちですが、この抽出は50ページ全体を一度に処理し、読み順を保持します。

抽出にはPyMuPDFを使用しており、PDFの内部テキスト構造を直接読み取って、2段組みレイアウト、表、ヘッダー、脚注を含む自然な読み順を再構築します。Unicodeも完全に対応しており、キリル文字、CJK、アラビア文字、アクセント付き文字がそのまま出力されます。翻訳ツール、検索インデックス、AIアシスタントへの文書の投入、論文からの引用、文字数カウントなどに最適です。

重要な注意点が1つあります。この機能はテキストレイヤーを含むPDFに対して動作します。スキャンされた文書は文字の「写真」にすぎないため、まずOCRツール(Tesseract搭載)にかけてから抽出してください。20 MB・50ページまでのファイルは無料で、透かしも登録も不要です。ファイルは1時間以内に完全に削除されます。

使い方

  1. 1

    PDFをアップロード

    ドラッグ&ドロップするか、クリックして選択します。20 MB・50ページまで無料です。

  2. 2

    抽出

    PyMuPDFがテキストレイヤーを読み取り、読み順を再構築します。ほとんどのファイルで1〜2秒です。

  3. 3

    プレビュー

    抽出されたテキストの最初の数ページを画面で確認できます。

  4. 4

    .txtをダウンロード

    改ページ位置がマークされた1つのプレーンテキストファイルです。

  5. 5

    1時間で完了

    PDFとテキストファイルは1時間以内にサーバーから削除されます。

よくある質問

そのPDFはほぼ間違いなくスキャンです。テキストレイヤーのない、文字の画像です。まずOCRツールにかけてから抽出してください。

関連ツール