PDFからすべてのテキストをプレーンテキストとして抽出
ここにファイルをドラッグ&ドロップ
クリックして選択
最大ファイルサイズ:20MB
pdftyの抽出ツールは、PDFからすべての文字を取り出し、きれいなプレーンテキストファイルとしてお渡しします。全選択してのコピー&ペーストは、段組みレイアウトを頻繁に崩し、テキストボックスを取りこぼし、長い文書で破綻しがちですが、この抽出は50ページ全体を一度に処理し、読み順を保持します。
抽出にはPyMuPDFを使用しており、PDFの内部テキスト構造を直接読み取って、2段組みレイアウト、表、ヘッダー、脚注を含む自然な読み順を再構築します。Unicodeも完全に対応しており、キリル文字、CJK、アラビア文字、アクセント付き文字がそのまま出力されます。翻訳ツール、検索インデックス、AIアシスタントへの文書の投入、論文からの引用、文字数カウントなどに最適です。
重要な注意点が1つあります。この機能はテキストレイヤーを含むPDFに対して動作します。スキャンされた文書は文字の「写真」にすぎないため、まずOCRツール(Tesseract搭載)にかけてから抽出してください。20 MB・50ページまでのファイルは無料で、透かしも登録も不要です。ファイルは1時間以内に完全に削除されます。
ドラッグ&ドロップするか、クリックして選択します。20 MB・50ページまで無料です。
PyMuPDFがテキストレイヤーを読み取り、読み順を再構築します。ほとんどのファイルで1〜2秒です。
抽出されたテキストの最初の数ページを画面で確認できます。
改ページ位置がマークされた1つのプレーンテキストファイルです。
PDFとテキストファイルは1時間以内にサーバーから削除されます。