OCR PDF

テキスト認識でスキャンPDFを検索可能にします

pdftyのOCRツールは、画像ベースのPDF(スキャンや書類の写真)を、検索・コピーできるテキスト付きPDFに変換します。Tesseract 5と英語・ロシア語・フランス語・ドイツ語・スペイン語向けに最適化されたモデルを使用し、キリル文字やアクセント記号付き文字にも対応しています。

OCR後のPDFは見た目はそのままで、テキストのコピー・検索ができるようになり、元のレイアウトを保ったままWordへの変換も可能になります。スキャンした契約書、アーカイブ文書、ホワイトボードの写真、FAXの出力などに便利です。

無料プランは50ページ・20 MBまで。Proなら制限が解除されます。複数の文字体系が混在するページもOK — OCRが領域ごとに文字体系を検出します。お客様のデータをモデル学習に使うことは一切ありません。

使い方

  1. 1

    スキャンをアップロード

    スキャンまたは画像のみのPDFをドロップします。無料プランは20 MBまで。

  2. 2

    言語を選ぶ

    英語・ロシア語・フランス語・ドイツ語・スペイン語から1つ以上選択します。

  3. 3

    OCRを実行

    Tesseractが各ページを処理します。通常1ページあたり1〜3秒です。

  4. 4

    検索可能なPDFをダウンロード

    見た目はそのまま、非表示のテキスト層が追加されます。コピー・検索・変換ができるようになります。

  5. 5

    完了

    ファイルは1時間以内に削除されます。

よくある質問

きれいな300 DPIのスキャンなら、ラテン文字で98%以上、キリル文字で95%以上です。低解像度やノイズの多いスキャンでは精度が下がります。

関連ツール

ガイドとチュートリアル