guide·pdfty チーム··6 分で読めます

スキャンPDFをOCRで検索可能にする方法(無料・日本語対応)

スキャンしたPDFの文字を検索・コピーできるように。OCRで見えないテキスト層を追加。日本語対応、登録不要、無料で使えます。

スキャンしたPDFをOCRで検索可能にする
見た目はそのまま。検索・コピーができるPDFに変わります

スキャンした書類のPDFで「Ctrl+F」を押しても何もヒットしない——それは、そのPDFが文字ではなくただの画像だからです。**OCR(光学文字認識)**を通せば、画像の中の文字が認識され、検索もコピーもできる「普通のPDF」に生まれ変わります。紙の書類を電子化して整理したい人には必須の処理です。

スキャンPDFをOCRする手順

1

OCRツールを開く

pdfty.com/tools/ocr にアクセスします。20MBまで無料、インストール不要です。

Drop PDF here
2

スキャンPDFをアップロード

ファイルをドラッグ&ドロップします。通信はHTTPSで暗号化されています。

Drop PDF here
3

言語を選ぶ

日本語を選択します。日本語と英語が混在する書類にも対応できます。言語を正しく選ぶほど認識精度が上がります。

▾WebPrintPrepress
4

認識処理を待つ

Tesseractエンジンが各ページの文字を認識し、画像の上に見えないテキスト層を重ねます。ページ数にもよりますが、通常は数十秒です。

Compressing…69%~2 seconds remaining
5

検索可能なPDFをダウンロード

見た目は元のスキャンと同じ。でも検索・コピー・テキスト選択がすべて機能します。

All done — file readyAuto-deleted in 1 hour
数十言語
対応している認識言語
Tesseract
採用しているOCRエンジン
0円
20MBまでの料金
1時間
ファイル削除までの時間

「見えないテキスト層」とは?

OCR後のPDFを開いても、見た目は元のスキャンと1ピクセルも変わりません。変わるのは中身です。認識されたテキストが、画像のちょうど対応する位置に透明な文字として重ねられます。

  • 検索すると、透明テキストがヒットし、該当箇所がハイライトされます
  • ドラッグで選択すると、画像の上の文字がテキストとして選べます
  • コピー&ペーストすれば、WordやExcelにそのまま貼り付けられます

つまり「原本の見た目」と「テキストの利便性」を両立できるのが、この方式の強みです。

OCRのあとに圧縮もおすすめ

スキャンPDFはもともと画像の集まりなので、ファイルサイズが大きくなりがちです。OCRを終えたら、圧縮ツール(/ja/tools/compress)にかけると、検索機能はそのままにサイズを大幅に減らせます。メール添付やクラウド保存の前のひと手間として効果的です。

よくある質問

手書きの文字も認識できますか?

正直にお答えすると、手書きは苦手です。Tesseractを含む無料のOCRエンジンは活字(印刷された文字)向けに設計されており、手書きメモや筆記体の認識精度は大きく落ちます。印刷された書類、書籍、請求書などでは高い精度が出ますが、手書き中心の書類には期待しすぎないでください。

見た目が変わってしまうことはありませんか?

ありません。OCRは元のスキャン画像を一切加工せず、その上に透明なテキスト層を追加するだけです。印刷しても画面で見ても、元のファイルと見分けはつきません。変わるのは、検索やコピーが効くようになる点だけです。

日本語と英語が混ざった書類でも大丈夫ですか?

はい。複数言語の同時認識に対応しているため、日本語の本文に英単語や数字が混ざった一般的なビジネス文書でも問題なく処理できます。対応言語は日本語・英語のほか、中国語、韓国語、ヨーロッパ各言語など数十言語に及びます。

pdfty チーム

pdfty チームはプライバシー重視のオンライン PDF ツール(圧縮・変換・OCR・署名・保護)を開発しています。ファイルは 1 時間以内に削除されます。 私たちについて →

関連記事