スキャンしたPDFをOCRで編集可能なテキストに変換する方法
公開日:2026年9月1日 · 読了目安 4 分
コピーした用紙、撮影した印刷契約書、レシートなど、スキャンした文書は実際には画像がPDFに包まれているだけです。選択や検索ができるテキストレイヤーは存在しません。光学文字認識(OCR)はピクセルを読み取って実際のテキストを再構築します。このツールは成熟したオープンソースOCRエンジンであるTesseractを使用し、WebAssembly経由で完全にクライアント側で実行され、25言語分の学習済みデータを自前でホストしています。
OCR PDFを試す手順
- 1
OCR PDFツールを開く
PDF用OCRツールにアクセスします。
- 2
スキャン済みPDFをアップロード
テキストを抽出したいPDF(または画像)を選択します。
- 3
文書の言語とオプションを選択
文書が書かれている言語、OCRを実行するページ、そして文書のレイアウトが特殊な場合(疎らなフォームなど)はセグメンテーションモードを選びます。
- 4
OCRを実行
ツールは各ページをレンダリングしてテキストを認識します。OCRは単純なテキスト抽出より本質的に処理が重いため、1ページあたり数秒かかります。
- 5
テキストをコピーまたはダウンロード
抽出されたテキストを確認し、コピーするか、プレーンな.txtファイルとしてダウンロードします。
よくある質問
精度はスキャン品質に大きく左右されます。高解像度で照明の良い、きれいな印刷テキストのスキャンは非常に高精度でOCRされますが、手書き文字のぼやけた写真はそうはいきません。このツールは印刷テキスト向けに調整されたLSTMベースのTesseractエンジンを使用しています。
このサイトが提供する全言語に対応する25言語です。それぞれ選択したときだけダウンロードされる自前ホストの学習済みモデルを持ち、サードパーティのOCR APIには何も送信されません。
はい。OCRは通常のテキスト抽出よりページあたりの処理がはるかに重いため、ブラウザタブで何分も処理が続くのを防ぐために50ページまでに制限されています。それ以上必要な場合は、先に大きなPDFを分割してください。
いいえ。PDFビューアーですでにテキストを選択できるなら、より高速なPDFからテキストツールを使ってください。OCRが必要なのは、PDFが実質的にテキストの画像で、下に文字テキストのレイヤーがまったくない場合だけです。
OCRモデルとエンジンが自前でホストされ、Web Worker内で実行されるため、サードパーティのOCR APIにアップロードしたくない機密性の高いスキャン文書でも利用できます。

