スキャンしたPDFをOCRで編集可能なテキストに変換する方法

公開日:2026年9月1日 · 読了目安 4 分

コピーした用紙、撮影した印刷契約書、レシートなど、スキャンした文書は実際には画像がPDFに包まれているだけです。選択や検索ができるテキストレイヤーは存在しません。光学文字認識(OCR)はピクセルを読み取って実際のテキストを再構築します。このツールは成熟したオープンソースOCRエンジンであるTesseractを使用し、WebAssembly経由で完全にクライアント側で実行され、25言語分の学習済みデータを自前でホストしています。

OCR PDFを試す

手順

  1. 1

    OCR PDFツールを開く

    PDF用OCRツールにアクセスします。

  2. 2

    スキャン済みPDFをアップロード

    テキストを抽出したいPDF(または画像)を選択します。

  3. 3

    文書の言語とオプションを選択

    文書が書かれている言語、OCRを実行するページ、そして文書のレイアウトが特殊な場合(疎らなフォームなど)はセグメンテーションモードを選びます。

  4. 4

    OCRを実行

    ツールは各ページをレンダリングしてテキストを認識します。OCRは単純なテキスト抽出より本質的に処理が重いため、1ページあたり数秒かかります。

  5. 5

    テキストをコピーまたはダウンロード

    抽出されたテキストを確認し、コピーするか、プレーンな.txtファイルとしてダウンロードします。

よくある質問

OCRモデルとエンジンが自前でホストされ、Web Worker内で実行されるため、サードパーティのOCR APIにアップロードしたくない機密性の高いスキャン文書でも利用できます。

← ブログに戻る