PDFのOCR(文字認識)

PDFのOCRは、スキャンされたPDFページに対してブラウザ内で直接、光学的文字認識を実行する無料ツールです。言語を選ぶと、結果をプレーンテキスト(TXT)または検索可能なPDFとして保存できます。言語モデルは最初に一度だけダウンロードしてキャッシュされ、書類が端末を離れることはありません。

PDFerretのマスコット:働く準備ができた白いフェレット

PDFファイルをここにドロップ、またはクリックして選択

ファイルは巣穴の中:すべて端末上で処理され、アップロードされません。

使い方

  1. 1スキャンPDFをツールにドロップ。
  2. 2認識言語を1つ以上選び、スキャン解像度(150または300 DPI)を設定します。
  3. 3出力を選択:テキストのみ、検索可能なPDF(ページ画像に不可視テキスト層を重ねたもの)、または両方。
  4. 4「認識開始」をクリックし、ページごとの進行状況を確認しながら完了後にダウンロード。

よくある質問

初回実行の開始が遅いのはなぜ?

認識用の言語モデルを一度ダウンロードする必要があるためです。1言語あたり約1〜3 MBです。最初のダウンロード後は端末にキャッシュされ、次回からすぐに始まります。

どんなスキャンPDFでも認識できますか?

いいえ、スキャン品質が結果を左右します。200 DPI以上で真っ直ぐ均一なページはよく認識されます。傾いたページ、暗い・不均一な照明、手書き、ノイズの多いスキャンは精度が下がります。スマホで撮影したページは、後から手動修正が必要になる前提でお使いください。

サーバー型OCRサービスと比べた精度は?

誠実で実用的なOCRですが、サーバー級の精度ではありません。対応言語のきれいな印刷テキストは高い精度で出ますが、表・多段組・数式・混在スクリプトではエラーが出ることがあります。検索可能なPDFはページ画像に不可視テキスト層を重ねるため、検索もコピーもでき、見た目は劣化しません。

関連ツール