検索可能PDFを作る

検索可能PDFは、tesseract.jsでOCRを端末上で実行し、各ページを認識した単語に合わせた不可視テキスト層付きの画像として再構築します。結果はどのPDFビューアでも検索・コピーできます。無料・アップロード不要、言語モデルのキャッシュ後はオフラインで動作します。

PDFerretのマスコット:働く準備ができた白いフェレット

スキャンPDFをドロップして検索可能なテキスト層を追加

ファイルは巣穴の中:すべて端末上で処理され、アップロードされません。

使い方

  1. 1スキャンPDFをドロップし、認識言語を選択。
  2. 2スキャン解像度を選択(150は高速、300は高精度)。
  3. 3「認識」をクリック。ページは端末上で1枚ずつ処理されます。
  4. 4検索可能PDFをダウンロードし、ビューアで単語を検索してみてください。

よくある質問

テキスト層は画像と完全に揃いますか?

位置合わせは認識された単語に基づくため、きれいなスキャンでは数ピクセル以内に収まります。歪んだページ・装飾フォント・低解像度では、ハイライトが見える文字からずれることがあります。検索とコピーは引き続き機能し、視覚的な一致は真っ直ぐで鮮明なスキャンで最も良くなります。

ファイルサイズが大きくなるのはなぜですか?

各ページはラスタライズ画像としてテキスト層とともに保存されます。どこにも送らずにスキャンを検索可能にする以上、避けられない代償です。サイズが気になる場合は、後で圧縮ツールにかけてください。

元からテキストがあるページは保持されますか?

いいえ。処理したページは画像+不可視テキストとして再構築されるため、そのページの元のテキスト層は認識結果に置き換えられます。PDFが既に選択可能なテキストを持っているなら、このツールは不要です。

関連ツール