スキャン PDF に OCR をかけて検索・コピーできるようにする方法
2026-09-14
スキャン PDF は写真の束です。OCR(光学文字認識)なしでは検索もコピーも引用もできません。OCR は画像内の文字の形状を読み取り、上に見えない本物のテキスト層を重ねます。
手順 1:まず手持ちのものを確認
ファイルを開いて単語を選択してみてください。カーソルが文字をつかめれば、その PDF には既にテキスト層があり、OCR は不要です。写真を囲む選択枠しか出なければスキャンであり、OCR が正解です。
手順 2:OCR ツールで言語を選ぶ
OCR ツールを開き、スキャンを投入して文書の言語を選びます。言語データは重要で、英語モデルで日本語スキャンを処理しても「自信満々のデタラメ」が出来上がるだけです。認識は端末上で実行されるため、スキャンした契約書がどこかへアップロードされることはありません。
手順 3:元画像と照合する
OCR は確率エンジンであってタイピストではありません。特に重要な書類では、氏名・数値・金額をページ画像と突き合わせて抽查してください。きれいな印刷物の正面スキャンはほぼ完璧に近く、コントラストの低いレシートや手書きメモはそうはいきません。
精度を高めるポイント
- 解像度を上げる:300 DPI が最適点。150 DPI 未満では精度が急落します。
- ページを真っ直ぐに:斜めスキャンは OCR の前に回転補正を。
- 1 パス 1 言語:バイリンガル文書は混合モデル 1 回より、単一言語 2 回の方がうまくいきます。
OCR 後に得られるもの
出力は、どのリーダーでも検索できる検索可能 PDF、または好きなところに貼れるプレーンテキストです。数百ページから「請求書 1042」を検索できるのは、テキスト層が存在するからこそ。それこそが OCR の全意味です。