如何 OCR 掃描版 PDF,讓它可搜尋、可複製

2026-09-14

掃描版 PDF 本質是一疊照片。沒有 OCR(光學字元辨識),你不能搜尋、不能複製、不能引用。OCR 會讀出圖片裡的文字形狀,在上方加一層看不見的真文字。

第一步:先確認你手上的東西

打開檔案試著選取一個字。如果游標抓得到文字,表示 PDF 已有文字層,不需要 OCR。如果只能框選到一張圖片,那就是掃描件,走 OCR 就對了。

第二步:跑 OCR 工具並選語言

開啟 OCR 工具,丟入掃描件,選文件語言。語言資料很重要:拿英文模型去辨識日文,只會產生「很有自信的胡說八道」。辨識在你的裝置上執行,掃描的合約完全不需要上傳到任何地方。

第三步:對照原圖驗收

OCR 是機率引擎,不是打字員。抽查姓名、數字、金額是否與頁面圖片一致,尤其重要的文件。乾淨印刷品的正向掃描通常近乎完美;低對比的收據和手寫筆記就不會。

提升準確度的方法

  • 掃描解析度高一點:300 DPI 是甜蜜點,低於 150 DPI 準確度會快速崩落。
  • 頁面擺正:歪的掃描先轉正再 OCR。
  • 一次一種語言:雙語文件跑兩輪,比混合模型一輪好。

OCR 之後:你會得到什麼

產出是可用任何閱讀器搜尋的可搜尋 PDF,或能貼到任何地方的红文字。能在幾百頁裡搜「發票 1042」的前提就是文字層存在——這就是 OCR 的全部意義。

全部文章