PDF 光學字元辨識(OCR)

PDF 光學字元辨識(OCR)是免費工具,直接在瀏覽器裡辨識掃描 PDF 的文字。自選語言,結果可存成純文字 TXT 或可搜尋 PDF。語言模型只需下載一次並快取,文件全程不離開你的裝置。

PDFerret 吉祥物:準備上工的白貂

把 PDF 檔拖到這裡,或點擊瀏覽

檔案留在你的巢:全都在你的裝置上處理,絕不上傳。

使用方式

  1. 1把掃描 PDF 拖進工具。
  2. 2選一或多種辨識語言,以及掃描解析度(150 或 300 DPI)。
  3. 3選輸出:純文字、可搜尋 PDF(頁面圖片加上透明文字層),或兩者都要。
  4. 4按「開始辨識」,看逐頁進度跑完後下載結果。

常見問題

第一次執行為什麼要等比較久?

辨識用的語言模型需要下載一次,每個語言約 1 到 3 MB。下載完成後會快取在你的裝置上,之後再跑就會直接開始。

所有掃描 PDF 都辨識得出来嗎?

不行,掃描品質决定成敗。200 DPI 以上、擺正、光線均匀的頁面效果好;歪斜、太暗、手寫或雜訊多的掃描件正確率會下降。手機拍照的頁面,請預期事後需要人工修正。

和伺服器級 OCR 服務比起來準確度如何?

這是誠實可用的 OCR,但不是伺服器級精度。乾淨的印刷文字通常相當準確;表格、多欄版面、數學式與混合語言則可能出錯。可搜尋 PDF 會保留頁面圖片並叠上透明文字層,搜尋與複製都可用,外觀也不會變差。

相關工具