掃描 PDF 做 OCR:讓文字能搜尋、能複製
由 FreePDF 團隊撰寫 ·
掃描版 PDF 其實只是一張頁面的照片,存成了 .pdf 副檔名。 你搜尋不了它,沒辦法選一句話來複製,螢幕報讀軟體也讀不出來。 OCR(光學字元辨識)能解決這個問題:它讀出圖片裡的文字,再在幕後把文字加回去。
OCR 到底改變了什麼
掃描檔本身原封不動——一樣的版面、一樣的手寫字,連咖啡漬(如果有的話)都在。 加上去的是一層看不見、真實可選取的文字,正好疊在圖片中那些字的後面, 所以頁面看起來一模一樣,但現在它的行為就像一份正常的文件了。
執行 OCR
- 開啟 PDF OCR 文字辨識工具,上傳你的掃描檔。
- 每一頁的文字都會被辨識出來,在下方加上一層可搜尋的文字層。
- 下載可搜尋的 PDF。
什麼時候你真的需要它
- 要在一份長長的掃描合約或報告裡搜某一條條款,而不是逐頁去讀。
- 想從掃描檔裡複製一段文字,而不是用手一個字一個字重打。
- 讓一份老舊的掃描文件能被螢幕報讀軟體讀取。
- 為進一步轉換做準備——表格或文字擷取,只有在有真實文字可讀時才行得通。
拿到準確的結果
OCR 的準確度和掃描品質直接掛鉤:
- 清晰、擺正、光線充足的掃描,幾乎能完美辨識。
- 低解析度的照片、嚴重歪斜或手寫字,比較難可靠辨識—— 如果第一次結果看起來不對,就把文件放平、光線打足重掃一次。
- 它針對英文文字做了調校;其他語言可能會出現比較多錯誤。
常見問題
之後頁面看起來會不一樣嗎?
不會。原始圖片會原封不動保留——OCR 是在它後面加一層看不見的文字層, 而不是重畫或替換頁面。
之後可以把檔案轉成 Word 或 Excel 嗎?
可以,而且這往往就是重點——先跑 OCR,讓底下有真實的文字或表格資料, 再照常轉成 Word、Excel 或純文字。