PDF 轉文字:把內容擷取成 .txt 檔案
由 FreePDF 團隊撰寫 ·
想從 PDF 複製一段內容,看似只要選取、貼上就好,麻煩在於 PDF 裡的「字」不一定真的是文字。一般的數位 PDF 存的是可以選取的字元;掃描檔存的則是一張張頁面圖片,眼睛看起來有字,電腦看到的卻只是像素。前者可以直接擷取,後者才需要先用 OCR 讀出圖片裡的文字。
把 PDF 文字擷取成 .txt 檔案
- 開啟 PDF 轉文字工具,上傳你的 PDF。
- OCR 預設是關閉的。一般的數位 PDF 維持關閉即可;如果檔案是掃描或拍照而成,裡面的字完全選不起來,再把 OCR 打開。
- 下載另外建立的純文字
.txt檔,裡面會收錄每一頁擷取出的文字。
先用一個動作判斷要不要 OCR
打開 PDF,試著選取其中一句話。要是每個字都能反白、複製,代表檔案本來就有文字層,不必啟用 OCR。直接擷取速度更快,也能保留原本的字元,不用讓辨識程式再猜一次。
如果滑過句子時選中的是整張頁面,或怎麼拖都選不到東西,這才是該開啟 OCR 的時候。它會先辨識頁面圖片中的字,再建立文字檔。頁面愈清楚、擺得愈正、黑白對比愈明顯,結果通常愈準;模糊照片、手寫字、褪色印刷和特殊字型則比較容易出錯。
純文字、Word、Markdown 怎麼選
- 純文字最適合只需要內容的情況,例如搜尋文件、貼到其他 App、交給程式處理,或整理成 AI 工具的輸入。它會刻意捨棄字型、圖片、分欄和表格。
- Word 適合要繼續編輯,而且希望盡量保留原本版面的人。
- Markdown 則介於兩者之間:檔案仍是好讀的純文字,但能留下標題、清單、連結和簡單表格等輕量結構。
為什麼擷取後的文字偶爾像被打亂
PDF 擅長的是把內容精準放在頁面座標上,卻不一定有記錄文章該怎麼一路讀下去。因此,雙欄報告擷取後可能左右欄交錯,頁首突然插進段落中間,印刷品的每一行也可能在文字檔裡各自斷行。純文字本來就無法重現整張版面;如果這些結構很重要,改用 Word 或 Markdown 通常會省下更多整理時間。
常見問題
可以只擷取其中幾頁的文字嗎?
可以。先把需要的頁面分割或抽出成一份較小的 PDF,再交給 PDF 轉文字工具。下載的文字檔就只會包含那些頁面,後續也比較好整理。
擷取文字會改動原本的 PDF 嗎?
不會。工具只會讀取你上傳的 PDF,另外建立一個 .txt 檔供你下載;它不會編輯或覆寫來源 PDF,也不會把 OCR 文字層加回原檔。