FreePDF logoFreePDF

从 PDF 提取文字:扫描件也能处理

来自 FreePDF 团队 ·

从 PDF 里复制一段话,看起来应该很简单。麻烦在于,PDF 保存“文字”的方式其实有两种:普通电子版 PDF 里是真正可以选中的字符,扫描件里却只有一张张文字的图片。前一种能直接提取,后一种得先用 OCR 把图片里的字认出来。

把文字提取成 .txt 文件

  1. 打开 PDF 转文字工具,上传你的 PDF。
  2. 普通电子版 PDF 不用开启 OCR。如果文件是扫描件或照片,里面的字选不中,就再打开 OCR。
  3. 下载一个纯文本 .txt 文件,里面包含每一页提取出来的文字。

怎么判断要不要开 OCR

打开 PDF,试着选中一句话。如果能逐字高亮并复制,说明文件里已经有文字层,OCR 保持关闭就行。直接提取速度更快,也能原样拿到已有字符,不用让 OCR 重新猜一遍。

要是拖动鼠标时选中的是整张页面图片,或者什么都选不中,就打开 OCR。它会先从页面图片里识别文字,再生成文本文件。页面越清晰、端正、黑白分明,识别越准;模糊照片、手写字、褪色印刷和少见字体更容易出错。

纯文本、Word 和 Markdown 该选哪个

  • 纯文本—— 适合只要文字的情况:全文搜索、粘贴到其他应用、交给脚本处理,或者整理后喂给 AI。它会主动舍掉字体、图片、分栏和表格。
  • Word—— 更适合继续编辑文档,同时尽量保留原来的页面排版。
  • Markdown—— 介于两者之间。文件仍然是容易打开的纯文本,但会保留标题、列表、链接和简单表格这类轻量结构。

为什么提取出来的文字有时不太整齐

PDF 的强项是把内容准确摆在页面坐标上,并不一定会记录文章该按什么顺序读。所以双栏报告里的两列文字可能交错在一起,页眉可能插进段落中间,印刷版上的每一行也可能单独换行。纯文本没法复刻页面版式;结构很重要时,转成 Word 或 Markdown 往往更合适。

常见问题

能不能只提取其中几页的文字?

可以。先把需要的页面拆分或提取成一个较小的 PDF,再用 PDF 转文字处理。最后得到的文本文件就只包含这些页面,也更方便整理。

提取文字会改动原来的 PDF 吗?

不会。工具只会读取 PDF,另外生成一个 .txt 文件供你下载。它不会编辑或覆盖原文件,也不会往原 PDF 里添加 OCR 文字层。

相关免费工具