从 PDF 提取文字:扫描件也能处理
来自 FreePDF 团队 ·
从 PDF 里复制一段话,看起来应该很简单。麻烦在于,PDF 保存“文字”的方式其实有两种:普通电子版 PDF 里是真正可以选中的字符,扫描件里却只有一张张文字的图片。前一种能直接提取,后一种得先用 OCR 把图片里的字认出来。
把文字提取成 .txt 文件
- 打开 PDF 转文字工具,上传你的 PDF。
- 普通电子版 PDF 不用开启 OCR。如果文件是扫描件或照片,里面的字选不中,就再打开 OCR。
- 下载一个纯文本
.txt文件,里面包含每一页提取出来的文字。
怎么判断要不要开 OCR
打开 PDF,试着选中一句话。如果能逐字高亮并复制,说明文件里已经有文字层,OCR 保持关闭就行。直接提取速度更快,也能原样拿到已有字符,不用让 OCR 重新猜一遍。
要是拖动鼠标时选中的是整张页面图片,或者什么都选不中,就打开 OCR。它会先从页面图片里识别文字,再生成文本文件。页面越清晰、端正、黑白分明,识别越准;模糊照片、手写字、褪色印刷和少见字体更容易出错。
纯文本、Word 和 Markdown 该选哪个
- 纯文本—— 适合只要文字的情况:全文搜索、粘贴到其他应用、交给脚本处理,或者整理后喂给 AI。它会主动舍掉字体、图片、分栏和表格。
- Word—— 更适合继续编辑文档,同时尽量保留原来的页面排版。
- Markdown—— 介于两者之间。文件仍然是容易打开的纯文本,但会保留标题、列表、链接和简单表格这类轻量结构。
为什么提取出来的文字有时不太整齐
PDF 的强项是把内容准确摆在页面坐标上,并不一定会记录文章该按什么顺序读。所以双栏报告里的两列文字可能交错在一起,页眉可能插进段落中间,印刷版上的每一行也可能单独换行。纯文本没法复刻页面版式;结构很重要时,转成 Word 或 Markdown 往往更合适。
常见问题
能不能只提取其中几页的文字?
可以。先把需要的页面拆分或提取成一个较小的 PDF,再用 PDF 转文字处理。最后得到的文本文件就只包含这些页面,也更方便整理。
提取文字会改动原来的 PDF 吗?
不会。工具只会读取 PDF,另外生成一个 .txt 文件供你下载。它不会编辑或覆盖原文件,也不会往原 PDF 里添加 OCR 文字层。