PDF 涂黑:让被涂掉的字真的消失
来自 FreePDF 团队 ·
泄密的经典姿势,就是在敏感内容上画几个黑方块,然后把 PDF 发出去。那个黑方块只是浮在页面上的一个图形,文字还在下面,还能选中,还能被搜索到——谁把光标从黑条上拖过去一粘贴,你想藏的名字就出来了。真正的涂黑必须把文字销毁,而不是盖住。
不是画上去,是把词打出来
上传 PDF,输入要去掉的内容:一个姓名、一个账号、一条街道。工具会在全文里找出每一处,涂黑,并把页面重建一遍,那些词就不在文件里了。你不必再去找第 31 页上第十四次出现的那个词。
关于匹配规则有几点要知道,它们会影响你该怎么输入:
- 多个词用逗号分开。一条可以是好几个词,所以
John Smith能整个命中,前提是它落在同一行里。要是某个名字正好被断到两行,就把两半拆成两条分别填。 - 不分大小写。 输入
confidential也会命中 CONFIDENTIAL 和 Confidential。 - 部分匹配也算。
2024会连2024-06-15一起涂掉,smith会把Smithson也涂掉。多数时候这是好事,但词太短、太常见时记得检查结果。
如果输入的词一个都没出现,任务会直接报错停下,而不是给你一个看着像涂过、其实没动过的文件。
拿回来的文档会变成图片
这就是让涂黑成真的那个代价。工具不是去删字符、再祈祷文件里没有别处还引用着它们,而是把每一页渲染成图,再把黑框画在像素上。任何一页都不再留有可恢复的文字层。
你要付出的:
- 搜索和选中都失效了。 Ctrl+F 找不到东西,段落也复制不出来。
- 文件通常会变大,有时大不少,因为整页图片比文字占地方。要发邮件的话,之后再压缩一次。
- 文档属性不会保留。 输出是新建的 PDF,原来的标题、作者等元数据都没了。对一份马上要交出去的文档来说,这通常正合适。
发出去之前先自己验一遍
每次两秒钟的事。打开涂黑后的文件,按 Ctrl+F,搜你刚去掉的那个词。再试着选中黑框下面的文字。搜不到、也选不中,才叫涂干净了。
另外还有一件事值得单独想想:剩下的内容能不能把被涂掉的东西推出来。一份文档里名字涂黑了,别处却留着发件人的邮箱地址,那就等于没保护。把周围几句当成对方在推理来读一遍。
之后想把搜索找回来
如果涂黑后的文档还得能搜,做完再跑一次 OCR。它读的是页面图像,根据可见内容重新生成一层文字,所以你去掉的词不会因此回来。顺序别搞反:先涂黑,再 OCR。
常见问题
要涂的字在扫描件里怎么办?
扫描件里没有文字可找,所以什么都匹配不上。先给扫描件做 OCR 加一层文字,再涂黑,需要搜索的话最后再 OCR 一次。结果要仔细检查:OCR 认错一个字符,那一处就匹配不到,还会明晃晃地留在页面上。
能按区域涂黑,而不是按词吗?
这个工具做不到,它是按你输入的词工作的。如果目的是按位置去掉页眉、页脚或者签名区,裁剪页边距更合适——但记住裁剪只是把内容藏起来,并没有删掉。要求内容真的消失,就从那个区域里挑一个词放进涂黑列表。