PDF 转 PDF/A:转换过程中会被丢掉什么
来自 FreePDF 团队 ·
法院的电子立案系统、大学的论文提交入口,或者某份档案留存规定——总有一处会告诉你,文件必须是 PDF/A。这是一种为「三十年后被一个还没被写出来的软件打开」而设计的 PDF,意味着这一页渲染所需要的一切,都得装在文件里面。转换只有一步,但它到底改了你文档的什么,值得花两分钟弄清楚。
转换到底做了什么
有三件事会变,而它们都在做同一件事:切断这份文件对打开它的那台机器的依赖。
- 所有字体被嵌进去。普通 PDF 可以只写一句「这里用 Arial」,然后指望你的电脑自己有。PDF/A 不允许,于是字形轮廓被整个复制进文档。这就是输出比输入大的主要原因。
- 颜色被钉死。颜色会被转换到与设备无关的色彩空间,于是某个红色是被绝对定义的,而不是交给屏幕或打印机自己去理解。
- 一切伸手到文件外面的东西都被拿掉。JavaScript、内嵌的音频视频、指向磁盘上其他文件的链接,以及加密,都是这个标准明令禁止的。
输出的是 PDF/A-2b。2 是 ISO 标准的版本号,b 是符合性级别——基本级,意思是这份文件保证以后看起来还是这个样子。把「看起来」这三个字记住,下面还要用到。
合规优先于保真
转换器碰到 PDF/A 不允许的东西时只有两条路:留着这个特性、给你一份通不过校验的文件,或者丢掉它、给你一份能通过的。我们选丢掉。你拿到的是一份能过校验的文件——而这恰恰就是当初有人要求 PDF/A 的全部意义。
大多数文档不会损失什么,因为大多数文档就是文字和图片。如果你的文件里有这些,转完打开确认一下:
- 挂了脚本的表单域,它们会不再可交互
- 内嵌的多媒体,是被移除而不是被转换
- 指向 PDF 旁边那些配套文件的链接,这些留不下来
加了密码的 PDF 是另一回事。标准直接禁止加密,所以这类文件得先解锁,否则根本进不了转换这一步。
基本级不等于能搜
这一点被误会的次数够多,值得把话说明白。PDF/A-2b 保证的是这一页看起来没问题,它对「这一页背后有没有真正的文字」只字未提。
拿一份扫描件跑一遍,你会得到一个完全合规的归档 PDF,而它的每一页仍然是纸的照片。选不中,搜不到,校验工具却会愉快地放行。如果你的档案真正需要的是能被检索的文字,那就先给扫描件做 OCR、再转换,顺序不能反——转 PDF/A 不会凭空生出文字层,而转完之后再跑 OCR,等于把你刚弄合规的文件又重写了一遍。
常见问题
为什么转出来的 PDF/A 比原文件大?
几乎总是因为嵌了字体。用两三种字体排的文档可能会涨几百 KB,而用了中日韩字体的文件可能涨好几 MB,因为整套字符集都得跟着走。这份重量正是归档在干它该干的事。转完再压缩当然可以,但等于白做:压缩会重写文件,你得重新校验一遍。真要压就先压再转。
我编辑过之后,它还算 PDF/A 吗?
当没有比较稳妥。加个签名、填个表单,或者用一个不认识 PDF/A 的编辑器另存一次,都可能悄悄把标准禁止的东西塞回去,而文件仍然顶着 PDF/A 的名头,只是已经不符合了。把转换当成归档或提交前的最后一步,而不是中间的某一环。