为什么 PDF 上的黑框会泄密
在 PDF 上添加黑色矩形可能只改变显示效果,并未移除底层文字。仍存在的文字有时可被复制、搜索或由解析器提取。OCR 读取的是图像中可见的文字,不能用来证明黑框下的内容已经移除。
真实翻车案例
Paul Manafort 的律师在法院文件里用黑框遮盖敏感段落,记者复制粘贴就读出了被「遮盖」的内容。
此类案例说明,文件看起来被遮住,并不能单独证明敏感内容已经从输出中移除。
为什么会这样
图形软件里的「画矩形」只是往页面上加一个不透明形状,它不会删除下方的任何东西。文字、图像、矢量路径全都还在文件里。
应检查工具实际修改了什么,以及下载的成品中还保留了什么,不能只凭按钮名称判断。
什么才是真脱敏
PrivScrub 将导出的每一页重新生成为图片,并写入全新的 PDF;框选区域的遮盖会写入像素,不会复制原始页面或资源。成品会重新读取并执行列出的检查,但不运行 OCR。
未框选区域保留可见外观,但所有页面都会失去可搜索文字和文字无障碍信息,需要逐页目视复核。
别忘了同时清除文档元数据(作者、创建时间等),否则身份信息仍会泄露。
PrivScrub 当前 PDF 支持范围
PDF 编辑支持最多 50 页、25 MiB 的基础未加密文件。非空批注、内部或外部链接、表单、附件、动作及图层不受支持,会在导出前停止处理。脱敏会将每一页重新生成为图片,所有页面都失去可搜索文字和文字无障碍信息。元数据清理保留受支持的页面内容。成品检查重新读取实际文件,只覆盖所列项目,不运行 OCR。请逐页目视复核实际成品。
常见问题
我把黑框设成不透明黑色还不够吗?
不够。不透明只影响显示,底层文字对象依然存在于文件里,能被复制和提取。
怎么验证我的脱敏真的生效了?
检查实际下载文件的文字、元数据、页面与范围说明,并逐页目视检查。检查器只在可提取文字和支持的 Info 值中搜索你输入的目标文字,并报告 XMP 是否存在;没有搜索结果不代表图片中没有遗漏。