PDF 伪造文件出人意料地罕见(2022年)
摘要
这篇博客文章分析了在互联网欺诈中,尽管PDF编辑相对容易,但PDF伪造文件却出人意料地罕见,并探讨了诸如验证实践以及流通的多为新文件而非篡改文件等原因。
暂无内容
查看缓存全文
缓存时间: 2026/09/22 06:48
# PDF伪造现象竟如此罕见
来源:https://gwern.net/blog/2022/pdf-forgery
有一类欺诈行为在网络上几乎销声匿迹:即篡改或伪造的PDF文件(https://en.wikipedia.org/wiki/PDF)。人们时常制作恶意视频、图片、聊天记录和Word文档来实施诈骗、散播宣传,甚至会发布整套充满谬误科学的PDF文档——但他们几乎不会去编辑已有的PDF文件。
偶尔有人质疑我托管在Gwern.net上的论文时会说:"但这不在正规期刊网站上!没经过同行评审!这只是某个随机人士的个人网站!根本不可信!"除了对人们不理解"文件可以存在于多处"感到困惑外(他们难道不懂"文件"的概念?显然许多年轻人确实难以理解,或者他们过度遵守版权法,连复制一份PDF都难以想象?),更有趣的是这种质疑为何如此奏效。
网络上确实充斥着无能、欺诈与恶意内容,其中常涉及PDF文档...但都是"新建"的PDF。我从未见过通过编辑真实PDF文件来实施欺诈的案例——无论是上传到Google Scholar等平台,或是我自己因文档标注错误而受骗的情况。
你只需搜索论文标题下载即可,几乎百分百能得到预期文件。唯一的注意事项是可能下载的是作者草稿或预印本(尤其在经济学领域,论文可能经历多次预印,有时结果会大幅修改,最终发表可能耗时十年)。即便遇到声称"运用统计学证明特朗普赢得2020年美国大选"等恶意内容的PDF,也必然是明确标注为新发布的"白皮书"之类的"新建"文档,不会伪装成已发表论文。如果是伪造或编辑过的文档,通常能明显看出是从Microsoft Word等文字处理器导出的(例如因时代错位使用Calibri字体而被揭穿的(https://en.wikipedia.org/wiki/Calibri#In_crime_and_politics)各类伪造文件(https://en.wikipedia.org/wiki/Calibri_font))。
相比之下,若以同样轻率的态度对待Facebook等平台上的图片,你就会收集到一整套经过PS处理、被误标、或"深度伪造"(https://en.wikipedia.org/wiki/Deepfake)的虚假图像。
PDF伪造之所以罕见令人费解,毕竟操作如此简单:找一篇有用的研究论文,用任意PDF工具编辑,上传到任何平台,等待他人复制传播(这很常见),然后删除你的原始文件——至此,一份权威的同行评审论文便与你毫无关联地在网络流传,堪称完美犯罪。(更隐蔽的做法是:直接上传到Libgen(https://en.wikipedia.org/wiki/Libgen)/Sci-Hub(https://en.wikipedia.org/wiki/Sci-Hub)等平台,让众人自发传播。)
考虑到(https://gwern.net/leprechaun#citogenesis-how-often-do-researchers-not-read-the-papers-they-cite)人们极少核实原始论文,像韦克菲尔德自闭症/疫苗研究等被撤稿论文,或丹佛行动(https://en.wikipedia.org/wiki/Operation_Denver)这类明显宣传文件,会在认知懈怠的人群中长期传播,只要伪造痕迹不太明显,假论文就能流传许久而不被发现。(在少数PDF遭篡改的案例中,往往迅速陷入技术泥潭和各执一词的争论,证实篡改所需的努力比实施篡改高出数个量级——参考克雷格·赖特案(https://en.wikipedia.org/wiki/Craig_Steven_Wright)专家们经历的周折,甚至仅房东篡改合同(https://gwern.net/doc/www/mjg59.dreamwidth.org/cd49bc29f497469d4ccc576d9241013d3dd7ecdb.html)这样的事件,而该合同竟通过了数字文档时间戳服务认证!)
这并非因为缺乏狂热分子或恶意行为者——历史上抄经员篡改文献的情况屡见不鲜!("孔子所作"或"闲话休提,现在我约瑟夫斯将向诸位阐明基督耶稣的伟大之处(https://en.wikipedia.org/wiki/Josephus_on_Jesus#The_Testimonium_Flavianum)"...)
究竟为何我们能放心下载各种随机网站(比如我的网站)上的PDF?
或许因为PDF缺乏像Photoshop那样的编辑工具?像arXiv(https://en.wikipedia.org/wiki/ArXiv)等平台提供TeX源文件,但这对大多数潜在伪造者、狂热分子和诈骗犯而言仍是高深技艺。PDF编辑虽非不可能,但并非多数人的常规工作流程:连孩童都会为社交媒体编辑照片,但除大型企业与设计师外,PDF严格属于"只写"格式——文档系统将源文件编译为PDF后,人们便不再修改PDF本身,只编辑源文件。(这类似于程序的编译后二进制文件:PDF专注像素级呈现打印文档的视觉效果,可能不包含原始文本,更不用说结构信息。如同有黑客专攻计算机原始二进制代码的解析与修改,也有专精PDF编辑的人才...但数量极少。)
这已足够将恶意行为者推向其他途径。毕竟,若编辑照片如此奏效,何必费力攻克更复杂的PDF编辑?
正如玩笑所言:PDF不需要跑赢熊(俄罗斯的?),只需跑赢其他格式即可。
## 相关链接(https://gwern.net/blog/2022/pdf-forgery#similars-section)
[\[主题相似链接\]](https://gwern.net/metadata/annotation/similar/%252Fblog%252F2022%252Fpdf-forgery.html)
相似文章
在Pixel 10上伪造C2PA
本文展示了如何使用Google Pixel 10 Pro伪造C2PA元数据来创建经过认证的伪造照片,尽管有有效的密码学签名,但暴露了内容真实性标准的漏洞。
我标记了两篇有虚假作者的研究论文,结果都被接收为口头报告
一位审稿人讲述自己标记了两篇作者捏造但被接收为口头报告的论文,并报告称在其审阅的22篇投稿中,68%存在捏造引用、LLM生成内容或虚假作者列表。多项研究证实,仅2025年就有数万篇此类论文,且同行评审中AI生成的内容越来越多。
PDF 的测试
作者描述了为其简历 PDF 构建测试套件,以确保它能被申请人追踪系统解析,并通过实验检查禁用连字是否影响 pdftotext 的输出。
如果你的PDF提取器返回的是空字符串,那文件可能并没有损坏。
一位开发者描述了构建PDF分类工具的过程,该工具通过检查PDF结构来判断其包含文本层还是由扫描图像组成,从而避免静默的空提取失败,并分享了关于虚假文本检测和幻影表格的陷阱。
@CycleDecoded: 白嫖党狂喜!谁还在傻乎乎掏钱充那些野鸡 PDF 网站的会员?GitHub 上刚刷到一个离谱项目,直接把这门生意给掀了。 这玩意叫 PDFCraft,是个纯纯的开源大杀器。直接在网页里塞了 90 多个专业 PDF 工具。最狠的是它完全本地跑…
PDFCraft 是一个开源 PDF 工具集,提供 90 多种功能,完全在浏览器内本地运行,不上传任何文件,保证数据安全且免费使用。