PDF 伪造文件出人意料地罕见(2022年)

Hacker News Top 新闻

摘要

这篇博客文章分析了在互联网欺诈中,尽管PDF编辑相对容易,但PDF伪造文件却出人意料地罕见,并探讨了诸如验证实践以及流通的多为新文件而非篡改文件等原因。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/22 06:48

# PDF伪造现象竟如此罕见 来源:https://gwern.net/blog/2022/pdf-forgery 有一类欺诈行为在网络上几乎销声匿迹:即篡改或伪造的PDF文件(https://en.wikipedia.org/wiki/PDF)。人们时常制作恶意视频、图片、聊天记录和Word文档来实施诈骗、散播宣传,甚至会发布整套充满谬误科学的PDF文档——但他们几乎不会去编辑已有的PDF文件。 偶尔有人质疑我托管在Gwern.net上的论文时会说:"但这不在正规期刊网站上!没经过同行评审!这只是某个随机人士的个人网站!根本不可信!"除了对人们不理解"文件可以存在于多处"感到困惑外(他们难道不懂"文件"的概念?显然许多年轻人确实难以理解,或者他们过度遵守版权法,连复制一份PDF都难以想象?),更有趣的是这种质疑为何如此奏效。 网络上确实充斥着无能、欺诈与恶意内容,其中常涉及PDF文档...但都是"新建"的PDF。我从未见过通过编辑真实PDF文件来实施欺诈的案例——无论是上传到Google Scholar等平台,或是我自己因文档标注错误而受骗的情况。 你只需搜索论文标题下载即可,几乎百分百能得到预期文件。唯一的注意事项是可能下载的是作者草稿或预印本(尤其在经济学领域,论文可能经历多次预印,有时结果会大幅修改,最终发表可能耗时十年)。即便遇到声称"运用统计学证明特朗普赢得2020年美国大选"等恶意内容的PDF,也必然是明确标注为新发布的"白皮书"之类的"新建"文档,不会伪装成已发表论文。如果是伪造或编辑过的文档,通常能明显看出是从Microsoft Word等文字处理器导出的(例如因时代错位使用Calibri字体而被揭穿的(https://en.wikipedia.org/wiki/Calibri#In_crime_and_politics)各类伪造文件(https://en.wikipedia.org/wiki/Calibri_font))。 相比之下,若以同样轻率的态度对待Facebook等平台上的图片,你就会收集到一整套经过PS处理、被误标、或"深度伪造"(https://en.wikipedia.org/wiki/Deepfake)的虚假图像。 PDF伪造之所以罕见令人费解,毕竟操作如此简单:找一篇有用的研究论文,用任意PDF工具编辑,上传到任何平台,等待他人复制传播(这很常见),然后删除你的原始文件——至此,一份权威的同行评审论文便与你毫无关联地在网络流传,堪称完美犯罪。(更隐蔽的做法是:直接上传到Libgen(https://en.wikipedia.org/wiki/Libgen)/Sci-Hub(https://en.wikipedia.org/wiki/Sci-Hub)等平台,让众人自发传播。) 考虑到(https://gwern.net/leprechaun#citogenesis-how-often-do-researchers-not-read-the-papers-they-cite)人们极少核实原始论文,像韦克菲尔德自闭症/疫苗研究等被撤稿论文,或丹佛行动(https://en.wikipedia.org/wiki/Operation_Denver)这类明显宣传文件,会在认知懈怠的人群中长期传播,只要伪造痕迹不太明显,假论文就能流传许久而不被发现。(在少数PDF遭篡改的案例中,往往迅速陷入技术泥潭和各执一词的争论,证实篡改所需的努力比实施篡改高出数个量级——参考克雷格·赖特案(https://en.wikipedia.org/wiki/Craig_Steven_Wright)专家们经历的周折,甚至仅房东篡改合同(https://gwern.net/doc/www/mjg59.dreamwidth.org/cd49bc29f497469d4ccc576d9241013d3dd7ecdb.html)这样的事件,而该合同竟通过了数字文档时间戳服务认证!) 这并非因为缺乏狂热分子或恶意行为者——历史上抄经员篡改文献的情况屡见不鲜!("孔子所作"或"闲话休提,现在我约瑟夫斯将向诸位阐明基督耶稣的伟大之处(https://en.wikipedia.org/wiki/Josephus_on_Jesus#The_Testimonium_Flavianum)"...) 究竟为何我们能放心下载各种随机网站(比如我的网站)上的PDF? 或许因为PDF缺乏像Photoshop那样的编辑工具?像arXiv(https://en.wikipedia.org/wiki/ArXiv)等平台提供TeX源文件,但这对大多数潜在伪造者、狂热分子和诈骗犯而言仍是高深技艺。PDF编辑虽非不可能,但并非多数人的常规工作流程:连孩童都会为社交媒体编辑照片,但除大型企业与设计师外,PDF严格属于"只写"格式——文档系统将源文件编译为PDF后,人们便不再修改PDF本身,只编辑源文件。(这类似于程序的编译后二进制文件:PDF专注像素级呈现打印文档的视觉效果,可能不包含原始文本,更不用说结构信息。如同有黑客专攻计算机原始二进制代码的解析与修改,也有专精PDF编辑的人才...但数量极少。) 这已足够将恶意行为者推向其他途径。毕竟,若编辑照片如此奏效,何必费力攻克更复杂的PDF编辑? 正如玩笑所言:PDF不需要跑赢熊(俄罗斯的?),只需跑赢其他格式即可。 ## 相关链接(https://gwern.net/blog/2022/pdf-forgery#similars-section) [\[主题相似链接\]](https://gwern.net/metadata/annotation/similar/%252Fblog%252F2022%252Fpdf-forgery.html)

相似文章

在Pixel 10上伪造C2PA

Lobsters Hottest

本文展示了如何使用Google Pixel 10 Pro伪造C2PA元数据来创建经过认证的伪造照片,尽管有有效的密码学签名,但暴露了内容真实性标准的漏洞。

PDF 的测试

Lobsters Hottest

作者描述了为其简历 PDF 构建测试套件,以确保它能被申请人追踪系统解析,并通过实验检查禁用连字是否影响 pdftotext 的输出。