Pangram已成为AI检测的黄金标准。你是否应该信任它?
摘要
本文探讨了Pangram,一家检测AI生成文本的AI初创公司,它在出版丑闻中的角色,以及对其检测模型可信度的质疑。
认识一下AI警察,他们能在出版界乃至更广泛领域决定职业生涯的成败。
查看缓存全文
缓存时间: 2026/09/02 11:45
# Pangram 已成为 AI 检测领域的黄金标准。你该信任它吗?
来源:https://www.wired.com/story/pangram-has-emerged-as-the-gold-standard-of-ai-detection/
认识一下那些可能决定出版业乃至更广泛领域职业生涯的“AI 警察”。
两只发光的手举着黄色警示带,中间另有一只手用羽毛笔在手稿上书写。
照片插图:WIRED 团队;GETTY IMAGES
Pangram 是一家拥有 24 名员工的 AI 初创公司,总部位于布鲁克林一家 Popeyes 炸鸡店楼上。截至目前,该公司已融资 1300 万美元——大约是 OpenAI 融资额的 0.0072%——在年初之前几乎无人知晓。但如果 Pangram 所言属实,它正是阻挡机器全面接管文字世界的唯一力量。
Pangram 承诺检测任何给定文本(https://www.wired.com/story/confessions-viral-ai-writer-chatgpt/)在生成过程中涉及了多少 AI,并且它以最佳猜测百分比的形式呈现(当然,也是通过 AI)。一月份,Reddit 和 YouTube 上有传言称作家米娅·巴拉德(Mia Ballard)可能使用 AI 撰写了*《害羞女孩》*,这本自出版小说被阿歇特出版社选中进行传统出版。尽管巴拉德予以否认,但 Pangram 的首席执行官在 X 上发帖称,该书有 78% 的内容是 AI 生成的。阿歇特随后取消了该书的发行。
随后爆发了大量类似指控。《纽约时报》因其“现代爱情”专栏(https://www.nytimes.com/2025/11/21/style/modern-love-unfit-to-be-a-mother.html)刊登了 AI 生成的一期而被曝光。Pangram 评分:100%。接着是英联邦短篇小说奖的一位获奖作品(100%),小说*《匕首之口》*(60%),以及一本以 240 万美元售出的惊悚小说*《叫我,我会藏好尸体》*(97%)。七月下旬,Substack 宣布将 Pangram 整合到其平台,以便读者快速判断文本是否可能使用了 AI。
并非所有作家都认为这是好事。“人们对这种 AI 检测软件极其反感和愤怒,”作家兼出版专家简·弗里德曼(Jane Friedman)说。“感觉它们即使不比 AI 公司本身更邪恶,也是一样邪恶。”除了出版和高等教育领域,Pangram 并非家喻户晓的名字,但我怀疑它即将变得广为人知;区分大型语言模型批量生产的内容与人类原创写作的需求与日俱增。现在要问的问题是:这家公司能在多大程度上被信任?
Pangram 30 岁的联合创始人兼首席执行官马克斯·斯佩罗(Max Spero)在谷歌 Meet 上用手机接入我们的会议,一手拿着外卖盒,背景是摩天大楼。他穿着米色 T 恤,深色短发,表情年轻,笑容灿烂。他说自己正带着午餐赶回家,稍后会再打来。十分钟后,斯佩罗出现在他在布鲁克林的公寓里。他说整个上午都在进行招聘电话。七月份,Pangram 融资 900 万美元,并宣布推出其最新模型 Pangram 4。公司网站列出了六个新职位空缺,这将使其员工人数增加 25%。
我问斯佩罗在加利福尼亚长大的经历,这个轻松的问题却让他明显感到不适。对他而言,讨论 Pangram 技术的细微之处比回答个人问题——或谈论公司在文学丑闻中的参与——要自然得多。斯佩罗吃了一口饭,说他在洛杉矶郊区的拉克雷森塔(La Crescenta)长大。他热爱编程,并加入了学校的机器人团队。在斯坦福大学读本科时,他遇到了未来的 Pangram 联合创始人布拉德利·埃米(Bradley Emi)。(我多次通过邮件请求采访埃米,但被公司公关团队忽略。)毕业后,斯佩罗去了谷歌,在那里参与开发了 FLoC,这是一项旨在通过根据兴趣对 Chrome 用户进行分组来取代第三方 cookie 的技术。(谷歌在 2022 年因隐私担忧而终止了 FLoC。)斯佩罗后来在自动驾驶汽车公司 Nuro 工作,而埃米则先后在特斯拉和 AI 生物技术公司 Absci 工作。2022 年 ChatGPT 推出后,两人看到了一个应对 AI 内容泛滥未来的商业机会。2023 年,他们创立了 Checkfor.ai,一年后将公司更名为 Pangram。那时,至少十几家其他公司已挤入检测领域,包括 Originality.ai、GPTZero 和 Turnitin;Pangram 在一些早期的独立测试中表现良好,并成为领跑者之一。
随着采访的进行,斯佩罗的回答显得断断续续,停停走走,这不仅是因为他在吃饭。我问起他的招聘理念。斯佩罗嘟囔了一声“嗯”,然后毫无歉意地转身去微波炉热他的食物。漫长的十五秒钟在沉默中过去。他终于再次面对我说道:“在 Pangram 的普通人之所以在这里,是因为他们关心这个使命。”
为了检测 AI,Pangram 使用一种名为“合成镜像”的方法,即获取人类写作内容,然后让大型语言模型生成一个近似的版本。这教会其模型 AI 是如何写作的。Pangram 还使用“困难负样本挖掘”,在数据集中搜索可以合成镜像并用于增强其训练集的假阳性案例——利用错误来重新训练机器。“我们所有的数据集都获得了适当的许可,我认为这在当今 AI 世界中相当罕见,”斯佩罗说,尽管这部分是因为 Pangram 的产品对数据的需求远不如 ChatGPT 或 Claude。“我不想完全把 AI 公司推入深渊,”他补充道,“但我认为他们已经失去了很多信任,尤其是在创意工作者的世界。”如今,Pangram 服务于多个行业,包括教育、法律领域和招聘,但创意写作构成了训练文本的最大部分。
*《害羞女孩》*事件让 Pangram 声名鹊起。斯佩罗之前就一直从他的社交账号上指出可疑的 AI 写作,因此,当一月份他在一个 Reddit 帖子中被艾特,并随后收到巴拉德手稿的 PDF 时,这并不令人意外。“我把它放入 [Pangram],发布了它,然后《纽约时报》请我发表评论(https://www.nytimes.com/2026/03/19/books/ai-fiction-shy-girl.html),”他说。“我认为人们夸大了 Pangram 在*《害羞女孩》*事件中的重要性。”但这并非完全属实。就像 AI 丑闻电话游戏一样,是 Pangram 的一位客户执行官与一位出版业分析师讨论了此事,后者又将其带给了《纽约时报》。
另一个转折是:Pangram 的批评者,包括调查项目*《德雷档案》*(https://www.youtube.com/watch?v=tv_3L_1avKM),指出斯佩罗获得手稿副本的来源是一个盗版网站。当我问及此事时,他说:“是的。而且,嗯,是的……事实就是如此。我当时没有仔细看。我没有通读整个 PDF。我只是直接把它放进了 Pangram。”
此后,Pangram 并没有完全回避争议。在英联邦短篇小说奖获奖作品获得高 Pangram 评分后,该公司分析了自 2012 年以来的每一篇获奖作品(https://www.pangram.com/blog/ai-is-writing-prize-winning-fiction),又指出了另外三篇可能使用了 AI 的作品。尽管如此,斯佩罗淡化了 Pangram 的影响,尤其是在被取消的图书交易方面。“基本上,据我所知,每一笔图书交易,都并非真的因为 Pangram 的评分,”他说。“那只是其中一部分,但如果你和任何相关人员交谈,这只是整个大局中很小、很小的一部分。”
我们转向 Pangram 与 Substack 的整合。“人们不应该害怕披露此事,因为你的作品应该凭其自身的质量以及人们想读而立得住脚,不管……”斯佩罗的声音逐渐弱了下去。“嗯,我想怎么说呢?”他停顿了一下。“我想我……哦,我想起来了我那天说的话。”他恢复了信心,语速加快。“如果你作品的价值取决于欺骗最终用户,让他们认为这不是 AI 写的,那么”——他又犹豫了一下——“这将是个问题。”(后来我意识到他的语调变化是因为他正在引用自己在 X 上的帖子(https://x.com/max_spero_/status/2087648625455157420)。)
Substack 未确认其与 Pangram 合作结构的任何细节,也未确认 Substack 是否按扫描次数向该公司付费。“Substack 的理念不是反 AI,”一位代表告诉我。“我们只是认为你应该知道自己消费的内容是什么。”一些作者对此保持警惕。有人告诉我,感觉整个职业生涯可能因为一个按钮的点击而被毁掉。
图书出版是一个出了名反应迟缓的行业,在应对 AI 方面尤其缓慢。然而,现实是,越来越多的作者、出版商和代理人正在使用 AI。去年,Gotham Ghostwriters 对 1481 名在职作家进行了调查,发现 61% 的人使用 AI 工具,7% 的人表示他们已经出版了 AI 生成的文本(https://gothamghostwriters.com/wp-content/uploads/2025/11/AI-Writing-Survey.pdf)。今年早些时候,石溪大学(Stony Brook University)计算机科学助理教授图辛·查克拉巴蒂(Tuhin Chakrabarty)使用 Pangram 分析了 14419 部自出版小说(https://arxiv.org/pdf/2607.20349),他发现其中近 20% 具有显著的 AI 检测评分。他的工作论文被广泛引用,那些数据是最初*《匕首之口》*指控的来源。
我联系了五大出版商,询问他们是否使用 AI 检测。西蒙与舒斯特(Simon & Schuster)和哈珀柯林斯(HarperCollins)拒绝置评;阿歇特(Hachette)和麦克米伦(Macmillan)未予回应。企鹅兰登书屋(Penguin Random House)的一位发言人证实,其编辑可能会使用经批准的 AI 检测工具“作为识别潜在 AI 生成内容的又一手段”,但强调这类工具“并非决定性因素,只是更广泛编辑流程的一个组成部分”。一些代理人也在使用检测工具——而且,除了公开的图书交易取消事件,还有其他交易在幕后被悄然终止。“通常,代理人什么也不说,”弗里德曼说。
我想听听查克拉巴蒂的看法。他是在 2024 年底从斯佩罗的一篇帖子中第一次听说 Pangram 的。注册后,斯佩罗给了他 API 额度。查克拉巴蒂告诉我,两人后来成了“亲密的朋友”,Pangram 继续为查克拉巴蒂提供额度以支持他的研究。查克拉巴蒂在社交媒体上发布 Pangram 的结果,并定期为该公司辩护。他说,他曾与出版商就 AI 丑闻后的检测问题进行过交流。“Pangram 不应该是事实上的评判标准,”他说。“但我认为,你自己的判断加上 Pangram 的判断不会错。”
查克拉巴蒂还与托德·舒斯特(Todd Shuster)处于恋爱关系,舒斯特是纽约顶级文学经纪公司 Aevitas 的联席首席执行官。查克拉巴蒂鼓励舒斯特与 Pangram 会面。“它立即就成了一个非常有用的工具,”舒斯特告诉我。“很快,我们就不得不开始和作者进行艰难的对话,因为 Pangram 显示他们的作品有 50% 到 95% 是 AI 写的。”舒斯特现在使用 Pangram 分析手稿和图书提案。他也为 Pangram 提供咨询,角色包括在 Pangram 和出版商之间牵线搭桥。当作者被质问时,舒斯特说有些人会进行防御或似乎撒谎,而另一些人则对自己的 AI 使用情况诚实相告。舒斯特说,他曾要求作者用自己的声音和想法重写作品。
批评者指出了 Pangram 的两个主要问题:假阳性造成的损害以及其机器学习中可能存在的偏见。“我不认为 [AI 检测器] 有效,”爱丁堡龙比亚大学(Edinburgh Napier University)关键 AI 素养教授萨姆·伊利因沃思(Sam Illingworth)说。“我认为检测器对某些人有偏见。”一项研究(https://arxiv.org/abs/2304.02819)显示,检测器更可能将非英语母语作者的作品识别为 AI 生成,而神经多样性作者也声称他们的写作模式被不成比例地标记出来。(该研究早于 Pangram,斯佩罗指出有内部研究反驳了这一点。)前面提到的三部小说——*《害羞女孩》*、*《匕首之口》*和*《叫我》*,很容易成为出版界最大的 AI 检测丑闻——都是由有色人种作家撰写的。(我联系了这些作者;其中两人未回应,一人以法律问题为由拒绝置评。)“作为一名非裔美国人经纪人,我确实认为我们需要关注行业内的一些不平等问题,”美国文学代理人协会主席雷吉娜·布鲁克斯(Regina Brooks)说。毕竟,谁的作品被扫描、谁被公开指控,本质上是一个人的过程——因此容易受到偏见影响。
在一些作者声称其作品被错误地标记为 AI 生成的案例中,斯佩罗提出,如果他们能证明是自己写的,就提供现金奖励。“我在几乎肯定对方在撒谎的情况下提供了悬赏,”他说。“或者,如果他们没撒谎,那么了解情况对我们来说非常有价值。”到目前为止,他说还没有人接受他的挑战。
“当然,你可以骗过 Pangram,”查克拉巴蒂说。一些作家调整了文本或模仿 AI 写作以引出错误结果。圣母大学(Notre Dame)一篇新的工作论文(https://arxiv.org/pdf/2608.11256)题为“为何 AI 检测在学术诚信中失败”,指出 Pangram 3.2 模型将轻微的 AI 编辑在学术摘要中标识为 AI 写作的比例为 64% 到 80%。然而,在将 AI 生成的文本通过一个“人性化工具”——使 AI 作品看起来更像人类写作——处理后,Pangram 识别出 AI 写作的比例不到 4%。
Pangram 确实承认其工具在处理较短文本块时表现较差,特别是任何少于 100 词的内容。这是一个复杂情况,考虑到 Pangram 的免费服务每天提供有限额度,总计约 2000 词。中位数输入为 350 词。公司还承认,同一段文字,单独扫描或在更大上下文中扫描,可能会得到不同的裁决——而这正是从一本小说中复制粘贴一小段摘录时可能发生的情况。
总而言之,Pangram 声称其新模型的假阳性发生率仅为 0.0041%(相比之前报告的 0.01% 有所改善)。斯佩罗说,如果有什么不同的话,那就是 Pangram 比较保守。如果文本处于边界情况,工具会倾向于判定为人类撰写(https://www.wired.com/story/more-typos-fewer-em-dashes-writers-are-creating-an-anti-ai-literary-counterculture/)。“这是我们做出的一个有意识的选择,”斯佩罗说。这在一定程度上导致了低假阳性率——也意味着 AI 生成的作品更有可能蒙混过关。根据 Pangram 的衡量,经 AI 大量改写的人类散文,仍有 41.37% 的比例被识别为人类撰写。
在我们采访期间,斯佩罗调出几篇社交帖子来阐明他想表达的观点,以如此快的速度粘贴到我们的聊天中,以至于我怀疑他是否在后台运行自己的 AI 系统。
据记者兼前 Pangram 承包商罗德·雷斯劳(Rod Breslau)称,斯佩罗“整天亲自在线。他会回复你的推文,回复你在 Reddit 上的帖子。他可能还会回复你在 LinkedIn 上的帖子。”雷斯劳在今年年初主动联系斯佩罗,提出以“攻击犬”的身份提供服务。他厌倦了看到 AI 内容充斥社交媒体。雷斯劳为 Pangram 做的承包工作包括为其社交媒体策略提供建议,并为斯佩罗争取采访机会,但他也使用 Pangram 扩展程序浏览互联网,公开指出可疑的 AI 用户。“我想采取更严厉的方式,因为我觉得人们逃脱惩罚太容易了,”雷斯劳说。
Pangram 与雷斯劳分道扬镳,部分原因是该公司改变了策略——它预测 AI 的使用将变得更加普遍(https://www.wired.com/story/tech-reporters-using-ai-write-edit-stories/)。斯佩罗似乎对此失去了兴趣。
相似文章
Pangram的Max Spero谈为何AI检测比‘真或假’更难
本文探讨了AI检测的挑战,介绍了Pangram的创业努力,包括一轮900万美元的融资以及与Substack的合作,以识别AI生成的内容。
随着AI内容充斥互联网,Pangram筹集900万美元用于检测
Pangram筹集900万美元用于检测AI生成内容,推出新的文本和图像检测模型,识别AI辅助写作的准确率超过99%。
Pangram 4 技术报告
Pangram Labs 推出 Pangram 4,这是一款最先进的 AI 文本检测模型,AUROC 达到 0.9916,误报率和漏报率极低,并且提高了对对抗性攻击的鲁棒性以及混合作者身份的检测能力。
推出Pangram 4(2分钟阅读)
Pangram Labs宣布推出Pangram 4,这是其迄今为止最强大的AI检测器,大幅降低了假阳性率和假阴性率,在前沿模型上实现稳健检测,并新增图像扫描功能。
探索Pangram 3.3.2的内部表示
Pangram Labs探索其AI检测模型Pangram 3.3.2的内部表示,分析模型如何在不同层中区分人工文本与AI文本,使用来自多种来源的5,000份文档的平衡数据集。