高质量非虚构书籍:AI垃圾内容的对立面

Hacker News Top 新闻

摘要

一篇个人随笔,反思精心策划的高质量非虚构书籍作为低质量AI生成内容的反衬,感叹传统图书馆浏览的衰退和AI垃圾内容的兴起。

<a href="https:&#x2F;&#x2F;book-prize-index.vercel.app&#x2F;" rel="nofollow">https:&#x2F;&#x2F;book-prize-index.vercel.app&#x2F;</a>
查看原文
查看缓存全文

缓存时间: 2026/07/22 23:24

# 优质非虚构书籍是AI垃圾的对立面 来源:https://resobscura.substack.com/p/quality-non-fiction-books-are-the 大学第一年,我有份勤工俭学的工作,最终却成为我人生中最暗藏重要性的智识经历之一。我是个不起眼的图书馆上架员,负责国会图书馆分类系统中标为A到F的书架:主要是宗教、哲学、社会学和历史类著作。我说**暗藏**重要性,是因为乍一看,在图书馆里上架图书极其无聊。实际操作上,就是读一本书的标签,然后把它放到所属的书架上,每班重复大约一千次。 为了摆脱枯燥,我决定每上架一本书还要随机翻到某一页,读上面的一句话。通常我会就此打住——被某位匈牙利古典音乐评论家、玻利维亚农业发展领域某位早已作古的统计学家,或任何其他未能引起我兴趣的内容所困住。但有时候——比如当我碰到一本关于 [希腊化时代密教](https://en.wikipedia.org/wiki/Mithraism) 的书,或是《亨利·亚当斯的教育》,或是《衣服现代吗?》——我会完全沉浸其中,一口气读上好几页,才不情愿地把书放回原位。 然后,很多时候,我还会把这本书旁边的书也如法炮制。 [](https://substackcdn.com/image/fetch/$s_!EZXa!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fc0fcdcaf-a0ad-4dd5-a383-47403c929ab7_1364x1212.png) GR 830, v to w:哥伦比亚大学巴特勒图书馆的吸血鬼/狼人专区。 回想起来,我在这份工作中学到的东西比任何正规课程都多,因为它是一种经过筛选的自学形式。国会图书馆分类系统——以及学术研究图书馆的专业馆员——已经对这些文本进行了分类和筛选。更不用说这些书被**借出**这一筛选机制:换句话说,它们找到了持久的读者群。因此,我看到的并非真正随机的书籍样本,而是一个有针对性、有组织,却仍带有有趣随机性的**优质**书籍样本。 如今,本科生被要求查找资料时,无一例外会去谷歌搜索,其结果**远比**老方法——比如去研究图书馆的GR 830书架(基本上就是“捉鬼敢死队会读的书”)随便看看——要**差得多**。 但老实说,就连研究图书馆也不是以前的样子了。我41岁,感觉自己亲身经历了图书馆所能达到的巅峰,现在则是衰落(我当然仍热爱它们——事实上,我现在就在圣克鲁斯公共图书馆的家谱区写这篇文章)。过去那种可浏览的开架书库正被学习实验室、数字创新中心和主要用于社交和吃零食的座位区所取代,而我在本科时有幸翻阅的那些有趣、怪异的老书,正越来越多地被扔进垃圾桶,被电子版替代。 但有一件事在我一生中始终如一地优秀——那就是书籍本身,我指的是非虚构书籍。即使现在,非虚构书籍的读者群因AI聊天机器人和播客的竞争而下降,我仍觉得我们正处在该类作品的黄金时代,却很少被如此认可。 这就是为什么今年夏天我抽出时间创建——或者更确切地说,通过Claude Code诱导创建——一个免费平台,用于搜索高质量非虚构书籍的长尾。质量很难定义,但我的经验是,获得或入围主要非虚构图书奖的书籍几乎总是明显优秀的,所以我以此为试金石。首先,我统计了英语世界所有主要的非虚构图书奖。然后我让Claude和GPT-5.6从各种在线来源(主要是维基百科)收集入围者和获奖者名单,并将其整理成一个可搜索、可排序的列表。 **你可以 [在这里访问它](https://book-prize-index.vercel.app/)。** (在你产生疑问之前,是的,这是完全免费的。我自付托管费和API费用,纯粹是因为我希望人们能找到并阅读更多好的非虚构书籍。) 除了收集数据和编写代码的工具之外,这真的没什么“AI”可言,[1] 而关键的一点是**语义搜索**,这是我当下所有AI工具中最吸引我的,正因为它能直接改进研究人员已有的工作流程和习惯:它让文本搜索效果更好。 所以,例如,你可以搜索“modern France”或“social history”之类的简单短语,但也可以搜索“classic biographies that are surprisingly weird”这类内容,嵌入模型会从大约6500个标题中提取并呈现一些结果: [](https://substackcdn.com/image/fetch/$s_!XwKt!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Ff19dbbcd-bc17-426e-81d7-b798aa16807a_2798x1900.png) 我正打算读《伊迪丝·华顿》,这听起来**并不**那么古怪,但读过刘易斯所写的关于詹姆斯家族那本兼收并蓄、才华横溢的传记后,我推测这本很有可能也是如此。 有时搜索的“选择”会让人有些困惑,但这正是我喜欢它的原因:其理念是重新捕捉那种在精心打理的花园中随意漫步的感觉,正是这种感觉让我当年的图书馆上架工作如此有价值。 我发现它最擅长的往往是寻找“类似书籍”。例如,我认为斯特凡·茨威格关于战前维也纳的回忆录《昨日的世界》非常感人(甚至在我得知他于1942年在巴西完成此书后立即自杀之前)。使用语义搜索在语料库中寻找类似书籍,立即得到了一些看起来很有希望但此前我从未听说过的书名: [](https://substackcdn.com/image/fetch/$s_!Vc4Y!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F250a02ce-fb83-4962-a75e-a234f8c3665b_2828x1918.png) 收集完所有这些书籍相关数据后,用其制作一些 [数据可视化](https://book-prize-index.vercel.app/experiments) 就成了一个有趣的实验,其中包括一些好玩的奇怪东西,比如这个按颜色排列的约5000本书籍的展示(如果能按十年期绘制图表,看看过去几十年里,我们在汽车上看到的 [色彩灰度化效应](https://www.reddit.com/r/Infographics/comments/1p2p5x6/the_evolution_of_car_colours_from_colourful_to/) 是否也作用于书籍封面,那会很有趣)。 也许更有用的是(因为我从未在任何地方见过这种图表)[这个图表](https://book-prize-index.vercel.app/experiments) 及其附带的 [排名](https://book-prize-index.vercel.app/publishers?sort=all_activity),你可以借此探究过去一个世纪里,哪些出版社和出版品牌在非虚构图书奖项中表现最佳。 [](https://substackcdn.com/image/fetch/$s_!kf1O!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F15efab2f-f3fa-455a-9ebe-20530a73dd98_2546x1654.png) 而这反过来又让我思考非虚构作品作为一种文化力量的过去和未来。例如,这是我为本项目采样的所有非虚构图书奖的图表。我惊讶地发现,甚至连声名显赫的普利策非虚构奖也是相对晚近才设立的,始于1962年。 在整个70年代、80年代和90年代,奖项数量不断增加,直到2014年达到顶峰,然后,在2020年,开始了**可能**是缓慢下降的迹象: [](https://substackcdn.com/image/fetch/$s_!2hoi!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F851c8e5a-3437-446b-b9ee-e23be6ab9820_2394x1112.png) 然而,也许并非如此。当我开始使用自己的工具寻找新书来读时,最让我印象深刻的是,过去几十年非虚构作品的长尾**始终如一地优秀**。你几乎可以随机从这份列表中选一本书,最终都会得到一本非凡而原创的作品——这并非因为它是沧海遗珠或被遗忘,显然这些书之所以**在**列表上,正是因为它们曾受赞誉和好评。但是,一本在1990年代早期赢得报纸、文学知识界或学者们巨大赞誉的书——比如,我目前正在读的戴维·莱弗林·刘易斯所写的 [关于W.E.B.杜波依斯的精妙传记](https://www.amazon.com/W-B-Bois-Biography-1868-1919/dp/0805026215/ref=pd_lpo_d_sccl_1/143-2013381-1211736?pd_rd_w=f3zgb&content-id=amzn1.sym.4c8c52db-06f8-4e42-8e56-912796f2ea6c&pf_rd_p=4c8c52db-06f8-4e42-8e56-912796f2ea6c&pf_rd_r=XRXCM2M2E1N5RR9H2ADM&pd_rd_wg=bwf2S&pd_rd_r=1d5a7928-e80b-4240-b31b-1de9a9de5d12&pd_rd_i=0805026215&psc=1) ——并不是亚马逊会推荐的那种书,因为它已经绝版,目前在销售排名中位于100万+。 但它就在列表上,排名接近所有书籍的前十,因为它在1993年出版时赢得了至少四个主要奖项。我个人可以证明,你可以花大约4美元买到二手书,而且它真的很好。 [](https://substackcdn.com/image/fetch/$s_!ZVQH!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F46f9891b-d7d3-44d6-b1a5-aee9f247cc5a_2488x1868.png) 撰写这篇文章时,我开始对一个更大的问题产生兴趣:非虚构作品的黄金时代始于何时,原因何在。我怀疑这与那些老式开架研究图书馆的兴起有很大关系,我在这里写过它们的起源: 确实,这些机构的基本蓝图是18和19世纪的发展成果——但战后时代从根本上改变了图书馆和档案馆产生新知识的方式,原因多种多样,我将在未来的文章中深入探讨。在我看来,其中惊人的数量与技术和社会变革有关: - 喷气式飞机使作家和研究人员能够前往多个大洲为书籍做研究——这种机会以前只有超级富豪才能享受。 - 围绕阶级、种族和性别的限制逐渐消除,使得像珍本图书馆这样以前专属精英的空间变得更加普及,同样的过程也开启了新的问题和研究线索(例如,令人惊讶的是,大约在1965年之前,传记作者很少深入挖掘其研究对象的性取向)。 - 原型数字和早期数字技术,如国会图书馆分类系统和相关的MARC(机读编目)标准(于1960年代末开发),使书籍的分类和排序变得更加容易。至关重要的是,它们也使事实核查来源和创建高质量尾注变得更加容易。 - 广播新闻、古怪的电视访谈节目(迪克·卡维特!)和书籍到好莱坞的产业链,为作者创造了新的激励,也为展示其作品提供了新的平台。 - 文字处理器和早期计算机?我仍然不确定这些是否显著改变了非虚构写作的质量,但我觉得有可能。当然(进入2000年代后),维基百科、Google Books/Hathi Trust对我和我这一代的其他人来说极为有用。 我自己完全主观的看法,基于在大量图书馆书籍中的大量浏览,是:非虚构写作质量在整个20世纪显著提高,可能在1980年代到2000年代初期达到顶峰。至于现在是否正在下降,再次成为了另一篇文章的话题——不过我很想听听**你**怎么想,亲爱的读者,无论是关于这个问题,还是关于“图书奖索引”。 [分享](https://resobscura.substack.com/p/quality-non-fiction-books-are-the?utm_source=substack&utm_medium=email&utm_content=share&action=share) --- [](https://substackcdn.com/image/fetch/$s_!ye1S!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F8a7962ec-7ec3-467e-a61a-fb4e967cfc00_3000x241.png) - [《侏罗纪公园》电脑的制作](https://fabiensanglard.net/jurrasic_park_computers/index.html)。 - “密尔的生活在这方面和他的论点一样富有教益。当他1826年那次早早崩溃时,是因为他对自己家族的信念——功利主义追求——失去了信心。但他觉得自己无人可以倾诉自己的危机。他说,他的康复部分来自于阅读华兹华斯。也来自于拒斥他父亲抚养他时所基于的心理图景,一种联想主义,将心灵视为管理快乐和痛苦的机制,就像他父亲的功利主义伦理学将道德视为最大化快乐对痛苦的盈余一样。正如他在《论自由》中所写,人性‘不是一架按模型建造的机器’,而是一个必须‘在各个方面生长和发展自身’的活物。”——夸梅·安东尼·阿皮亚谈AI与约翰·斯图尔特·密尔,[密尔的《自传》](https://humanistreview.ai/issue-1/appiah-ai-moral-character/) 是我在开架书库中注意到的一本书。 - 幸运的是,Pangram将阿皮亚的文章评定为100%人类撰写……如今很难判断了。但显然你**可以**在Substack上大致判断——当我在准备这篇文章时,我注意到这个 [新增的功能](https://support.substack.com/hc/en-us/articles/50891130623508-How-can-I-detect-AI-on-Substack): [](https://substackcdn.com/image/fetch/$s_!eq-W!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F071598d8-a7c7-42d1-b370-dc39bb62a267_952x998.png) 过去我对宣称能检测AI写作的软件持怀疑态度,但我必须说,Pangram感觉不一样。我测试过,它有效得令人沮丧——沮丧是因为,正如我 [在此](https://resobscura.substack.com/p/what-is-happening-to-writing) 写到的,如今网上很多人喜欢的写作都被判定为100% AI。我很高兴Substack添加了这个功能,我希望它也能出现在其他地方,比如,如果它能自动应用于主要新闻网站和杂志的输出,那会很有趣。 [发表评论](https://resobscura.substack.com/p/quality-non-fiction-books-are-the/comments) [分享](https://resobscura.substack.com/p/quality-non-fiction-books-are-the?utm_source=substack&utm_medium=email&utm_content=share&action=share)

相似文章

在我看来 AI撰写 != Slop

Reddit r/AI_Agents

一篇观点文章讨论了将真实艺术作品标记为AI生成如何导致错误的批评,并指出'slop'的定义是缺乏人类故事,而非AI参与。

AI小说是新的快餐文化

Reddit r/ArtificialInteligence

一篇评论文章认为,AI生成的小说就像快餐,缺乏人类创作故事的深度和原创性,强调了人类作者仍然必不可少。

垃圾时代的品质

Lobsters Hottest

一篇反思性的博文,引用罗伯特·波西格的《禅与摩托车维修艺术》,探讨随着生成式AI工具泛滥,科技行业中的质量危机与虚无主义,呼吁重新关注工艺与价值观。

美学中的AI‘slop’

Reddit r/artificial

对美学中AI生成内容(‘slop’)的哲学批判,指出高质量的作品需要连贯的意图与风格,而不仅仅是自动生成。

我找到了对抗AI内容垃圾的方法

Reddit r/artificial

作者提出将AI作为研究筛选和综合工具,而非内容生成器,以对抗“AI内容垃圾”。通过构建一个比较并排名专家来源的自动化流程,作者认为未来人类在AI时代的主要角色将是策展人、筛选者和判断者。