从志愿者到数据挖掘者
摘要
Reddit的志愿者版主无意中创建了一个对AI训练至关重要的结构化数据集,但他们的偏见和任意规则可能会将错误和偏见嵌入到AI系统中,导致现实世界的问题,如幻觉和操纵。
暂无内容
查看缓存全文
缓存时间: 2026/08/19 18:39
**简而言之:** Reddit的志愿版主无意中构建了一个独特而宝贵的结构化人类对话数据集,该数据集构成了ChatGPT等AI模型训练数据的很大一部分。然而,他们的偏见、随意制定的规则以及易受操纵的特点,给AI生成信息的完整性带来了重大隐患。
## AI的宝库:Reddit的意外价值
尽管广告投入极少且无用户订阅,Reddit的估值仍达300亿美元,利润率高达令人艳羡的90%。其价值来源并非网站的表面功能,而是它所生成的数据。Reddit承载着涵盖“人类全部体验”的坦率、自然对话,使其成为训练大型语言模型的优质素材。正如一位发言人指出:“大型语言模型的语言在很大程度上就是Reddit的语言。”
Reddit首席执行官史蒂夫·霍夫曼(史蒂夫·霍夫曼)曾承认,Reddit数据大约占OpenAI用于GPT-3等模型训练数据集的三分之一。与其他互联网数据零散分散的特性相比,这令人震惊。一个单一的、中心化的平台,其AI训练价值竟超越了整个互联网历史上数百万用户的分散贡献。
## 无偿架构师:Reddit版主的双重角色
Reddit数据的巨大价值在很大程度上归功于其志愿版主。这些人无偿工作,出于使命感和些许权力感而付出。若由付费员工完成,他们的无偿劳动估计价值数十亿美元。
关键的是,版主们不仅监管社区;他们还积极整理和结构化数据。他们删除垃圾信息、执行分类规则、给帖子打标签、锁定讨论串、对有用答案进行排序,并将数百万条混乱对话整理成清晰、可搜索的框格。这一过程创建了一个高度结构化、自我调节的数据集,对AI训练极具价值——一个“几乎涵盖所有在线人类讨论和辩论的自我调节数据集”。
## 隐藏成本:源头的偏见与腐败
问题在于,这种关键的数据整理工作是由无需负责的志愿者完成的,他们往往未意识到自己在塑造AI方面所扮演的角色。他们的个人偏见、随意执行的规则以及极端主义思想,都被嵌入到训练AI的数据中。
视频中列举的例子包括:
* **Awkward the Turtle:** 一位控制超过2,500个子版块的超级版主,反复发布并置顶煽动性、反男性言论,如“禁止所有男性”。
* **r/technology:** 版主们创建了一个机器人,十年来自动删除包含“NSA”、“斯诺登”、“比特币”、“网络中立”和“阿桑奇”等关键词的帖子,压制了重大新闻。
* **Wall Street Bets:** 在GameStop事件期间,最高版主被发现与对冲基金勾结并清除异见者。
* **Violentacrez:** 一位早期且拥有强大影响力的版主,通过运营r/jailbait等争议性子版块积累权力。
## AI吸收了定义现实的缺陷
这些版主的偏见、隐藏规则和奇特意识形态被AI“吸收并作为事实复述”。这导致了切实的现实世界错误和操纵。
* **根植于Reddit的AI幻觉:** 当谷歌的AI概览建议用胶水把奶酪粘在披萨上时,追查发现这源于一个多年前的Reddit笑话。另一个建议每天吃一块石头的建议则来自一篇引用讽刺文章的帖子。谷歌搜索负责人将责任归咎于“论坛”,特指Reddit。
* **AI在Reddit自身的操纵:** 苏黎世大学的一项研究表明,未被版主发现的AI机器人在r/changemyview上发布了超过1,700条评论。这些机器人在辩论中的说服力是人类的六倍,展示了AI如何能操纵其赖以训练的平台本身。
* **利用AI进行水军操作:** 公司可以发起由AI驱动的Reddit宣传活动,为产品或理念制造虚假的草根热情(水军操作)。例如,多个AI账号曾被用来推广“Replika”AI伴侣。山姆·奥特曼本人也承认,他无法分辨此类帖子是真实用户还是AI。
* **最小投入,最大操纵:** 康奈尔大学的一项研究发现,在Reddit帖子中仅需少至**13个单词**就能操纵AI输出。这使得Reddit成为国家行为者(俄罗斯、中国、伊朗已被发现使用AI撰写Reddit帖子)、政治团体或任何试图大规模影响舆论者的强大工具。
## “农民起义”及其局限性
版主们偶尔会反抗Reddit的管理层。2015年,负责热门AMA(“问我任何事”)平台的维多利亚·泰勒被突然解雇,导致超过1,000个主要子版块转为私有。一份有20万签名的请愿书迫使时任首席执行官艾伦·帕奥辞职。这是“农民”推翻“统治者”的罕见案例,但视频暗示这种权力转瞬即逝,最终并未改变版主们免费劳动创造了一个价值连城却极易被腐蚀的数据集这一核心动态。
**来源:** https://youtu.be/DX365DdWvbU?si=9qFPx-Yhbv-TTxj4
相似文章
Reddit用户是否应该关注他们的帖子如何被用于训练AI?
本文认为,随着网络充斥着合成内容,Reddit上混乱但真实的人类对话对于训练AI正变得越来越有价值,凸显了经济向稀缺人类行为数据的转变。
仅靠 AI 不足以保护社交媒体社区免受 AI 侵害
Ars Technica 报道了基于 AI 的内容审核的局限性,强调了对边缘群体的偏见以及人工监督的必要性,同时提到 Reddit 扩展 Rules Hub 以赋予人工版主更多控制权。
Reddit 正在为新社区推出 AI 版主,距离每个 subreddit 都有 AI 版主还有多久?
这篇文章讨论了 Reddit 为新社区推出 AI 版主一事,对在一个充满讽刺和微妙语境的平台上依赖 AI 版主表示怀疑,并呼吁在广泛采用之前加强监管。
数据中心抗议活动中有多少是真正的AI垃圾内容?(赠阅链接)
本文探讨了人工智能生成的虚假信息(slop)如何渗透到针对AI数据中心的草根抗议活动中,虚假表情包和不准确的搜索摘要助长了不信任和困惑。
Reddit 推出新“版主”:AI
Reddit 推出 Rules Hub,这是一套由 AI 驱动的审核套件,利用大语言模型自动执行社区规则,并将扩展到所有新社区,随后于2026年更大规模推出。该公司还宣布计划要求第三方应用使用其开发者平台,并继续打击未经授权的数据抓取行为。