随着互联网充满合成内容,生成式AI之前的数据是否变得更有价值?
摘要
一篇博客文章及配套推文探讨了随着互联网充满合成内容,生成式AI之前的数据是否变得更有价值,讨论了来源、模型崩溃以及Anthropic的图书扫描。
嘿,各位,我一直在思考生成式AI繁荣的一个奇怪后果。尤其是鉴于那些关于Anthropic销毁书籍的末日故事(呸,坏Anthropic,坏)。第一批主要的LLM继承了数十年的互联网,这些内容绝大多数是由人类产生的。现在,这些系统及其后代正在生产文章、代码、摘要、书籍、评论和其他材料,这些材料最终又回到了信息环境中。显然,合成数据本身并不天生就是坏的。精心生成和过滤的合成数据可能极其有用。我感兴趣的是来源(provenance)。一本1980年印刷的书有一个非常明显的特性:无论它有什么其他问题,它都不是用LLM写的。同样适用于旧论坛、存档网站、学术工作、旧文档和其他生成式AI之前的材料。那个历史语料库是否会因为我们对其来源有所了解而变得异常有用?我写了一篇更长的文章,通过Anthropic的实体图书扫描、递归训练/模型崩溃、旧互联网档案和人类作者认证来探讨这个问题。完整披露,这是我的文章:https://www.gonzocapital.net/the-internet-ouroboros/ 但我更感兴趣的是根本问题:来源对于训练数据来说是否变得实质上更重要,还是过滤和验证技术已经足够好,以至于语料库的年龄/来源变得基本上无关紧要?
相似文章
Reddit用户是否应该关注他们的帖子如何被用于训练AI?
本文认为,随着网络充斥着合成内容,Reddit上混乱但真实的人类对话对于训练AI正变得越来越有价值,凸显了经济向稀缺人类行为数据的转变。
当人工智能耗尽人类生成的数据时会发生什么?
随着AI模型消耗有限的人类生成数据,未来的训练可能会依赖其他AI产生的合成数据,这引发了关于长期影响的疑问。
当AI掌控一切之后
一篇探讨人工智能实现广泛主导后社会影响的推测性文章。
如果AI比人类写得更好,什么会变得有价值?
本文探讨了如果AI超越人类写作所带来的哲学影响,质疑什么会变得有价值——真实性、人类创作的艺术,还是情感冲击。
生成式AI与数字生态系统韧性:基于生命周期的主动式综述
本综述整合了关于生成式AI加速的对抗性合成内容主动检测的新兴研究,提出了基于生命周期的分类法,采用C5交互模型来融合机器学习和社会科学方法。