随着互联网充满合成内容,生成式AI之前的数据是否变得更有价值?

Reddit r/artificial 新闻

摘要

一篇博客文章及配套推文探讨了随着互联网充满合成内容,生成式AI之前的数据是否变得更有价值,讨论了来源、模型崩溃以及Anthropic的图书扫描。

嘿,各位,我一直在思考生成式AI繁荣的一个奇怪后果。尤其是鉴于那些关于Anthropic销毁书籍的末日故事(呸,坏Anthropic,坏)。第一批主要的LLM继承了数十年的互联网,这些内容绝大多数是由人类产生的。现在,这些系统及其后代正在生产文章、代码、摘要、书籍、评论和其他材料,这些材料最终又回到了信息环境中。显然,合成数据本身并不天生就是坏的。精心生成和过滤的合成数据可能极其有用。我感兴趣的是来源(provenance)。一本1980年印刷的书有一个非常明显的特性:无论它有什么其他问题,它都不是用LLM写的。同样适用于旧论坛、存档网站、学术工作、旧文档和其他生成式AI之前的材料。那个历史语料库是否会因为我们对其来源有所了解而变得异常有用?我写了一篇更长的文章,通过Anthropic的实体图书扫描、递归训练/模型崩溃、旧互联网档案和人类作者认证来探讨这个问题。完整披露,这是我的文章:https://www.gonzocapital.net/the-internet-ouroboros/ 但我更感兴趣的是根本问题:来源对于训练数据来说是否变得实质上更重要,还是过滤和验证技术已经足够好,以至于语料库的年龄/来源变得基本上无关紧要?
查看原文

相似文章

当AI掌控一切之后

Hacker News Top

一篇探讨人工智能实现广泛主导后社会影响的推测性文章。