AI正在实时退化
摘要
AI模型因使用递归生成的合成数据进行训练而不断退化,导致模型崩溃;多项研究强调了使用合成数据进行规模化训练的风险。
**来源与参考文献**
Shumailov等人 — 《当AI模型使用递归生成的数据训练时会发生崩溃》。《自然》,2024年7月。 [https://www.nature.com/articles/s41586-024-07566-y](https://www.nature.com/articles/s41586-024-07566-y)
Villalobos等人(Epoch AI) — 《我们会耗尽数据吗?基于人类生成数据的大语言模型规模化极限》。《国际机器学习大会》,2024年。 [https://arxiv.org/abs/2211.04325](https://arxiv.org/abs/2211.04325)
OpenAI — o3和o4-mini系统卡(2025年4月)。PersonQA幻觉基准。
Gartner — 合成训练数据预测,预计到2024年将占训练语料库的60%。
杜克大学图书馆 — 生成式AI学生调查(2025年1月)。
DeepMind — AlphaZero(自对弈国际象棋/围棋);AlphaGeometry(基于合成数据的奥数级别几何问题)。
Ed Zitron — 《AI泡沫与软件衰退的真相》。《技术报告》访谈。 [https://www.wheresyoured.at/](https://www.wheresyoured.at/)
Gary Marcus — 《AI反馈循环如何威胁破坏ChatGPT》。《技术报告》。 [https://garymarcus.substack.com/](https://garymarcus.substack.com/)
相似文章
当人工智能耗尽人类生成的数据时会发生什么?
随着AI模型消耗有限的人类生成数据,未来的训练可能会依赖其他AI产生的合成数据,这引发了关于长期影响的疑问。
模型崩溃怎么回事?
对模型崩溃的探讨,这是一种AI模型在合成数据上训练后,其质量和多样性下降的现象。
@rohanpaul_ai: 德克萨斯大学论文显示AI智能体在部署后可能逐渐变得不那么可靠,即使模型本身并未变…
德克萨斯大学的一篇论文介绍了AgingBench,这是一个基准测试,揭示了AI智能体在部署后可能因记忆和维护衰减而变得不那么可靠,即使底层模型保持不变。
AI自信地给你过时的信息。原因之一及如何避免
解释为何AI模型因上下文持续存在而自信地提供过时信息,并提供实用建议,如使用干净的上下文和时间戳值。
在AI生成的低质内容上训练AI模型
本文探讨了利用其他AI系统生成的低质数据(常被称为'AI垃圾')训练AI模型的问题,及其对模型可靠性和性能的影响。