model-collapse

标签

Cards List
#model-collapse

RAG Collapse:当检索到的文档为自我创作时,LLM响应发生崩溃

arXiv cs.CL · 2026-08-25 缓存

本文表明,检索增强生成(RAG)系统在检索自我创作的文档时会出现崩溃,导致响应多样性和自我偏差降低,实验显示在79.6%的模拟中发生了崩溃。

0 人收藏 0 人点赞
#model-collapse

模型崩溃与对策综述

arXiv cs.AI · 2026-08-25 缓存

本文提供了生成AI中模型崩溃现象的最新概述,并回顾了缓解该问题的对策,强调了挑战和未来的研究机会。

0 人收藏 0 人点赞
#model-collapse

AI会(或将会)反向学习吗?(因为其大部分训练数据现在是由AI生成的)

Reddit r/ArtificialInteligence · 2026-08-21

文章对AI模型可能基于AI自身生成的数据进行训练提出了担忧,这可能导致模型崩溃等问题,并引用了Deezer移除数百万首AI生成歌曲以及AI创建的博客文章比例过高等例子。

0 人收藏 0 人点赞
#model-collapse

随着互联网充满合成内容,生成式AI之前的数据是否变得更有价值?

Reddit r/artificial · 2026-08-12

一篇博客文章及配套推文探讨了随着互联网充满合成内容,生成式AI之前的数据是否变得更有价值,讨论了来源、模型崩溃以及Anthropic的图书扫描。

0 人收藏 0 人点赞
#model-collapse

公平崩溃现象:基于合成数据训练的语言模型中的偏见放大

arXiv cs.CL · 2026-08-06 缓存

本文介绍了“公平崩溃”现象,表明在标准模型崩溃指标恶化之前,在合成数据上训练语言模型会悄悄放大社会偏见,凸显了人工智能公平性面临的关键风险。

0 人收藏 0 人点赞
#model-collapse

AI如何识别AI生成的内容?

Reddit r/ArtificialInteligence · 2026-07-28

探讨了AI模型在AI生成的内容上训练的问题,随着不准确性的累积,可能导致质量下降和真相的丧失。

0 人收藏 0 人点赞
#model-collapse

AI公司大量购入旧书,因其不含AI垃圾

Reddit r/ArtificialInteligence · 2026-07-21 缓存

AI公司正在购买2022年之前出版的印刷书籍,以避免训练数据中出现AI生成文本,因为旧书保证没有AI垃圾和污染。ISBNdb在保密协议下向AI实验室提供批量图书采购服务。

0 人收藏 0 人点赞
#model-collapse

迭代指令微调中从合成数据学习避免模型崩溃

arXiv cs.CL · 2026-07-21 缓存

本文研究了迭代指令微调中使用合成数据时的模型崩溃问题,揭示了崩溃表现为能力极化:强项被强化,弱项则进一步退化。提出了KITE,一个两阶段框架,结合失败引导的数据生成和边界感知的不确定性筛选,确保在多次迭代中稳定提升。

0 人收藏 0 人点赞
#model-collapse

模型崩塌 + 技能退化 + 竞争压力 = 一个巨大的反馈循环。你怎么看?

Reddit r/ArtificialInteligence · 2026-07-15

文章讨论了一家咨询公司的论点:模型崩塌、人类认知债务(技能退化)和竞争压力在人工智能中形成了一个自我强化的反馈循环,并质疑组织能否抵制自动化的竞赛。

0 人收藏 0 人点赞
#model-collapse

模型崩溃怎么回事?

Reddit r/LocalLLaMA · 2026-07-09

对模型崩溃的探讨,这是一种AI模型在合成数据上训练后,其质量和多样性下降的现象。

0 人收藏 0 人点赞
#model-collapse

当样本选择偏差加速模型崩溃时

arXiv cs.AI · 2026-06-15 缓存

本文表明,在低资源验证场景中,验证者仅能访问目标分布中碎片化且有偏的片段,此时数据选择会通过剪除全局相关的尾部模式,反而加速模型崩溃。作者提供了理论证明,并提出了一种协作代理参考机制作为缓解策略。

0 人收藏 0 人点赞
#model-collapse

模型崩溃的流行病学:通过双层SIR动态建模合成数据污染

arXiv cs.CL · 2026-06-05 缓存

本文提出了一种双层耦合SIR/SIRS框架,用于模拟AI生态系统中的合成数据污染和模型崩溃,表明模型与数据语料库之间的交叉污染会导致超临界动力学,并指出基于检测的过滤是关键干预手段。

0 人收藏 0 人点赞
#model-collapse

模型崩塌的有趣之处不在于技术,而在于认识论

Reddit r/AI_Agents · 2026-06-01

本文探讨模型崩塌不是技术缺陷,而是认识论问题:当AI模型的输出成为自身输入时,模型对现实的表征逐渐扁平化为一种自我指涉的平均值,这引发了我们如何区分一个建模世界的模型与一个只建模自身的模型的问题。

0 人收藏 0 人点赞
#model-collapse

人类策展何时及为何适得其反:多模型自消费循环下的偏好对齐

arXiv cs.AI · 2026-05-29 缓存

本文研究了多模型体系中的自消费训练,表明由于跨模型交互,人类策展可能适得其反并损害长期对齐。

0 人收藏 0 人点赞
#model-collapse

作为文化演化的模型崩溃

arXiv cs.CL · 2026-05-25 缓存

本文将LLM中的模型崩溃重新定义为一种文化传播现象,表明迭代学习理论预测了自我训练下组合性的非单调轨迹,并在多种语言和模型上得到证实。

0 人收藏 0 人点赞
#model-collapse

如何在人类生成的数据耗尽时防止AI模型自我蚕食?科学家称他们已找到答案。

Reddit r/artificial · 2026-05-22 缓存

科学家声称已找到一种解决方案,防止AI模型在人类生成数据耗尽时自我蚕食,解决了模型崩溃问题——即基于合成数据训练的大语言模型会产生胡言乱语和幻觉。

0 人收藏 0 人点赞
#model-collapse

自训练不会使语言扁平化——而是重组它:表层标记增强,深层句法消亡

arXiv cs.CL · 2026-05-21 缓存

本文提供的证据表明,对语言模型输出的自训练并不会均匀地使语言扁平化,而是对其进行重组,表层标记(话语连接词、模糊限制语、破折号)增加,而深层句法结构(被动语态、虚拟语气、插入语)崩溃,这被正式化为结构深度假说。

0 人收藏 0 人点赞
#model-collapse

AI正在实时退化

Reddit r/ArtificialInteligence · 2026-05-20

AI模型因使用递归生成的合成数据进行训练而不断退化,导致模型崩溃;多项研究强调了使用合成数据进行规模化训练的风险。

0 人收藏 0 人点赞
#model-collapse

基于语义损失的微调方法以防止因果推理中的模型崩溃

arXiv cs.LG · 2026-05-08 缓存

本文指出了标准微调在因果推理任务中存在的“模型崩溃”问题,并提出了一种结合基于图的逻辑约束的语义损失函数来防止该现象。

0 人收藏 0 人点赞
#model-collapse

关于LLM“数学证明”声明的问题(15分钟阅读)

TLDR AI · 2026-05-07 缓存

本文批判了媒体对LLM局限性数学证明的夸大报道,特别指出关于自我提升的条件性结论如何经常被曲解为普遍不可能性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈