回归均值:论LLM与新事物的悄然消亡
摘要
一篇论述文章,认为LLM通过返回最大概率的续写,可能在无意中抑制了真正的创新与偏差,导致文化向平均值趋同,而非真正的新事物。
暂无内容
查看缓存全文
缓存时间: 2026/07/06 14:03
# 均值回归 —— 论LLM与新事物的悄然消亡
Source: https://rruxandra.github.io/regression-to-the-mean.html
更多想法的承诺 · 以及向中心的拉力
## 回归到*均值*
我们被交予一台能与我们一起思考的机器,并被告知它将引爆新思想的爆发。*它可能恰恰相反——轻柔到让我们将平坦误认为进步。*
scroll
承诺**· 第01号**
每个桌面一个模型;每个头脑一个协作者。宣传语是一场寒武纪大爆发——所有人同时探索上千个方向。*更多头脑在思考,当然,意味着更多值得思考的想法。*
新事物的爆发
均值**· 第02号**
但问它任何问题,它都会返回*最可能*的延续——所有已写内容的质心。训练于过去,它以思想的过去时作答。不是真实。而是*典型*。
平均值 · 以确定性的速度返回
修正**· 第03号**
给它从未见过的东西,它不会亮起来。它会纠正你。对于一个为预测期望而构建的系统,真正的新事物与错误无异。阻力是轻柔的、持续的:
你是不是指——
*那个熟悉的东西,用来替换你的。*
不是标准术语
*新名字作为拼写错误返回。*
多数来源一致
*共识作为事实交回。*
你确定吗?
*信念被磨平至均值。*
崩塌**· 第04号**
我们将其答案作为下一个问题重新输入。每一次传递,分布范围缩小;奇怪的尾部变薄。*方差从文化中泄露。* 我们收敛——并非正确,而是平均。
输出成为输入 · 曲线锐化为尖峰
代价**· 第05号**
然而,每一项发现,在它被做出的那一刻,都*偏离分布。* 它与当时的共识相悖——移动的大地,看不见的细菌,漂移的大陆,每一个起初都被归档为错误。共识模型,按其构造,是一台告诉你新事物是错误的机器。
发现只曾存在于尾部
偏离**· 第06号**
于是稀缺之物反转。平均值现在免费、无限、相同——恰恰因为每个人都拥有它而价值甚微。无价的是*偏离*:模型标记为错误的位置,却仍被保留。不是它确信的答案——*那个它不停纠正的。*
守护尾部
机器无法交还之物
## 它将给你所有被思考过的事物的平均值。*新事物从未在其中。*
一个返回最可能句子的工具,既是一种安慰,也是一种悄然的窄化。它无法为你做的工作,才是唯一重要的工作:有目的地站在曲线变薄的地方——并停留足够长的时间以变得正确。
---
不是最可能的答案。*那个它试图纠正的。*
有意地·偏离分布
相似文章
LLMs陷入了群体思维的窠臼。这家初创公司正试图让它们摆脱困境。
一家名为Springboards的初创公司开发了一款名为Flint的LLM,旨在生成比主流模型更多样化和更具创意的回答,以解决AI输出中普遍存在的同质化问题。文章强调了相关研究,表明许多LLM因为训练数据和方法相似而趋同于类似的答案。
利用熵提升大语言模型的创意写作能力
本文介绍了一种通过修改采样过程利用熵来改进大语言模型创意写作的技术,旨在减少生成文本中常见的“大语言模型风格”。
使用枯燥语言配合LLM
一篇观点文章指出,LLM在枯燥且一致的语言与生态系统(如Ruby on Rails)中表现更佳,因为训练语料库的方差较低,从而产生更可靠的智能体输出,而碎片化的生态系统(如JavaScript)则导致效果不佳。
LLMs知道自己何时出错。我对Anthropic的新“全局工作空间”论文进行了一项修复 [R]
作者提出了一种方法,通过使用中间层状态的线性探测器和一个小型训练桥接器将置信度对数进行校准,使LLMs能够表达校准后的置信度,仅需200个标注样本,无需修改权重。这与Anthropic的全局工作空间论文相关,该论文解释了“知道-说出”差距。
对齐更优,多样性下降?分析两代大语言模型的语法与词汇特征
这篇学术论文分析了两代大语言模型与人类撰写新闻文本相比的句法和词汇多样性,发现较新的对齐模型表现出多样性降低的现象。