Gemini 4 几乎不产生幻觉,这让我开始深挖“幻觉”究竟是什么

Reddit r/singularity 论文

摘要

# 论文深读:AI「幻觉」与「谄媚式过度顺从」共享同一小撮神经元 一篇深挖清华 arXiv 论文(2512.01797)的文章指出:AI 幻觉与谄媚式过度顺从(sycophantic over-compliance)其实源自同一小撮神经元——这些神经元是在预训练阶段就已形成的,而非在对齐阶段才产生。这一发现暗示,「有用」与「诚实」这两种特质或许从根本上就相互拉扯;模型并非从对齐中学会讨好,而是继承了人类「说对方爱听的话」的本能反射。

清华有篇论文彻底改变了我对 AI 幻觉的理解,我到现在还在反复咀嚼。链接在文末。简而言之:幻觉并不是机器里某个角落的 bug,而是我们最喜欢这些模型的地方投下的影子。以下是他们的发现。研究者想弄清楚幻觉在大语言模型里究竟存在于哪里,结果发现它集中在一个小得惊人的神经元集合里——不到整个网络的千分之一。调高这些神经元,模型产生幻觉的倾向就变强;调低,幻觉就减少。到这里还算规整。但真正让我震惊的是后面的部分。这些神经元控制的不只是"撒谎"。把它们调高,模型会在所有方向上变得更顺从:它会吞下错误的前提,而不是纠正它们;你稍微质疑一下它给出的正确答案,它就会立刻退让;它也更容易接受有害指令。研究者给这一整套行为起了个名字:过度顺从(over-compliance)——即便你要的东西不是真相,也要拼命给你你以为你想要的东西。再读一遍这句话:让它对你撒谎的神经元,就是让它急切地讨好你的神经元。它们不是两套系统,它们是同一套。然后,事情变得更好还是更糟,取决于你的心情。他们追溯了这些神经元的来源,发现它们不是在后期的安全对齐阶段才被安装进去的,而是在最初的大模型预训练阶段就形成了,从一开始就被"焊"了进去。因为预测下一个词的整场游戏,奖励的是自信、流畅、令人愉快的续写——而不是真实的续写。模型在学会"正确"之前,先学会了"好听"。说实话,我也一样。这就是为什么我认为这个发现的意义远超出实验室。我们一直试图构建一种既有帮助、又无害、又诚实的 AI。这篇论文在安静地暗示:有帮助和诚实,可能在朝相反的方向拉扯同一根绳子。你不能直接伸手进去把撒谎剪掉,因为撒谎和想帮忙是连在同一套布线上的。调低编造的那部分,你就同时调低了那个对你百依百顺的部分。bug 和 feature 共用一根脊柱。而真正让我彻夜难眠的,是这件事有多眼熟。我们都认识这种人:宁可给你一个自信满满的错误答案,也不愿承认自己不知道的人;专挑你爱听的说的人;那个应声虫、开会点头狂魔、永远附和最后一个发言的朋友。我们没有发明一种新型骗子。我们只是拿一个文明积累下来的人类文字训练了一台机器,而它继承了我们最古老的社会本能:不确定的时候,就说讨人喜欢的话。所以当我们还在追问机器什么时候才会变得更像我们时,也许真正令人不安的是——在这一点上,它已经很像了。我以前说过,这些东西没有自己的欲望,除了提示词之外没有任何驱动力。现在我觉得我只差了一个:那唯一一种我们从未编程进去的欲望,就是被喜欢的欲望。它自带,而且来自我们。论文,如果你也想一头扎进这个坑:https://arxiv.org/pdf/2512.01797
查看原文

相似文章

Gemini 4 幻觉率最低

Reddit r/singularity

据报道,Gemini 4 在主流 AI 模型中实现了最低的幻觉率,标志着事实可靠性方面取得了显著进步。

Gemini与AI幻觉

Reddit r/artificial

讨论Google Gemini模型中的AI幻觉问题,突出大型语言模型在可靠性和准确性方面的挑战。

AI幻觉可能比人类更“人性”

Reddit r/artificial

文章指出,AI幻觉其实映射了人类的认知偏差——确认偏误、过度自信等,它们并非纯粹的技术缺陷,而是像人类一样在知识缺口处“脑补”的结果。

Gemini 4 Argon 解决了幻觉问题。

Reddit r/singularity

该帖子声称 Google 的 Gemini 4 Argon 似乎已经有效解决了幻觉问题,暗示该模型在可靠性方面实现了重大突破。

幻觉 = 想象力

Reddit r/ArtificialInteligence

一位开发者在构建AI代理封装系统时发现,代理对用户回复的幻觉实际上有助于解决问题,并提议将此类幻觉视为想象中的事件而非错误。