@rohanpaul_ai: 谷歌新论文称LLMs应停止假装确定,而是清楚地表明不确定。幻觉…

X AI KOLs Following 论文

摘要

一篇新的谷歌论文认为,LLMs应侧重于诚实表达不确定性,而非追求完美的事实性,并提出“忠实的不确定性”以建立信任。

谷歌新论文称LLMs应停止假装确定,而是清楚地表明不确定。 幻觉与其说是机器犯错,不如说是机器在应该犹豫时听起来过于确定。 这一区别改变了目标问题。 该论文将目标从让模型完美符合事实转变为让模型诚实面对自身的不确定性。 多年来,显而易见的目标是让语言模型知道更多,从而减少事实错误。 完美的事实性可能非常困难,但一个能清晰区分“我知道这个”和“我在猜测”的模型,可以在不悄悄损害信任的情况下保持有用。 这篇论文认为,更难的缺失技能不是知识,而是自我认知。 一个模型可以在广义上校准良好,知道像这样的答案大约有60%的正确率,但仍然无法识别哪个具体答案是危险的。 这就是陷阱:要消除错误,系统必须拒绝许多本来正确的答案。 作者称之为效用税,这解释了为什么产品总是倾向于自信的实用性,而不是谨慎的真实性。 关键点在于: 一个包裹在诚实不确定性中的错误答案,与一个作为事实给出的错误答案,不是同一种社会对象。 它给用户一个不同的指令:验证这个,把它当作临时的,不要过分依赖它。 提出的解决方案是“忠实的不确定性”,即模型的语言反映其内部置信度,而不是将怀疑平滑成权威。 对于智能体来说,这变得更加重要,因为不确定性决定了何时搜索、何时信任某个来源、何时停止。 工具扩展了模型可以访问的内容,但元认知决定了访问是否被明智地使用。 ---- 论文链接 – arxiv.org/abs/2605.01428v1 论文标题:“幻觉破坏信任;元认知是前进之路”
查看原文
查看缓存全文

缓存时间: 2026/05/26 20:57

谷歌最新论文指出,大型语言模型应停止假装确定性,转而清晰展示自身的不确定性。

“幻觉“的问题不在于机器会犯错,而在于机器在应该犹豫时却表现得过于确定。

这一区分改变了问题的核心目标。

该论文将目标从“让模型绝对正确“转向“让模型对自己的不确定性保持诚实“。

多年来,显而易见的目标一直是让语言模型掌握更多知识,从而减少事实性错误。

绝对的正确性或许极难实现,但一个能明确区分“我知道这个“和“我在猜测“的模型,依然能在不悄然破坏信任的前提下保持实用价值。

论文认为,更困难的缺失技能不是知识,而是自我认知。

一个模型可能在宏观上校准良好,知道类似答案的正确率约为60%,却仍无法识别出哪个具体答案存在风险。

这正是陷阱所在:为了消除错误,系统必须拒绝许多本可能正确的答案。

作者将这种现象称为“效用税“,它解释了为什么产品一再倾向于自信的实用性而非谨慎的真实性。

关键点在这里。

包裹在诚实不确定性中的错误答案,与以事实形式输出的错误答案,在社会语境上完全不同。

它给用户传达了不同的指令:请验证此信息,将其视为临时性的,不要过分依赖它。

论文提出的解决方案是“忠实的不确定性“,即模型的语言应反映其内部置信度,而不是将怀疑平滑为权威语气。

对于AI智能体而言,这一点更为重要,因为不确定性恰恰是决定何时搜索、何时信任某一来源、以及何时停止的关键。

工具扩展了模型可获取的范围,但元认知决定了这些获取是否被明智地使用。


论文链接 – arxiv. org/abs/2605.01428v1

论文标题:“幻觉破坏信任;元认知是前进之路”

相似文章

LLM的未来发展方向

Reddit r/artificial

文章讨论了为何LLM无法从用户交互中学习,且缺乏确定性的真值层,提出动态知识图谱可以减少幻觉并在医学等高风险领域提升性能。

观点:大型语言模型中的不确定性量化仅是无监督聚类

arXiv cs.CL

这篇观点论文认为,当前大型语言模型的不确定性量化方法本质上属于无监督聚类,测量的是内部一致性而非外部正确性,因此无法检测出自信的幻觉。作者主张进行范式转变,将不确定性建立在客观真理之上。