@rohanpaul_ai: 谷歌新论文称LLMs应停止假装确定,而是清楚地表明不确定。幻觉…
摘要
一篇新的谷歌论文认为,LLMs应侧重于诚实表达不确定性,而非追求完美的事实性,并提出“忠实的不确定性”以建立信任。
查看缓存全文
缓存时间: 2026/05/26 20:57
谷歌最新论文指出,大型语言模型应停止假装确定性,转而清晰展示自身的不确定性。
“幻觉“的问题不在于机器会犯错,而在于机器在应该犹豫时却表现得过于确定。
这一区分改变了问题的核心目标。
该论文将目标从“让模型绝对正确“转向“让模型对自己的不确定性保持诚实“。
多年来,显而易见的目标一直是让语言模型掌握更多知识,从而减少事实性错误。
绝对的正确性或许极难实现,但一个能明确区分“我知道这个“和“我在猜测“的模型,依然能在不悄然破坏信任的前提下保持实用价值。
论文认为,更困难的缺失技能不是知识,而是自我认知。
一个模型可能在宏观上校准良好,知道类似答案的正确率约为60%,却仍无法识别出哪个具体答案存在风险。
这正是陷阱所在:为了消除错误,系统必须拒绝许多本可能正确的答案。
作者将这种现象称为“效用税“,它解释了为什么产品一再倾向于自信的实用性而非谨慎的真实性。
关键点在这里。
包裹在诚实不确定性中的错误答案,与以事实形式输出的错误答案,在社会语境上完全不同。
它给用户传达了不同的指令:请验证此信息,将其视为临时性的,不要过分依赖它。
论文提出的解决方案是“忠实的不确定性“,即模型的语言应反映其内部置信度,而不是将怀疑平滑为权威语气。
对于AI智能体而言,这一点更为重要,因为不确定性恰恰是决定何时搜索、何时信任某一来源、以及何时停止的关键。
工具扩展了模型可获取的范围,但元认知决定了这些获取是否被明智地使用。
论文链接 – arxiv. org/abs/2605.01428v1
论文标题:“幻觉破坏信任;元认知是前进之路”
相似文章
@dair_ai: 来自谷歌的新研究。LLMs 以高置信度产生幻觉,忽视自身知识边界,并错误报告不确定性…
一篇新的研究论文介绍了 RLMF(Reinforcement Learning with Metacognitive Feedback),一种两阶段方法,利用模型自身的自我判断来校准置信度并忠实地表达不确定性,在保持准确性的同时,在多种任务上实现了最先进的校准,并且比标准 RL 提升了高达 63%。
LLMs知道自己何时出错。我对Anthropic的新“全局工作空间”论文进行了一项修复 [R]
作者提出了一种方法,通过使用中间层状态的线性探测器和一个小型训练桥接器将置信度对数进行校准,使LLMs能够表达校准后的置信度,仅需200个标注样本,无需修改权重。这与Anthropic的全局工作空间论文相关,该论文解释了“知道-说出”差距。
大型语言模型能否对检索到的信息保持审慎态度?
本文研究了大型语言模型如何适应检索信息的确定程度,指出了其在处理不确定性方面的系统性局限。论文提出了一种交互策略,在不修改模型权重的前提下,将顺从错误降低了 25%。
LLM的未来发展方向
文章讨论了为何LLM无法从用户交互中学习,且缺乏确定性的真值层,提出动态知识图谱可以减少幻觉并在医学等高风险领域提升性能。
观点:大型语言模型中的不确定性量化仅是无监督聚类
这篇观点论文认为,当前大型语言模型的不确定性量化方法本质上属于无监督聚类,测量的是内部一致性而非外部正确性,因此无法检测出自信的幻觉。作者主张进行范式转变,将不确定性建立在客观真理之上。