@dair_ai: 来自谷歌的新研究。LLMs 以高置信度产生幻觉,忽视自身知识边界,并错误报告不确定性…

X AI KOLs Timeline 论文

摘要

一篇新的研究论文介绍了 RLMF(Reinforcement Learning with Metacognitive Feedback),一种两阶段方法,利用模型自身的自我判断来校准置信度并忠实地表达不确定性,在保持准确性的同时,在多种任务上实现了最先进的校准,并且比标准 RL 提升了高达 63%。

来自谷歌的新研究。 LLMs 以高置信度产生幻觉,忽视自身知识边界,并错误报告不确定性。大多数修复方法只是从外部强行添加校准机制。 RLMF 将模型自身的元认知转化为训练信号。它在偏好优化过程中,根据模型对自身表现优劣的自我判断来优化完成排名,并利用这些自我判断来选择高价值的训练数据。 该方法分为两个阶段。首先校准自我报告置信度的忠实性,然后通过针对性的输出编辑将其映射到自然语言的不确定性表达。 RLMF 在多种任务上实现了最先进的忠实校准,同时保持准确性,并且比标准 RL 提升了高达 63%。 论文:https://arxiv.org/abs/2606.32032 在我们的学院中学习构建有效的 AI 智能体:https://academy.dair.ai
查看原文
查看缓存全文

缓存时间: 2026/07/02 04:17

来自谷歌的新研究。LLM会以高置信度产生幻觉,错失自身知识边界,并错误报告不确定性。大多数修复方法从外部进行校准。RLMF 将模型自身的元认知作为训练信号。它在偏好优化过程中,根据模型自我判断其表现的质量来优化补全排名,并使用相同的自我判断来选择高价值的训练数据。该方法分为两个阶段。首先校准自我报告置信度的忠实性,然后通过目标输出编辑将其映射到自然语言的不确定性。RLMF 在多种任务中实现了最先进的忠实校准,同时保持了准确性,并且比标准 RL 提升了高达 63%。论文:https://arxiv.org/abs/2606.32032 在我们的学院学习构建有效的 AI 智能体:https://academy.dair.ai — # 基于元认知反馈的强化学习激发 LLM 的忠实不确定性表达 来源:https://arxiv.org/html/2606.32032 Gabrielle Kaili-May Liu1Avi Caciularu2Gal Yona2Idan Szpektor2Arman Cohan1 1 耶鲁大学2谷歌研究 {kaili.liu, arman.cohan}@yale.edu ###### 摘要 元认知是智能的一个关键组成部分,描述了个体监控和调节自身认知过程的能力。然而,LLM 在关键的元认知能力方面存在系统性缺陷:它们以高置信度产生幻觉,无法识别知识边界,并错误表达其内在不确定性——这削弱了可信度和可靠性。由于监控任务表现并根据表现调整行为是元认知的核心,我们假设能够准确判断自身表现的模型更有可能改进其表现。我们通过两种新颖的机制来实践这一想法:基于元认知反馈的强化学习(RLMF),这是一种在偏好优化过程中根据模型自我判断其表现的质量来优化补全排名的范式;以及元认知数据选择,它使用类似的自我判断来识别高价值的训练样本,其性能优于朴素的主动学习。我们将这些创新应用于忠实校准(FC)问题,该任务本身从根本上就是元认知的:其目标是将表达的不确定性与内在不确定性对齐,即使对于最先进的 LLM 来说这也很难。我们采用了一种两阶段、解耦的方法,首先使用这些方法校准模型自我报告置信度分数的忠实性,然后通过目标输出编辑将其映射到自然、可适应上下文的语言不确定性。大量实验表明,RLMF 在多种任务中实现了可泛化的、最先进的 FC,同时保持了准确性。此外,RLMF 比标准 RL 提升了高达 63%,同时增强了模型评估和表达自身能力边界的能力。这使 RLMF 成为一种有前景的范式,可以增强 LLM 的元认知,从而提高能力和对齐性,并表明元认知表现可以作为有效的 RL 信号,克服先前内在反馈方法的局限性。111我们的代码发布于https://github.com/yale-nlp/RLMF。 ## 1 引言 元认知是智能的一个基础组成部分,指的是监控、评估和调节自身认知过程的能力[23 (https://arxiv.org/html/2606.32032#bib.bib23)]。它对于有效学习、决策和沟通至关重要,并且越来越被认为是能力强、透明的人工智能系统的基石[88 (https://arxiv.org/html/2606.32032#bib.bib88)]。尽管如此,LLM 仍然表现出关键的元认知缺陷,包括无法识别知识边界[89 (https://arxiv.org/html/2606.32032#bib.bib89)]、高置信度幻觉的倾向[83 (https://arxiv.org/html/2606.32032#bib.bib83)],以及系统性地错误表达其内在不确定性[113 (https://arxiv.org/html/2606.32032#bib.bib113),62 (https://arxiv.org/html/2606.32032#bib.bib62)]。这种缺乏稳健元认知能力的情况削弱了可信度和可靠性,尤其是在模型被部署到高风险的下游咨询角色中时,例如科学发现[85 (https://arxiv.org/html/2606.32032#bib.bib85),122 (https://arxiv.org/html/2606.32032#bib.bib122)]、医疗诊断[46 (https://arxiv.org/html/2606.32032#bib.bib46),130 (https://arxiv.org/html/2606.32032#bib.bib130)]和法律咨询[15 (https://arxiv.org/html/2606.32032#bib.bib15),55 (https://arxiv.org/html/2606.32032#bib.bib55)]。由于监控任务表现并根据表现调整行为是元认知的核心,我们假设能够准确判断自身表现的模型更有可能改进其表现,这使得元认知信号成为后训练期间监督的自然来源。具体来说,我们提出利用元认知表现作为 LLM 的额外训练信号——将元认知意识编码到模型中,同时提高任务表现。 参见图注 Figure 1: RLMF 概述,结合元认知数据选择和目标重写,以忠实校准 LLM 数值和语言表达的不确定性。 我们通过两种新颖的机制(图1 (https://arxiv.org/html/2606.32032#S1.F1))来实践这一想法。首先,我们引入了基于元认知反馈的强化学习(RLMF),这是一种训练范式,模型不仅因产生强大的输出而获得奖励,还因准确判断其输出表现如何而获得奖励。RLMF 建立在先前工作的基础上,这些工作表明内在置信度信号可以作为有效的 RL 奖励,但 RLMF 在更高的抽象层次上运作,利用模型对自身表现评估的质量,而不是简单的输出置信度。具体来说,我们引入了一种新颖的元认知优势缩放机制:在 RL 训练期间,我们使用模型自我判断的准确性来缩放每个补全的优势,即决定该补全相对于其他采样补全被强化的程度的学习信号。为了补充 RLMF,我们还提出了元认知数据选择,它使用模型的自我评估来选择信息丰富的训练样本:候选样本根据模型认为自身表现的好坏进行评分,并从该谱系的高分和低分两端选择样本进行训练,因为每一端都提供了互补的学习信号。我们通过将这些创新应用于忠实校准(FC)问题来展示其有效性,该任务本身是元认知的:目标是使模型能够表达真实反映其(估计的)内在置信度的不确定性,即使对于前沿 LLM 来说也是一个挑战[62 (https://arxiv.org/html/2606.32032#bib.bib62),24 (https://arxiv.org/html/2606.32032#bib.bib24),61 (https://arxiv.org/html/2606.32032#bib.bib61)]。FC 与更常研究的事实校准问题不同,事实校准是将置信度与经验准确性对齐[103 (https://arxiv.org/html/2606.32032#bib.bib103)]:一个模型可能看起来事实校准良好,但其内部信念可能仍不一致。FC 捕获了这一关键的失败模式,以校准用户依赖并提高可信度。然而,据我们所知,FC 在很大程度上尚未解决,现有方法在范围和可泛化性上有限,并且没有一种方法整体上同时解决数值和语言不确定性。为了实现 LLM 的端到端 FC,我们提出了一个两阶段框架。首先,应用 RLMF 和元认知数据选择来校准模型自我报告句子级置信度分数的忠实性。然后,我们将这些忠实的数值分数转换为自然且可适应上下文的语言不确定性,通过将每个分数映射到适当的模糊限制语并修改响应以保持连贯性和流畅性。这为用户校准对模型输出的依赖提供了一种更可信[124 (https://arxiv.org/html/2606.32032#bib.bib124)]且更符合人性[5 (https://arxiv.org/html/2606.32032#bib.bib5)]的媒介。此外,这两个阶段在设计上是解耦的:阶段 1 可以运行一次,而阶段 2 可以适应不同的用户偏好和上下文,无需重复昂贵的 RL 训练。在多个 LLM 和跨越 6 个以上内容领域的 10 个任务上的评估表明,我们的框架实现了最先进的 FC,尽管仅在单个数据集上训练,但在任务之间表现稳健,同时保持了任务准确性和事实校准,这与之前的方法不同。消融研究验证了我们元认知方法的贡献及其相对于各自基线的优越性。我们证明了 RLMF 提高了模型在目标任务上自我评估表现的能力。系统化的人工评估进一步表明,在跨不同任务和用户偏好的语言不确定性的多样性、自然性、有用性和上下文适宜性方面,相对于最强基线平均有 96% 的胜率。总结如下: 1. 我们引入了基于元认知反馈的强化学习(RLMF),这是一种新颖的范式,在偏好优化期间根据模型自我判断其表现的质量来优化补全排名,这将后训练结果比标准 RL 提高了高达 63%,同时赋予了模型改进的元认知意识。 2. 我们建立了首个端到端管道,用于忠实校准 LLM 发出的数值语言不确定性表达,在模型和任务上取得了最先进的结果。 3. 我们表明,模型的自我评估表现可以用来策划有效的训练数据(我们称之为元认知数据选择),其性能优于朴素的和主动学习风格的选择模型处理不佳的样本。 4. 我们开发了一种原则性的、符合人类认知的从数值置信度到语言置信度的映射方法,提高了 LLM 不确定性沟通的自然性和适应性。 ## 2 相关工作 ##### LLM 中的元认知。 元认知——监控和控制自身认知过程的能力[23 (https://arxiv.org/html/2606.32032#bib.bib23)]——是认知、学习和不确定性沟通的核心组成部分[88 (https://arxiv.org/html/2606.32032#bib.bib88)]。LLM 在这方面存在的缺陷已在各种任务中被注意到[31 (https://arxiv.org/html/2606.32032#bib.bib31),125 (https://arxiv.org/html/2606.32032#bib.bib125),41 (https://arxiv.org/html/2606.32032#bib.bib41)],并且被假设是幻觉和其他不一致表达的主要成因。尽管其重要性,LLM 中的元认知直到最近才受到关注[73 (https://arxiv.org/html/2606.32032#bib.bib73),78 (https://arxiv.org/html/2606.32032#bib.bib78)],少数研究表明元认知方法可以改善下游性能[62 (https://arxiv.org/html/2606.32032#bib.bib62),18 (https://arxiv.org/html/2606.32032#bib.bib18),95 (https://arxiv.org/html/2606.32032#bib.bib95),101 (https://arxiv.org/html/2606.32032#bib.bib101),131 (https://arxiv.org/html/2606.32032#bib.bib131)]。我们基于这些进展,提出在 RL 中优先考虑模型表现出更强元认知能力的补全,但前提是首先满足任务级别的奖励信号。我们的假设是,如果一个模型能够学会预测其在目标任务上的表现(这是一种通过候选补全排名方式强化的技能),那么它也能获取关于如何调整其生成以获得更好表现的隐含信号。正如我们将展示的,这种机制不仅加强了后训练结果,而且同时提高了模型识别和表达自身能力水平的能力,向更好的元认知监控和对齐迈进了一步。 ##### 基于内部反馈的强化学习。 自从基于人类反馈的强化学习出现以来[74 (https://arxiv.org/html/2606.32032#bib.bib74),52 (https://arxiv.org/html/2606.32032#bib.bib52)],出现了多种方法来设计更有效、更有针对性的 LLM RL 奖励信号。最近一类方法是基于内部反馈的 RL[121 (https://arxiv.org/html/2606.32032#bib.bib121),123 (https://arxiv.org/html/2606.32032#bib.bib123)],它利用来自模型本身的无监督奖励信号,绕过对外部昂贵反馈的需求。使用内部置信度信号[54 (https://arxiv.org/html/2606.32032#bib.bib54),97 (https://arxiv.org/html/2606.32032#bib.bib97),116 (https://arxiv.org/html/2606.32032#bib.bib116)],如自我确定性[127 (https://arxiv.org/html/2606.32032#bib.bib127),57 (https://arxiv.org/html/2606.32032#bib.bib57)]或熵[1 (https://arxiv.org/html/2606.32032#bib.bib1)],作为奖励在改善事实校准方面特别有效,此外还有直接调整校准指标(如 Brier 分数)进行显式优化的方法[59 (https://arxiv.org/html/2606.32032#bib.bib59),86 (https://arxiv.org/html/2606.32032#bib.bib86),16 (https://arxiv.org/html/2606.32032#bib.bib16)]。进一步的研究考虑了将 GRPO[79 (https://arxiv.org/html/2606.32032#bib.bib79)] 的优势乘以由置信度信号[13 (https://arxiv.org/html/2606.32032#bib.bib13),63 (https://arxiv.org/html/2606.32032#bib.bib63),118 (https://arxiv.org/html/2606.32032#bib.bib118),104 (https://arxiv.org/html/2606.32032#bib.bib104)](如语义熵)导出的标量值。受这些研究的启发,我们提出利用元认知表现作为额外的反馈信号,在 RL 训练期间对补全进行优先排序,并将 RL 应用于忠实校准。据我们所知,这标志着首次在 LLM 的 RL 中使用这种元认知反馈。我们强调基于元认知反馈的强化学习(RLMF)是一种有前景的新方法,其性能优于标准 RL,并赋予模型更好的元认知意识。 ##### LLM 的忠实校准。 模型可能看起来事实校准良好,但其内部信念仍可能不一致[113 (https://arxiv.org/html/2606.32032#bib.bib113),25 (https://arxiv.org/html/2606.32032#bib.bib25),62 (https://arxiv.org/html/2606.32032#bib.bib62),24 (https://arxiv.org/html/2606.32032#bib.bib24),61 (https://arxiv.org/html/2606.32032#bib.bib61)]。这种缺乏忠实校准(FC)的情况给用户依赖和 AI 工具的安全使用带来了风险[129 (https://arxiv.org/html/2606.32032#bib.bib129)]。现有理解、基准测试和改进 FC 的努力只关注了语言不确定性。然而,这些方法只产生了适度的改进,并且在范围和适用性上有限。元认知提示[62 (https://arxiv.org/html/2606.32032#bib.bib62)]依赖于指令遵循,会降低任务准确性;引导方法[42 (https://arxiv.org/html/2606.32032#bib.bib42)]仅限于开放权重模型,并且依赖于预定义的探针,限制了在新上下文中的可扩展性;以及使用简化的句子模板进行 SFT[20 (https://arxiv.org/html/2606.32032#bib.bib20)] 限制了泛化和语言多样性,同时产生了不自然、重复的结构。至关重要的是,这些工作都没有解决忠实的数值不确定性,尽管自我报告的置信度分数作为输出可靠性的易于解释的信号非常有用。它们也没有考虑模糊限制语在整个生成文本中的自然性和连贯性,这在长文本场景中很重要。一个令人满意的解决方案必须超越简单的逐句模糊限制,动态地改变不确定性在回应中表达的方式,反映人类如何在语域中调整模糊策略。我们解决了这些不足,以实现

相似文章

大语言模型对其自身回应过度自信

Hugging Face Daily Papers

本文探究为何经过指令微调的大语言模型对其自身回应表现出过度自信,并识别出一种“所有权偏差”,即模型对自我生成的答案赋予更高置信度。文章提出一种简单的推理时策略,将模型答案重新表述为用户输入,无需重新训练即可将校准度提升高达26%。