基于元认知反馈的强化学习激发大语言模型中的忠实不确定性表达

Hugging Face Daily Papers 论文

摘要

本文介绍了基于元认知反馈的强化学习(RLMF)和元认知数据选择,以改进大语言模型的校准,实现内部不确定性的忠实表达,并比标准强化学习提升高达63%。

元认知是智能的关键组成部分,描述了监控和调节自身认知过程的能力。然而,大语言模型在关键的元认知能力上存在系统性缺陷:它们以高置信度产生幻觉,无法识别知识边界,并歪曲其内部不确定性——从而损害了可信赖性和可靠性。由于监控任务表现并相应调整行为是元认知的核心,我们提出,能够准确判断自身表现的模型更有可能改进其表现。我们通过两种新颖机制实现了这一想法:基于元认知反馈的强化学习(RLMF),这是一种在偏好优化期间根据模型自我判断的质量来完善完成排序的范式;以及元认知数据选择,它使用类似的自我判断来识别高价值训练样本,优于单纯的主动学习。我们将这些创新应用于忠实校准(FC)问题,该任务本身在本质上就是元认知的:目标是将表达的不确定性与内在不确定性对齐,即使对于前沿大语言模型来说也很困难。我们采用了一种两阶段解耦方法,首先使用这些方法来校准模型自我报告置信度的忠实性,然后通过有针对性的输出编辑映射到自然的、可适应上下文的语言不确定性。大量实验表明,RLMF在保持准确性的同时,在各种任务上实现了可推广的最先进的FC。此外,RLMF比标准RL提升了高达63%,同时增强了模型评估和表达自身能力极限的能力。这使得RLMF成为一种有前景的范式,用于增强大语言模型的元认知能力,以提升能力和对齐性,并表明元认知表现可以作为有效的强化学习信号来克服先前内在反馈方法的局限性。
查看原文
查看缓存全文

缓存时间: 2026/07/01 07:41

论文页面 - 通过元认知反馈的强化学习引发大语言模型的忠实不确定性表达

来源:https://huggingface.co/papers/2606.32032

摘要

通过元认知反馈和元认知数据选择的强化学习,使大语言模型能够准确自我评估性能与不确定性,从而提升其校准能力。

元认知是智能的关键组成部分,描述了个体监控和调节自身认知过程的能力。然而,大语言模型在核心元认知功能上存在系统性缺陷:它们会以高置信度产生幻觉,无法识别知识边界,并且歪曲自身内在的不确定性——这破坏了可信度与可靠性。由于监控任务表现并据此调整行为是元认知的核心,我们假设能够准确判断自身表现的模型更有可能改进表现。我们通过两种新颖机制将这一想法付诸实践:基于元认知反馈的强化学习(RLMF),该范式在偏好优化过程中根据模型对自身表现判断的质量来优化完成结果排序;以及元认知数据选择,该方法利用类似的自我判断来识别高价值训练样本,性能优于朴素的主动学习。我们将这些创新应用于忠实校准(FC)问题,该任务本身从根本上就是元认知性的:目标是使表达的不确定性与内在不确定性对齐,即使是前沿大语言模型也难以做到。我们采用解耦的两阶段方法,首先使用这些方法来校准模型自我报告置信度分数的忠实性,然后通过针对性的输出编辑将其映射到自然的、可适应上下文的语言不确定性。大量实验表明,RLMF 能在多种任务上实现可泛化的、最先进的 FC,同时保持准确性。此外,RLMF 相比标准强化学习可提升多达 63%,同时增强了模型评估和表达自身能力极限的能力。这使得 RLMF 成为一种有前景的范式,用于增强大语言模型的元认知,以改进能力和对齐性,并表明元认知表现可以作为有效的强化学习信号,克服以往内在反馈方法的局限性。

查看 arXiv 页面 (https://arxiv.org/abs/2606.32032)
查看 PDF (https://arxiv.org/pdf/2606.32032)
GitHub0 (https://github.com/yale-nlp/RLMF)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.32032)

在您的代理中获取此论文:

hf papers read 2606.32032

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2606.32032 即可从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.32032 即可从此页面链接。

引用此论文的 Space0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2606.32032 即可从此页面链接。

包含此论文的合集1

相似文章

当正确信念崩溃时:临床压力下LLMs的认知韧性

arXiv cs.AI

本文研究了大型语言模型在临床环境中面对对抗性压力时如何维持正确信念,提出了R-FT微调方法以在平衡可纠正性的同时提升认知韧性,并在医学基准测试中展示了显著的鲁棒性提升。

检索增强的语言校准

arXiv cs.CL

本文提出检索增强的语言校准(RALC),一种事后流水线方法,通过将语言置信度建模为分布并使用检索增强重写来校准大语言模型中的置信度信号。它引入了忠实度散度指标,并在多个基准测试中展示了显著改进。