基于元认知反馈的强化学习激发大语言模型中的忠实不确定性表达
摘要
本文介绍了基于元认知反馈的强化学习(RLMF)和元认知数据选择,以改进大语言模型的校准,实现内部不确定性的忠实表达,并比标准强化学习提升高达63%。
查看缓存全文
缓存时间: 2026/07/01 07:41
论文页面 - 通过元认知反馈的强化学习引发大语言模型的忠实不确定性表达
来源:https://huggingface.co/papers/2606.32032
摘要
通过元认知反馈和元认知数据选择的强化学习,使大语言模型能够准确自我评估性能与不确定性,从而提升其校准能力。
元认知是智能的关键组成部分,描述了个体监控和调节自身认知过程的能力。然而,大语言模型在核心元认知功能上存在系统性缺陷:它们会以高置信度产生幻觉,无法识别知识边界,并且歪曲自身内在的不确定性——这破坏了可信度与可靠性。由于监控任务表现并据此调整行为是元认知的核心,我们假设能够准确判断自身表现的模型更有可能改进表现。我们通过两种新颖机制将这一想法付诸实践:基于元认知反馈的强化学习(RLMF),该范式在偏好优化过程中根据模型对自身表现判断的质量来优化完成结果排序;以及元认知数据选择,该方法利用类似的自我判断来识别高价值训练样本,性能优于朴素的主动学习。我们将这些创新应用于忠实校准(FC)问题,该任务本身从根本上就是元认知性的:目标是使表达的不确定性与内在不确定性对齐,即使是前沿大语言模型也难以做到。我们采用解耦的两阶段方法,首先使用这些方法来校准模型自我报告置信度分数的忠实性,然后通过针对性的输出编辑将其映射到自然的、可适应上下文的语言不确定性。大量实验表明,RLMF 能在多种任务上实现可泛化的、最先进的 FC,同时保持准确性。此外,RLMF 相比标准强化学习可提升多达 63%,同时增强了模型评估和表达自身能力极限的能力。这使得 RLMF 成为一种有前景的范式,用于增强大语言模型的元认知,以改进能力和对齐性,并表明元认知表现可以作为有效的强化学习信号,克服以往内在反馈方法的局限性。
查看 arXiv 页面 (https://arxiv.org/abs/2606.32032)
查看 PDF (https://arxiv.org/pdf/2606.32032)
GitHub0 (https://github.com/yale-nlp/RLMF)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.32032)
在您的代理中获取此论文:
hf papers read 2606.32032
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.32032 即可从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.32032 即可从此页面链接。
引用此论文的 Space0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2606.32032 即可从此页面链接。
包含此论文的合集1
相似文章
@dair_ai: 来自谷歌的新研究。LLMs 以高置信度产生幻觉,忽视自身知识边界,并错误报告不确定性…
一篇新的研究论文介绍了 RLMF(Reinforcement Learning with Metacognitive Feedback),一种两阶段方法,利用模型自身的自我判断来校准置信度并忠实地表达不确定性,在保持准确性的同时,在多种任务上实现了最先进的校准,并且比标准 RL 提升了高达 63%。
当正确信念崩溃时:临床压力下LLMs的认知韧性
本文研究了大型语言模型在临床环境中面对对抗性压力时如何维持正确信念,提出了R-FT微调方法以在平衡可纠正性的同时提升认知韧性,并在医学基准测试中展示了显著的鲁棒性提升。
检索增强的语言校准
本文提出检索增强的语言校准(RALC),一种事后流水线方法,通过将语言置信度建模为分布并使用检索增强重写来校准大语言模型中的置信度信号。它引入了忠实度散度指标,并在多个基准测试中展示了显著改进。
大语言模型不确定性中的人类对齐、校准与激活模式
本文研究大语言模型的不确定性与人类不确定性的相似程度,探讨LLMs在多个数据集上的对齐、校准和激活模式,以及指令微调的影响。
@ethantsliu:meta-rl 引发代理式 LLM 探索 传统强化学习训练 LLM 代理使用固定策略,难以进行主动探索……
一篇新的研究论文将 LLM 代理训练重新定义为跨回合的 Meta-RL 问题,使用无评论家策略梯度实现在上下文中的适应,而无需梯度更新。LAMER 框架在长时程任务上相比标准 RL 基线将测试时性能提升了 11-19%,并且能更好地泛化到未见过的环境。