大语言模型对其自身回应过度自信

Hugging Face Daily Papers 论文

摘要

本文探究为何经过指令微调的大语言模型对其自身回应表现出过度自信,并识别出一种“所有权偏差”,即模型对自我生成的答案赋予更高置信度。文章提出一种简单的推理时策略,将模型答案重新表述为用户输入,无需重新训练即可将校准度提升高达26%。

先前研究表明,经过指令微调的大语言模型校准度低于其基础预训练版本。然而,关于对话式大语言模型中常用的聊天模板对校准度的影响,我们知之甚少。本研究通过分离后训练算法和聊天格式的影响,探究了导致这种校准偏差的机制。我们发现,指令微调从根本上损害了校准度,而聊天模板通过一种“所有权偏差”进一步加剧了问题——模型对自己答案的置信度显著高于对用户提供的相同答案的置信度。在六个近期开源大语言模型、三个基准测试以及三种置信度获取方法上的大量实验表明,模型对自身回应的置信度可高出高达26%。基于这一发现,我们提出一种简单的推理时策略:在获取置信度时将模型答案框架化为用户输入。这种方法显著降低了过度自信,并将校准度提升高达26%,且无需重新训练,从而缩小了基础模型与指令微调模型之间的差距。
查看原文
查看缓存全文

缓存时间: 2026/06/11 13:37

论文页面 - 大型语言模型对自己的回答过度自信

来源:https://huggingface.co/papers/2606.03437

摘要

指令微调会降低大型语言模型的校准能力,而聊天模板通过所有权偏差加剧了过度自信问题——将模型回答在置信度评估时重新表述为用户输入可缓解此现象。

先前研究表明,经过指令微调的大型语言模型(https://huggingface.co/papers?q=instruction-tuned%20large%20language%models)(LLMs)的校准性不如其基础预训练版本。然而,关于广泛使用的聊天模板(https://huggingface.co/papers?q=chat%20template)对对话型LLM校准(https://huggingface.co/papers?q=calibration)的影响知之甚少。在本工作中,我们通过解耦后训练算法与聊天格式的影响,探究导致这种校准偏差的机制。我们发现,尽管指令微调从根本上损害了校准能力,但聊天模板(https://huggingface.co/papers?q=chat%20template)通过一种“所有权偏差”(https://huggingface.co/papers?q=ownership%20bias)加剧了该问题——模型对自己答案的置信度显著高于用户提供的相同答案。在六个近期开源权重LLM、三个基准测试以及三种置信度激发(https://huggingface.co/papers?q=confidence%20elicitation)方法上的大量实验表明,模型对自己回答分配的置信度高出高达26%。利用这一发现,我们提出一种简单的推理阶段策略:在置信度激发(https://huggingface.co/papers?q=confidence%20elicitation)时将模型的回答视为用户输入。该方法显著降低了过度自信(https://huggingface.co/papers?q=overconfidence),并将校准能力提升最多26%,而无需重新训练(https://huggingface.co/papers?q=retraining),缩小了基础模型与指令微调模型之间的差距。

查看 arXiv 页面(https://arxiv.org/abs/2606.03437)查看 PDF(https://arxiv.org/pdf/2606.03437)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.03437)

在你的代理中获取此论文:

hf papers read 2606\.03437

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

请在一个模型的 README.md 中引用 arxiv.org/abs/2606.03437,以便从本页面链接。

引用此论文的数据集0

没有数据集链接此论文

请在一个数据集的 README.md 中引用 arxiv.org/abs/2606.03437,以便从本页面链接。

引用此论文的 Space0

没有 Space 链接此论文

请在一个 Space 的 README.md 中引用 arxiv.org/abs/2606.03437,以便从本页面链接。

包含此论文的合集0

没有包含此论文的合集

请将此论文添加到一个合集(https://huggingface.co/new-collection)中,以便从本页面链接。

相似文章

大型语言模型中的置信度校准

arXiv cs.AI

本文分析了11个主流大型语言模型的置信度校准情况,发现它们普遍过于自信,尤其在困难任务上,而在简单任务上则信心不足。文章引入了LifeEval,这是一个用于评估不同难度级别下校准效果的测试。

幻觉作为承诺失败:大型语言模型在知晓答案的情况下仍然犯错

arXiv cs.CL

本文研究了大型语言模型在其生成时间分布中已有正确答案时仍产生幻觉的现象。通过引入答案可用性的语义概念,作者表明16-47%的指令调优模型幻觉发生在正确概念已经表示的情况下,并且这一比例随着模型规模增加而上升。他们指出,指令调优强化了答案承诺,使得有用性和自信幻觉成为同一枚硬币的两面。

一种更优的识别大语言模型过度自信的方法

MIT News — Artificial Intelligence

MIT研究人员开发了一种新方法,通过衡量相似模型间的跨模型分歧来识别过度自信的LLM,而非仅依赖自洽性指标。该方法能更好地捕捉认知不确定性,并在高风险应用中更准确地识别出不可靠的预测。