LLM预测模型知道但不说的话:探测内部表征以实现校准和忠实性
摘要
本文探测LLM预测模型的内部表征,以改进校准并评估思维链推理的忠实性。研究发现,探针能够实现更好的校准,并充当谎言检测器。
arXiv:2607.08046v1 公告类型:新
摘要:经过微调用于预测的大型语言模型可以准确但校准不佳,其思维链(CoT)推理可能无法忠实反映预测背后的证据。我们询问内部表征是否为两者提供了更直接的窗口。与Eternis-Forecaster 8B在OpenForesight上合作,我们在中间激活上训练表征池化探针,发现它们实现了显著更好的校准;这一结果也适用于GLM-4.7-Flash和GLM-4.5-Air。然后,我们通过证据消融和干扰注入来评估CoT忠实性:移除提示中的一个有影响力的来源通常会改变模型的预测,同时保持推理轨迹不变。相同的探针充当谎言检测器:它们的激活追踪行为变化远好于推理轨迹,并且在84%的情况下预测变化方向,包括当CoT隐藏了扰动的影响时。最后,强制回答表明预测在推理开始之前就已基本固定:单次推理前传递即可恢复已确定的答案和置信度,根据这种预设答案分布的分散程度对问题进行路由节省了30-47%的生成令牌,且不损失准确性。总之,这些结果将探测内部表征确立为校准、审计和分类语言模型预测模型及更广泛推理模型的实用工具。
查看缓存全文
缓存时间: 2026/07/10 06:12
# 大型语言模型预测器知道但不说的话:探究内部表征以实现校准与忠实性 来源:https://arxiv.org/abs/2607.08046 查看 PDF(https://arxiv.org/pdf/2607.08046) > 摘要:经过微调用于预测的大型语言模型能够保持准确,但校准效果往往不佳,其思维链(CoT)推理也可能无法忠实反映预测背后的依据。我们探究了内部表征是否能更直接地展现这两方面。基于OpenForesight上的Eternis-Forecaster 8B模型,我们训练了面向中间激活的表征池化探针,发现它们实现了明显更优的校准效果;该结果同样适用于GLM-4.7-Flash和GLM-4.5-Air。随后,我们通过证据消融和干扰注入来评估CoT的忠实性:在提示中移除一个有影响力的信息来源,通常会改变模型的预测,但推理痕迹却保持不变。同一组探针可作为谎言检测器使用:它们的激活状态对行为变化的追踪效果远优于推理痕迹,并且在84%的案例中还能预测变化的方向,包括当CoT掩盖了扰动影响时。最后,强制回答实验表明,预测在推理开始之前就已基本确定:只需一次推理前的传递就能恢复已确定的答案和置信度,而根据预设答案分布的离散度来路由问题,可节省30-47%的生成token,且准确率不损失。综合来看,这些结果确立了探究内部表征作为一种实用工具的地位,可用于校准、审计和分类大型语言模型预测器,乃至更广泛的推理模型。 ## 提交历史 来自:Raphael Sarfati [查看邮箱(https://arxiv.org/show-email/25252c81/2607.08046)] **\[v1\]** 2026年7月9日星期四 01:52:09 UTC(858 KB)
相似文章
通过探针目标微调,让LLM真正表达其自信程度。[研究]
这项研究提出了探针目标微调(LoRA)方法,使LLM能够口头表达其内部置信度,实现了对置信度输出的因果控制,并证明模型通常知道自己是正确还是错误,但未能表达出来。
LLMs知道自己何时出错。我对Anthropic的新“全局工作空间”论文进行了一项修复 [R]
作者提出了一种方法,通过使用中间层状态的线性探测器和一个小型训练桥接器将置信度对数进行校准,使LLMs能够表达校准后的置信度,仅需200个标注样本,无需修改权重。这与Anthropic的全局工作空间论文相关,该论文解释了“知道-说出”差距。
别让我的LLM崩溃:注意力层剪枝对解释忠实性与置信度校准的影响
本文研究了在大型语言模型(LLM)中剪枝注意力层对解释忠实性和置信度校准的影响,发现准确率通常保持较高,但可解释性和可靠性下降,凸显了模型置信度、可解释性与准确率之间的失调。
LLM代理中的忠实不确定性:实践中校准与效用权衡
一位从业者讨论了LLM代理中的校准与效用权衡,分享了基于验证器的流水线经验,该流水线将幻觉工具调用减少了约60%,但引入了延迟成本并丢失了简单的正确答案。
大语言模型真的知道自己不知道什么吗?内部状态主要反映知识回忆而非真实性
本文质疑了大语言模型能够通过内部信号可靠区分幻觉输出和事实输出的假设,论证内部状态主要反映知识回忆而非真实性。作者提出了一套幻觉分类法(相关性幻觉与非相关性幻觉),并证明相关性幻觉的隐藏状态几何特性与事实输出重叠,使得标准检测方法失效。