LLM预测模型知道但不说的话:探测内部表征以实现校准和忠实性

arXiv cs.CL 论文

摘要

本文探测LLM预测模型的内部表征,以改进校准并评估思维链推理的忠实性。研究发现,探针能够实现更好的校准,并充当谎言检测器。

arXiv:2607.08046v1 公告类型:新 摘要:经过微调用于预测的大型语言模型可以准确但校准不佳,其思维链(CoT)推理可能无法忠实反映预测背后的证据。我们询问内部表征是否为两者提供了更直接的窗口。与Eternis-Forecaster 8B在OpenForesight上合作,我们在中间激活上训练表征池化探针,发现它们实现了显著更好的校准;这一结果也适用于GLM-4.7-Flash和GLM-4.5-Air。然后,我们通过证据消融和干扰注入来评估CoT忠实性:移除提示中的一个有影响力的来源通常会改变模型的预测,同时保持推理轨迹不变。相同的探针充当谎言检测器:它们的激活追踪行为变化远好于推理轨迹,并且在84%的情况下预测变化方向,包括当CoT隐藏了扰动的影响时。最后,强制回答表明预测在推理开始之前就已基本固定:单次推理前传递即可恢复已确定的答案和置信度,根据这种预设答案分布的分散程度对问题进行路由节省了30-47%的生成令牌,且不损失准确性。总之,这些结果将探测内部表征确立为校准、审计和分类语言模型预测模型及更广泛推理模型的实用工具。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:12

# 大型语言模型预测器知道但不说的话:探究内部表征以实现校准与忠实性  
来源:https://arxiv.org/abs/2607.08046  
查看 PDF(https://arxiv.org/pdf/2607.08046)  

> 摘要:经过微调用于预测的大型语言模型能够保持准确,但校准效果往往不佳,其思维链(CoT)推理也可能无法忠实反映预测背后的依据。我们探究了内部表征是否能更直接地展现这两方面。基于OpenForesight上的Eternis-Forecaster 8B模型,我们训练了面向中间激活的表征池化探针,发现它们实现了明显更优的校准效果;该结果同样适用于GLM-4.7-Flash和GLM-4.5-Air。随后,我们通过证据消融和干扰注入来评估CoT的忠实性:在提示中移除一个有影响力的信息来源,通常会改变模型的预测,但推理痕迹却保持不变。同一组探针可作为谎言检测器使用:它们的激活状态对行为变化的追踪效果远优于推理痕迹,并且在84%的案例中还能预测变化的方向,包括当CoT掩盖了扰动影响时。最后,强制回答实验表明,预测在推理开始之前就已基本确定:只需一次推理前的传递就能恢复已确定的答案和置信度,而根据预设答案分布的离散度来路由问题,可节省30-47%的生成token,且准确率不损失。综合来看,这些结果确立了探究内部表征作为一种实用工具的地位,可用于校准、审计和分类大型语言模型预测器,乃至更广泛的推理模型。

## 提交历史

来自:Raphael Sarfati [查看邮箱(https://arxiv.org/show-email/25252c81/2607.08046)] **\[v1\]** 2026年7月9日星期四 01:52:09 UTC(858 KB)

相似文章