通过探针目标微调,让LLM真正表达其自信程度。[研究]
摘要
这项研究提出了探针目标微调(LoRA)方法,使LLM能够口头表达其内部置信度,实现了对置信度输出的因果控制,并证明模型通常知道自己是正确还是错误,但未能表达出来。
与大家分享我关于探针目标微调(LoRa)在口头置信度校准方面的研究。如果你对经过指令微调的LLM的隐藏状态进行探针检测,它可以以0.76–0.88 AUROC区分正确与错误答案。但当你直接询问时,它往往对所有问题都回复99%的置信度。模型知道它是否真正知道答案,但不愿承认。我使用了探针的输出作为微调目标。这教会了模型说出它内部已知的信息。LoRA,几百个样本,在M3 Ultra上不到10分钟。我在4个系列(7B–70B)的8个模型上进行了测试。* 激活修补(Activation Patching)显示这是因果关系,而不仅仅是相关性。如果你在置信度位置交换隐藏状态,可以观察到置信度变化(层梯度ρ=0.976)。如果在随机位置交换,则不会发生任何变化。* 在70B模型上,softmax分布携带了有效的元认知信号,但argmax文本仍然停留在99%的置信度。模型在内部学习了路由,但无法突破文本瓶颈。* 在3个模型上进行了种子级别的复现。判别能力稳定,但置信度分布的形态对种子敏感。我预先注册了这两项研究(并注明了偏差),所有代码都已公开(代码:github.com/synthiumjp/metacog-engineering)。我尽量使其严谨且可复现。预印本在此:[https://zenodo.org/records/20436841](https://zenodo.org/records/20436841)
相似文章
LLMs知道自己何时出错。我对Anthropic的新“全局工作空间”论文进行了一项修复 [R]
作者提出了一种方法,通过使用中间层状态的线性探测器和一个小型训练桥接器将置信度对数进行校准,使LLMs能够表达校准后的置信度,仅需200个标注样本,无需修改权重。这与Anthropic的全局工作空间论文相关,该论文解释了“知道-说出”差距。
校准过度自信而不牺牲置信度:面向LLMs的探针条件化头部干预
本文介绍了一种推理时方法——探针条件化头部干预(PCHI),该方法通过在模型可能错误但保持高置信度时条件性地重新缩放注意力头输出,有选择地减少对错误答案的过度自信,同时不会显著降低对正确答案的置信度。
LLM预测模型知道但不说的话:探测内部表征以实现校准和忠实性
本文探测LLM预测模型的内部表征,以改进校准并评估思维链推理的忠实性。研究发现,探针能够实现更好的校准,并充当谎言检测器。
大语言模型对其自身回应过度自信
本文探究为何经过指令微调的大语言模型对其自身回应表现出过度自信,并识别出一种“所有权偏差”,即模型对自我生成的答案赋予更高置信度。文章提出一种简单的推理时策略,将模型答案重新表述为用户输入,无需重新训练即可将校准度提升高达26%。
自我评价之言:大语言模型在机器翻译中的口头化置信度研究
本文研究了从大语言模型中提取机器翻译输出置信度的口头化方法,并将其与内部token概率进行了比较。研究发现,尽管两种方法在错误检测和校准方面表现相似,但内部置信度与口头化置信度之间几乎没有相关性。