提示嵌入探针(PEP):从隐藏状态检测大语言模型幻觉
摘要
本文介绍了提示嵌入探针(PEP),一种参数高效的线性探针扩展方法,利用隐藏状态上的可学习提示嵌入来检测冻结的大语言模型中的幻觉。在 TriviaQA、GSM8K 和 MedQA 上使用 Qwen3 模型的评估显示,相比标准线性探针,该方法在预生成和跨模型设置中均有改进。
arXiv:2608.08024v1 公告类型:新
摘要:大型语言模型(LLM)能够生成流畅且有帮助的响应,但仍然容易出现幻觉。我们提出了提示嵌入探针(PEP),一种白盒方法,用于从冻结的 LLM 的隐藏状态中进行答案级别的幻觉检测。PEP 通过向输入中添加少量可学习的提示嵌入来扩展标准线性探针。我们使用多个规模的 Qwen3 模型在 TriviaQA、GSM8K 和 MedQA 上评估了 PEP。在主要分布内设置中,PEP 比标准线性探针改进了基于隐藏状态的检测。我们进一步评估了 PEP 在预生成预测、跨模型迁移和分布外泛化方面的表现。PEP 在预生成和跨模型设置中保持有效,而稳健的跨数据集迁移仍然困难。这些结果表明,基于提示的适配可以在保持主干冻结且仅增加少量可训练参数的同时,增强隐藏状态探针的检测能力。
查看缓存全文
缓存时间: 2026/08/11 08:06
# 基于隐藏状态的大语言模型幻觉检测 来源:https://arxiv.org/html/2608.08024 ## 提示嵌入探针(PEP):从隐藏状态进行大语言模型幻觉检测 ###### 摘要 大语言模型(LLM)能够生成流畅且有用的回答,但仍然容易出现幻觉——即不正确、缺乏依据或不可靠的输出。这促使我们设计在推理时检测不可靠输出的高效方法。在本文中,我们研究白盒设置下基于冻结LLM隐藏状态的答案级幻觉检测,并引入提示嵌入探针(Prompt Embedding Probes, PEP),这是标准线性探针的一种参数高效扩展,通过少量可学习提示嵌入来增强输入。我们在TriviaQA、GSM8K和MedQA上使用多种规模的Qwen3模型评估PEP。结果表明,相对于标准线性探针,可学习提示嵌入在主要的分布内设置中改进了基于隐藏状态的幻觉检测。我们进一步在待生成(TBG)设置中研究了该方法在生成前的幻觉预测、跨模型迁移实验以及分布外评估中的表现。PEP在TBG和跨模型设置中仍然有效,但在差异较大的数据集之间进行稳健迁移仍然困难。这些结果表明,基于提示的适配可以增强基于探针的幻觉检测,同时保持主干模型冻结,并且仅增加少量可训练参数。 提示嵌入探针(PEP):从隐藏状态进行大语言模型幻觉检测 Zakhar Mrykhin([email protected]) Valentin Malykh(HSE University,[email protected]) ## 1 引言 大语言模型(LLM)能够生成流畅且有用的回答,但仍然容易出现幻觉——即不正确、缺乏依据或不可靠的输出(Huang et al., 2025, https://arxiv.org/html/2608.08024#bib.bib11)。这在医疗、金融和法律等高风险领域尤其令人担忧,因为模型错误可能导致具有重大影响的决策或误导性的专业建议。法律案例已经表明,在LLM辅助工作流中出现的幻觉内容可能带来实际处罚和程序性损害(Reuters, 2026, https://arxiv.org/html/2608.08024#bib.bib17)。幻觉在广泛使用的评测数据集和基准中也仍然常见,表明尽管LLM开发持续进步,幻觉依然存在(Niu et al., 2024, https://arxiv.org/html/2608.08024#bib.bib3;Li et al., 2023, https://arxiv.org/html/2608.08024#bib.bib1)。幻觉可能源于数据、训练和推理阶段的多方面因素,因此很难通过单一干预措施消除(Huang et al., 2025, https://arxiv.org/html/2608.08024#bib.bib11)。先前的工作进一步表明,即使是简单的事实性提示也能诱发LLM给出自信但错误的答案
相似文章
HalluSAE:利用稀疏自编码器检测大型语言模型中的幻觉
北京航空航天大学等机构的研究人员提出了HalluSAE,这是一个结合稀疏自编码器与相变理论的框架。该框架通过将生成过程建模为穿越势能地形的轨迹,来检测大型语言模型(LLM)中的幻觉,并精准定位发生事实性错误的关键过渡区域。
幻觉可从量化大语言模型中间层隐藏状态线性解码
本文研究开源量化大语言模型的隐藏状态中是否编码了线性可分的真实性信号。在三个7B-8B指令调优模型上,对单个网络中间层的线性探针在幻觉检测基准上达到0.904-1.000 AUROC,优于基于采样的方法。
通过语义等价的对抗性攻击诱发LLM的内在幻觉
本文提出了一种利用语义等价的对抗性扰动来诱发LLM内在幻觉的框架,表明即使保持查询含义不变,最先进的模型在上下文忠实度上也会显著下降。
PRISM:探究大语言模型幻觉中的推理、指令与源记忆
研究人员提出了 PRISM 诊断基准,该基准将大语言模型(LLM)的幻觉拆解为四个维度(知识缺失/错误、推理错误、指令遵循错误),涵盖三个生成阶段(记忆、指令、推理),并通过评估 24 款大语言模型,揭示了各类缓解策略之间存在的权衡关系。
零源大语言模型幻觉检测:基于类人标准探询方法
提出HCPD,一种零源幻觉检测方法,采用类人标准探询机制将判断分解为可解释的标准,优于当前最先进的基线方法。