从令牌到语义:利用互补信号在黑盒LLMs中检测幻觉
摘要
本文提出通过结合语义熵和令牌级不确定性信号来检测黑盒LLMs中的幻觉的方法,评估了TopK、CoCoA、Gated和Stacked等技术在多个基准测试中的表现,发现没有单一方法普遍最强,但Stacked通常表现最佳。
arXiv:2609.02679v1 Announce Type: new
摘要:当LLMs支持面向公众或高风险的工作流程时,遗漏的捏造可能对用户和机构造成伤害,而误报警则会消耗有限的人工审查能力。在没有可信上下文或参考文档的情况下,我们研究了通过黑盒模型API可访问的两个信号:语义熵,衡量采样响应含义之间的分歧;以及从令牌级对数概率中得出的不确定性。它们的失败模式可能是互补的:当响应形成一个语义簇时,语义熵变得无信息性,而令牌不确定性可能会错过始终自信的错误。我们通过我们的TopK方法聚合采样响应中的令牌级信号,扩展了基于令牌的不确定性检测;评估了混合的CoCoA方法,该方法结合了目标响应不确定性与语义不相似性;并提出和研究了两种监督方法:Gated,将单簇案例路由到聚合令牌特征分类器;以及Stacked,从语义不确定性和更广泛的令牌特征中联合学习。我们评估了七个基准测试,包括五个公开基准(四个文本数据集和多模态手写支票提取)和两个构建的基准(金融摘要和长文本QA),使用四种语言模型。在我们的跨模型和数据集评估中,Stacked在近一半的情况下给出了最佳性能,而TopK和CoCoA在没有监督训练标签的情况下仍具有竞争力,尽管它们的阈值需要仔细校准。没有方法是普遍最强的。因此,我们评估了从1%到15%的假阳性率预算下的性能,评估了它们对生成和校准选择的敏感性,并检查了跨数据集特性的变化。
查看缓存全文
缓存时间: 2026/09/03 05:56
# 从令牌到语义:利用互补信号检测黑盒大语言模型中的幻觉
来源:https://arxiv.org/html/2609.02679
工作坊标题:AI4Good Workshop, NeurIPS 2026
###### 摘要
当大语言模型支持面向公众或高风险的工作流程时,遗漏的捏造内容可能损害用户和机构,而误报警则会消耗有限的人工审核能力。在没有可信上下文或参考文档可用的情况下,我们研究了两种可通过黑盒模型API获取的信号:语义熵,它衡量抽样响应意义之间的不一致性;以及从令牌对数概率推导出的不确定性。它们的失效模式可能是互补的:当响应形成一个语义簇时,语义熵变得无信息量;而令牌不确定性可能遗漏持续自信的错误。我们通过我们的TopK方法扩展了基于令牌的不确定性检测,该方法在采样响应间聚合令牌级信号;评估了混合的CoCoA方法,该方法将目标响应不确定性与语义不相似性相结合;并提出并研究了两种监督方法:Gated,它将单簇情况路由到聚合令牌特征分类器;以及Stacked,它从语义不确定性和更广泛的令牌特征中联合学习。我们评估了七个基准——包括五个公共基准(四个文本数据集和多模态手写支票提取)以及两个构建的基准,金融摘要和长文本问答,使用了四种语言模型。在跨模型和数据集的评估中,Stacked在近半数情况下表现最佳,而TopK和CoCoA在没有监督训练标签的情况下仍具竞争力,尽管它们的阈值需要仔细校准。没有一种方法是普遍最强的。因此,我们在1%到15%的假阳性率预算下评估性能,评估其对生成和校准选择的敏感性,并考察跨数据集特征的差异。
## 1 引言
大型语言模型越来越多地为受监管组织和面向公众的服务中的信息工作流程提供支持。在这些环境中,捏造的说法或不正确的数字可能会误导下游审核人员和用户,而误报警则会消耗有限的人力审核能力。基于参考的方法可以根据权威上下文检查输出,但开放式任务在推理时可能没有可信的上下文或完整的参考文档。专有模型通常也通过黑盒API访问,这些API暴露生成的文本,有时也暴露令牌对数概率,但不暴露隐藏状态。因此,我们研究这些可观测信号是否能在没有可信参考证据或模型内部访问的情况下识别幻觉响应。
两种API可见的信号族尤为重要。语义熵通过对N个响应进行采样,按意义分组,并根据它们在语义簇中的分布来衡量不确定性。令牌对数概率方法则使用序列似然度、困惑度、TopK熵和候选词边缘差(最高和次高令牌对数概率之间的差异)来估计单个响应内的置信度。由于语义熵已经需要多个响应,我们计算每个响应的令牌信号,并在相同的样本中对它们进行聚合。我们的标量TopK分数结合了平均TopK熵和跨响应置信度变化。我们还评估了CoCoA,这是一种混合分数,它将目标响应置信度与对采样替代方案的语义不相似性相结合。
这两个信号族以不同方式失效。即使所有样本都不正确,当它们形成一个语义簇时,语义熵变为零。令牌特征在某些此类情况下可能具有信息量,但可能遗漏持续自信的幻觉;相反,语义分歧可以暴露令牌概率无法发现的错误。这种互补性激发了两种监督组合方法。*门控级联*在存在多个簇时使用语义不确定性,并将单簇情况路由到聚合令牌分类器。*堆叠分类器*则针对每个查询从两个信号族中联合学习(见图1)。
我们在七个基准上进行了评估——包括五个公共基准(四个文本数据集和多模态手写支票提取)以及两个作者构建的基准,金融摘要和长文本问答——使用了四种语言模型(在支持的情况下)。在跨模型和数据集的评估中,Stacked在近半数情况下表现最佳,而TopK和CoCoA在没有监督训练标签的情况下仍具竞争力,尽管它们的阈值需要仔细校准。没有一种方法是普遍最强的。因此,我们在1%到15%的假阳性率预算下评估性能,评估其对生成和校准选择的敏感性,并考察跨数据集特征的差异(见附录E)。我们记录了两个基准的构建过程以确保可重复性,但并未将其作为公开发布的数据集呈现。
##### 研究问题。我们询问语义和令牌对数概率信号在哪些数据集上失效;它们的互补信息是否能够改进黑盒幻觉检测;以及TopK、Gated和Stacked在跨数据集、模型、假阳性率预算和数据特征方面的表现一致性如何。我们的发现为所评估的设置类型提供了有条件的指导。
(a)语义聚类 C₁ C₂ C₃,高语义熵 → 幻觉 ✓
(b)令牌对数概率,单次生成 rᵢ,高令牌不确定性 → 幻觉 ✓
(c)语义聚类失效,C₁(全部错误) r₁ r₂ ... rₙ,SE=0 ✗,令牌不确定性高 ✓
(d)令牌对数概率失效,H_topk 低 ✗,|S|=2 ✓
(e)多响应 TopK,N个响应,令牌对数概率,在N个响应上聚合 U_topk = mean(H_topk) + Var(log p̄)
(f)门控级联,N个响应,|S|(|S|?),语义熵分数,令牌特征分类器,>1(是),=1(否),P(hallu)
(g)堆叠分类器,语义 + 谱聚合令牌,组合特征,PCA + 逻辑回归,P(hallu)
图 1:互补的黑盒信号与方法。(a–d)语义和令牌不确定性揭示互补的失效模式。(e–g)TopK在多个响应上聚合令牌不确定性,Gated根据簇数进行路由,Stacked从语义和令牌特征中联合学习。
## 2 互补的黑盒幻觉信号
### 2.1 相关工作
##### 语义熵。语义熵为提示词x采样N个响应,将它们分组为语义等价类C = {C₁, ..., Cₖ},并基于经验类分布衡量不确定性:SE(x) = -Σ_{k=1}^K p̂(Cₖ) log p̂(Cₖ),p̂(Cₖ) = |Cₖ|/N。标准SE有两个局限:有限采样可能遗漏合理的语义类,而硬聚类丢弃了渐进相似性。字母表大小校正估计了样本中未观察到的类。成对相似度方法保留了渐进信息:核语言熵使用语义相似度核,而语义最近邻熵使用最近邻相似度而不离散分组。谱不确定性,我们评估了它,利用响应相似度图的谱保留渐进信息,并区分偶然不确定性和认知不确定性。语义能量用倒数第二层的logits增强语义类,但需要白盒访问。语义多样性语言生成从单个模型中引出多样替代方案,而跨模型分歧则比较模型内部和跨模型的相似性。这些方法丰富了语义变化性,但当相同的错误意义重复时,可能提供的证据有限,这激励了下文考虑的令牌级证据。
##### 令牌级不确定性。令牌概率方法评估生成内容内部的置信度,而非响应意义之间的不一致性。基本方法使用序列似然度或预测熵,而自评估则使用分配给"True"的概率作为置信度。将注意力转移到相关性为语义上重要的令牌和响应相关的不确定性赋予权重。EAS沿着推理序列累积熵,而通过对数概率作为时间序列的幻觉评估从TopK令牌对数概率中学习时间模式。HaluNet也使用隐藏状态特征,这使其超出了我们的黑盒设置。与HALT在单个响应的令牌位置上建模不确定性不同,我们的方法在为语义熵已经采样的多个响应上聚合令牌证据;然而,持续自信的幻觉仍然难以识别。
##### 混合和更高访问方法。CoCoA是一种密切相关的混合方法。它将目标响应的标量模型不确定性乘以其对采样替代方案的平均语义不相似性,通过最小贝叶斯风险公式推导出该组合。我们则在所有N个响应上聚合更广泛的令牌概率特征,并将其与查询级语义信号相结合。其他方法需要额外的上下文或隐藏状态访问。
### 2.2 提出的方法
语义和令牌信号的不同失效模式激发了三种使用相同N个采样响应和API暴露的对数概率的方法。TopK在多个响应上聚合令牌不确定性。Gated和Stacked结合令牌和语义证据:Gated根据是否存在多个语义簇来路由查询,而Stacked则从两个信号族中联合学习。这些方法都不需要参考证据或模型内部访问。
##### 多响应令牌表示。对于每个响应,我们提取令牌置信度、序列置信度、位置置信度变化和响应长度特征,然后使用均值、方差、分位数、范围和极值总结它们在N个响应上的分布。TopK仅使用平均TopK熵和跨响应置信度分布,而Gated和Stacked使用更广泛的聚合特征向量。为了分析,我们将对数概率、候选词边缘差和熵归类为*令牌置信度*;位置置信度变化和响应长度归类为*响应动态*;跨样本分布和极值归类为*跨响应聚合*;响应多样性和冯·诺依曼熵归类为*语义多样性*。
##### 门控级联。门控级联使用语义簇数K进行路由。当K ≥ 2时,它返回所选的语义熵分数;当K = 1时,经验SE按定义为零,因此它使用基于聚合令牌特征的逻辑回归分类器:score(x) = { SE_m(x), K ≥ 2; σ(wᵀ f_tok(x) + b), K = 1 }。这里,f_tok(x)是跨N个响应聚合的令牌特征向量,σ将分类器输出转换为幻觉概率。*门控(混合)*在语义分支使用混合SE,而*门控(谱)*使用冯·诺依曼熵。它们共享相同的令牌分类器,仅在语义熵分数上不同。
##### 堆叠分类器。堆叠分类器将聚合的令牌配置文件与簇数和一个语义特征块结合:*混合*、*谱*或*冯·诺依曼*。特征被标准化,通过主成分分析降维,并传递给L2正则化的逻辑回归,允许两种信号影响每次预测(关于特征输入的详细信息见附录C.4)。
## 3 方法论与实验设置
对于每个查询,我们计算几个语义不确定性分数和第2.2节中的多响应令牌表示,独立评估这些度量,同时也通过门控和堆叠方法联合评估。本节定义变体、数据集、模型、训练过程和指标。
### 3.1 方法与变体
表1概述了所选方法及其测量方式如何通过门控和堆叠方法使用。我们使用text-embedding-3-large对N个响应进行嵌入,并使用成对余弦相似度衡量它们的语义相似性。对于标准SE、UEigV和混合SE,特定于数据集的阈值τ决定一个响应是否被分配到现有的语义类。我们使用单独的验证数据选择τ,并在五折交叉验证前固定它;验证样本被排除在评估折之外。冯·诺依曼和谱分数直接使用相同的相似度矩阵。附录A.1包含完整的实现细节。
表 1:13种评估方法的概述。描述总结了每种方法使用的不确定性分数或分类器输入。
### 3.2 数据集
我们评估了七个基准,涵盖事实性、模糊性、多跳、抽取式、长上下文、金融和多模态设置。其中五个是公共的,而金融摘要和长文本问答是作者构建的。我们仅相似文章
关注未见质量:通过软混合字母估计揭示 LLM 幻觉
研究者提出 SHADE,一种混合估计器,在仅能获取少量黑盒样本时,融合 Good-Turing 覆盖率与图谱线索,量化语义不确定性并检测大模型幻觉。
Mixture-of-Experts模块包含强烈的幻觉检测信号
本文介绍了InnerExpert,这是一种利用Mixture-of-Experts信号在LLMs中进行逐词元幻觉检测的方法,性能优于现有技术。
用于词元级幻觉检测的时序多信号融合方法
本文介绍了一种时序多信号融合方法,用于通过融合特征上的序列标注检测语言模型中的词元级幻觉,在不访问模型内部信息的情况下实现了改进的跨模型性能。
重访最大池化网络:分析语义概率在幻觉检测多重实例学习中的作用
本文分析了大语言模型中的幻觉检测问题,提出了一种最大池化方法,该方法通过消除昂贵的语义一致性计算来提高效率,同时保持具有竞争力的性能。
面向多样性的微调方法用于基于不确定性的幻觉检测
本文提出了面向多样性的微调策略,通过鼓励多样化的生成来改进大型语言模型中基于不确定性的幻觉检测,从而通过语义熵使幻觉更易检测。