基于输入端证据对齐的幻觉片段检测
摘要
本文介绍了一个在LLMs中通过将输出token与输入证据对齐来检测幻觉片段的任务,提出了一种基于编码器的模型,该模型使用预测置信度来检测幻觉,无需人工对齐。
arXiv:2608.15804v1 Announce Type: new
摘要:幻觉仍然是阻碍大语言模型(LLMs)在条件文本生成中可靠使用的主要障碍。现有方法主要评估整个生成文本的事实性,对哪些输出片段是幻觉或它们与输入的关系提供有限的见解。我们引入了基于输入端证据对齐的幻觉片段检测任务,该任务联合识别幻觉片段并将输出token与相应的输入证据对齐。我们的方法基于这样的观察:忠实的输出token可以从输入预测,而幻觉token则不能。因此,我们训练一个基于编码器的模型来从输入表示预测被掩码的输出token,使用预测置信度进行幻觉检测,同时自然地生成与输入的对齐。实验表明,所提出的方法有效检测幻觉片段并识别有意义的输入端证据。人工评估证实了预测对齐的质量。
查看缓存全文
缓存时间: 2026/08/18 10:14
# 基于输入侧证据对齐的幻觉片段检测
来源:https://arxiv.org/html/2608.15804
Yuki Arase
隶属机构:东京科学研究所
隶属机构邮箱:yamada\.m\.ee1b@m\.isct\.ac\.jp, arase@c\.titech\.ac\.jp
###### 摘要
幻觉仍然是大型语言模型(LLMs)在条件文本生成中可靠应用的主要障碍。现有方法主要评估整个生成文本的真实性,对识别哪些输出片段存在幻觉或这些片段与输入如何关联提供的信息有限。我们引入了“基于输入侧证据对齐的幻觉片段检测”任务,该任务同时识别幻觉片段并将输出标记与相应的输入证据对齐。我们的方法基于一个观察:忠实的输出标记可以从输入中预测,而幻觉标记则不能。因此,我们训练一个基于编码器的模型,从输入表示中预测被掩盖的输出标记,利用预测置信度进行幻觉检测,同时自然地生成与输入的对齐。实验表明,所提出的方法能有效检测幻觉片段并识别有意义的输入侧证据。人工评估证实了预测对齐的质量。
## 1 引言
大型语言模型(LLMs)极大地推动了条件文本生成任务的发展,包括文本摘要和问答。尽管取得了这些显著进步,它们仍然容易产生幻觉,生成与输入文本不符或矛盾的内容⁹ (https://arxiv.org/html/2608.15804#bib.bib4);16 (https://arxiv.org/html/2608.15804#bib.bib13)。此类幻觉损害了LLM生成输出的可靠性,并限制了其在现实世界应用中的部署。为了便于验证生成内容,不仅需要检测输出中的幻觉片段,还应识别支持或矛盾于这些片段的相关输入部分。这种输入-输出对齐对于长文档尤为重要,因为手动将生成内容追溯到其来源非常困难。
参见说明图 1:基于输入侧证据对齐的幻觉片段检测示例。
大多数现有研究将幻觉检测形式化为句子或文档级别的二分类问题⁸ (https://arxiv.org/html/2608.15804#bib.bib14);5 (https://arxiv.org/html/2608.15804#bib.bib6)。尽管这些方法对于评估整个输出的真实性有效,但它们既不能定位幻觉片段,也不能识别与单个输出片段相关的输入证据。这限制了它们在解释模型预测和协助用户验证生成内容方面的实用性。
为解决此局限性,我们引入了*基于输入侧证据对齐的幻觉片段检测*任务,该任务同时识别生成文本中的幻觉片段,并将输出片段与其在输入中的相应证据对齐。图1 (https://arxiv.org/html/2608.15804#S1.F1) 以文本摘要为例说明了该任务。在输出摘要中,“ADA [...] to employers with twenty or more employees” 这一短语是幻觉,因为源文本中说明员工数为“four to fifteen”。因此,理想的模型应检测出幻觉词“twenty”,同时识别出相关的输入片段“four to fifteen”。
获取生成文本与其输入之间的对齐需要昂贵的手工标注。此外,由于LLMs快速发展,为每个新模型或领域构建此类标注并不实际。这促使我们采用一种不依赖手工对齐训练数据的方法。我们在远程监督框架下构建该任务,避免了对人工对齐输入-输出对的需求。具体来说,我们利用了这样一个观察:忠实的输出标记通常可以从其在输入文本中的支持上下文中预测,而幻觉标记则不能。基于此直觉,我们将幻觉片段检测转化为一个以输入为条件的掩码标记预测问题。具体而言,一个编码器模型仅基于输入表示来预测被掩盖的输出标记。直观地说,忠实的标记可以从输入中高置信地恢复,而幻觉标记则不能。因此,我们使用预测置信度来区分忠实标记和幻觉标记。由于每次预测都是从输入表示中检索得到,该框架同时生成了标记级别的证据对齐。
与近期依赖大型基于解码器的LLMs进行幻觉检测的方法²⁰ (https://arxiv.org/html/2608.15804#bib.bib11);16 (https://arxiv.org/html/2608.15804#bib.bib13);14 (https://arxiv.org/html/2608.15804#bib.bib9) 不同,我们的方法采用轻量级编码器模型,使得推理效率显著提高。实验证明,所提方法在有效检测幻觉片段的同时,能识别其在输入中的支持证据。人工评估确认了预测对齐在忠实词和幻觉词上的质量。我们的代码在 https://github.com/miyu-y/HalluSpan_EviAlign 可用。
## 2 相关工作
### 2.1 幻觉检测
幻觉检测通常被形式化为文本级分类,目标是判断生成文本是否包含幻觉。代表性方法包括估计多个采样响应间的一致性¹² (https://arxiv.org/html/2608.15804#bib.bib15) 和基于LLMs的事实核查(对比参考文档)⁵ (https://arxiv.org/html/2608.15804#bib.bib6)。最近,一些研究关注了幻觉片段检测。CoT推理方法¹ (https://arxiv.org/html/2608.15804#bib.bib16) 和推理模型²⁰ (https://arxiv.org/html/2608.15804#bib.bib11) 被用来解释特定片段为何是幻觉。然而,它们不一定提供输出片段与输入证据之间的对应关系。其他研究使用基于编码器的模型直接对输出标记或片段进行分类¹⁰ (https://arxiv.org/html/2608.15804#bib.bib8);3 (https://arxiv.org/html/2608.15804#bib.bib17)。这些先前的研究均未考虑输入与生成文本之间忠实标记和幻觉标记的对齐。
### 2.2 单语词对齐
词对齐识别两个句子之间的对应关系,因此与我们任务的对齐部分密切相关。大多数单语词对齐方法(例如¹¹ (https://arxiv.org/html/2608.15804#bib.bib18))依赖于监督学习。然而,人工标注词对齐成本高昂,需要高度专业性。存在少数无监督单语词对齐方法⁶ (https://arxiv.org/html/2608.15804#bib.bib19);2 (https://arxiv.org/html/2608.15804#bib.bib20)。其中,OTAlign² (https://arxiv.org/html/2608.15804#bib.bib20) 将词对齐形式化为最优传输问题,并使用不平衡最优传输来建模空对齐。这一特性与我们的情景特别相关,因为幻觉片段在输入中可能没有对应证据。然而,与单语词对齐不同,我们的目标不是对齐语义等价的文本,而是联合检测幻觉片段并将生成内容定位到输入文本中。
## 3 所提方法
我们假设忠实的输出标记通常可以从其在输入文本中的支持上下文中预测,而幻觉标记则不能。基于此假设,我们将幻觉片段检测形式化为一个以输入为条件的掩码标记预测任务。所提方法受到非参数掩码语言模型(NPM)¹³ (https://arxiv.org/html/2608.15804#bib.bib21) 的启发,该模型通过将其上下文表示与参考文本的表示匹配来恢复被掩盖的标记。
如图2 (https://arxiv.org/html/2608.15804#S3.F2) 所示,所提方法掩盖生成文本中的一个标记,并通过从输入文本中检索最相关的表示来预测它。然后使用预测置信度来区分忠实标记和幻觉标记,同时检索到的输入标记提供了相应的证据对齐。
参见说明图 2:所提方法
### 3.1 训练
为提高训练效率,模型使用片段级掩码进行优化,允许同时预测多个标记。
#### 片段分割
我们首先基于语义角色标注(SRL)将输出文本分割为具有语义意义的片段。3 (https://arxiv.org/html/2608.15804#bib.bib17) 也使用基于SRL的片段进行幻觉片段检测。以下是我们分割的一个示例:
原始文本:Keonna Thomas was charged with attempting to travel to Syria.
分割后:[Keonna Thomas] [was charged] [with attempting] [to travel] [to Syria]。
我们使用SRL提取谓词及其论元,并将它们分割为片段。当一个句子包含多个动词时,我们合并所有谓词的SRL结果,并识别最细粒度的片段。具体来说,如果一个谓词识别的片段被另一个谓词进一步划分,我们采用最小的片段。未包含在任何谓词或论元片段中的词(如连词)被排除在掩码之外。最后,我们合并两个相邻的谓词片段,以处理被动或进行时态结构。
#### 预测置信度
然后,我们使用片段级掩码预测来微调编码器模型。每个被掩码的片段$s$被替换为两个连续的特殊标记,即<ms>和<me>。输入文本和被掩盖的输出文本被连接并编码;$\bm{m}_{s} \in \mathbb{R}^{d}$ 和 $\bm{m}_{e} \in \mathbb{R}^{d}$ 分别表示前一个和后一个标记的 $d$ 维嵌入。输入文本标记 $t_{1}, t_{2}, \ldots, t_{n}$ 的嵌入也从最终编码器层提取为隐藏表示:$(\bm{d}_{1}, \bm{d}_{2}, \ldots, \bm{d}_{n})$,其中 $\bm{d}_{i} \in \mathbb{R}^{d}$。预测置信度定义为 $c(s,i,j) := \mathrm{sim}(\bm{m}_{s}, \bm{d}_{i}) + \mathrm{sim}(\bm{m}_{e}, \bm{d}_{j})$,(1) 其中 $i$ 和 $j$ 是输入标记的索引($i \leq j$),$\mathrm{sim}(\cdot)$ 函数计算余弦相似度。然后,输出片段 $s$ 被视为对应于置信度最高的输入片段 $(k, \ell)$:$c^{s}_{\mathrm{max}} = \max_{(k, \ell)} c(s,k,\ell)$。
#### 损失函数
我们设计了一个损失函数,使模型对于忠实片段以更高置信度预测输入文本标记,同时为幻觉片段分配更低的置信度。$\mathcal{L} = \frac{1}{M} \sum_{i \in M} f(s_{i})$,(2) $f(s_{i}) = \begin{cases} \max(0, c^{s_{i}}_{\mathrm{max}} - \gamma_{\mathrm{h}}), & \text{如果是幻觉}, \\ \max(0, \gamma_{\mathrm{f}} - c^{s_{i}}_{\mathrm{max}}), & \text{否则}, \end{cases}$ (3) 其中 $s_{i}$ 是总共 $M$ 个输出片段中的第 $i$ 个片段,$\gamma_{\mathrm{h}}$ 和 $\gamma_{\mathrm{f}}$ 分别是幻觉片段和忠实片段的置信度上下界。我们进一步为困难样本添加了损失权重 $w$:置信度高于 $\gamma_{\mathrm{f}}$ 的幻觉片段和置信度低于 $\gamma_{\mathrm{h}}$ 的忠实片段。
### 3.2 推理
虽然我们在训练时使用片段级掩码,但在推理时执行标记级预测,以获得细粒度的幻觉检测和证据对齐。每个输出标记被单个<ms>标记替换,并以与训练相同的方式编码。最后,具有最高置信度的输入侧标记(以与公式 (1 (https://arxiv.org/html/2608.15804#S3.E1)) 相同的方式计算)被视为与被掩码的输出标记关联最强。
我们使用一个简单的阈值 $\lambda_{\mathrm{h}}$ 对最大置信度分数 $c^{s}_{\mathrm{max}}$ 进行操作,将每个输出标记分类为幻觉或忠实。如果其最大置信度低于 $\lambda_{\mathrm{h}}$,我们认为输出标记是幻觉,否则为忠实。由于分词器可能将一个词拆分为多个子词,我们将标记级预测聚合为词级预测。一个词只有在其所有子词标记都被分类为幻觉时,才被判定为幻觉。
## 4 实验设置
本节描述自动和人工评估的共同实验设置和实现细节。
### 4.1 数据集
表 1:RAGTruth 中的样本数量(括号内表示幻觉字符的比例)
| 数据集 | Q&A | 总结 | 总体 |
| :---------- | :--------- | :--------- | :---------- |
| 训练集 (FT) | 4,134 (8.6%) | 3,858 (3.0%) | 7,992 (5.9%) |
| 验证集 | 400 (9.0%) | 400 (3.3%) | 800 (6.1%) |
| 验证集 (λ) | 500 (9.9%) | 500 (3.5%) | 1,000 (6.7%) |
| 测试集 | 900 (5.4%) | 900 (2.9%) | 1,800 (4.1%) |
我们使用 RAGTruth¹⁶ (https://arxiv.org/html/2608.15804#bib.bib13),它提供了66种不同LLMs¹⁷ (https://arxiv.org/html/2608.15804#bib.bib1);7 (https://arxiv.org/html/2608.15804#bib.bib2);21 (https://arxiv.org/html/2608.15804#bib.bib3) 在QA、数据转文本和新闻摘要任务上的输出。在本研究中,我们使用QA和新闻摘要任务,因为数据转文本任务的输入与自然文本不同。在QA任务中,输入由来自MS MARCO¹⁵ (https://arxiv.org/html/2608.15804#bib.bib5) 的段落和问题组成,输出是答案。在新闻摘要任务中,输入是来自CNN/Daily Mail数据集¹⁸ (https://arxiv.org/html/2608.15804#bib.bib22) 等数据集的新闻文章,输出是其摘要。提供有人工标注,指示生成输出中的幻觉片段。但是,输入与生成输出之间的对齐不可用。
#### 数据划分
表1 (https://arxiv.org/html/2608.15804#S4.T1) 显示了RAGTruth各划分中的样本数量及幻觉字符比例。由于RAGTruth未提供官方验证集,我们从训练集中随机抽取了800个样本(每个任务400个)作为验证集(Dev)。我们进一步随机抽取了1,000个样本(每个任务500个)用于调整阈值 $\lambda_{\mathrm{h}}$ (Dev (λ))。剩余样本用于训练。
#### 评估指标
RAGTruth的官方评估指标是字符级的精确率、召回率和F1分数。
### 4.2 所提方法的实现
我们遵循NPM的训练策略,掩盖输出文本的15.0%标记。我们从几何分布($p=0.5$)中采样目标掩码大小,并选择长度最接近采样掩码大小的基于SRL的片段。如果一个选定片段包含至少一个幻觉字符,则标记为幻觉;否则标记为忠实。由于幻觉片段远少于忠实片段,我们在掩码片段采样时优先选择幻觉片段。我们重复此过程,直到掩码预算耗尽。结果,用于训练的掩码片段包含35,578个忠实片段和13,269个幻觉片段。相似文章
HalluSAE:利用稀疏自编码器检测大型语言模型中的幻觉
北京航空航天大学等机构的研究人员提出了HalluSAE,这是一个结合稀疏自编码器与相变理论的框架。该框架通过将生成过程建模为穿越势能地形的轨迹,来检测大型语言模型(LLM)中的幻觉,并精准定位发生事实性错误的关键过渡区域。
用于词元级幻觉检测的时序多信号融合方法
本文介绍了一种时序多信号融合方法,用于通过融合特征上的序列标注检测语言模型中的词元级幻觉,在不访问模型内部信息的情况下实现了改进的跨模型性能。
幻觉检测中的自动层选择
本文提出了用于大语言模型幻觉检测的自动层选择方法,并引入了固有维度首个有效峰值(FEPoID),这是一种无需训练的标准,能够一致地识别出最优中间层,优于现有启发式方法。
Mixture-of-Experts模块包含强烈的幻觉检测信号
本文介绍了InnerExpert,这是一种利用Mixture-of-Experts信号在LLMs中进行逐词元幻觉检测的方法,性能优于现有技术。
关注未见质量:通过软混合字母估计揭示 LLM 幻觉
研究者提出 SHADE,一种混合估计器,在仅能获取少量黑盒样本时,融合 Good-Turing 覆盖率与图谱线索,量化语义不确定性并检测大模型幻觉。