CORTEX:通过比较内部表示实现RAG中令牌级幻觉检测
摘要
提出了CORTEX,一种针对RAG的令牌级幻觉检测方法,通过比较有无检索文档时LLM的内部表示来识别无根据的文本片段。它改进了长文本RAG输出中幻觉的细粒度定位。
查看缓存全文
缓存时间: 2026/07/01 05:32
# CORTEX:通过比较内部表征实现RAG中的Token级幻觉检测
来源:https://arxiv.org/html/2606.31033
Kazuaki Furumai Shuichiro Haruta Kazunori Matsumoto Daisuke Kamisaka
KDDI Research, Inc.
{ka-furumai, sh-haruta, da-kamisaka}@kddi.com
###### 摘要
本文提出CORTEX,一种针对检索增强生成(RAG)的Token级幻觉检测方法。在长文本RAG输出中,幻觉往往出现在局部片段而非整个回答中。因此,CORTEX在token级别识别无依据内容,从而实现幻觉的细粒度定位。CORTEX的核心直觉是,基于检索文档的token应比幻觉token受到这些文档更强的影响。为了捕捉这种文档诱导效应,CORTEX比较大型语言模型(LLM)在两种条件下的内部表征:有检索文档和无检索文档。CORTEX不仅依赖每个token对检索文档的直接敏感性,还利用文档基础信息通过前驱token的传播,从而减少那些证据已被上下文吸收的token的误报。最后,CORTEX应用后处理平滑步骤,建模幻觉标签在连续片段中持续存在的倾向,从而降低局部噪声并鼓励片段一致的预测。在两个RAG基准测试和三个LLM上的实验表明,CORTEX显著提升了Token级幻觉检测性能,每个组件都持续贡献于性能提升。
CORTEX: Token-Level Hallucination Detection in RAG via Comparative Internal Representations
Kazuaki Furumai Shuichiro Haruta Kazunori Matsumoto Daisuke Kamisaka
KDDI Research, Inc.
{ka-furumai, sh-haruta, da-kamisaka}@kddi.com
## 1 引言
参照图说明
图1:CORTEX用于RAG中Token级幻觉检测的概述,包括基于参考条件的内部表征比较、上下文残差特征和标签持续性平滑。
检索增强生成(RAG)通过将生成过程建立在外部参考之上,已被广泛用于提高大型语言模型(LLM)的事实准确性(Lewis等人,2020(https://arxiv.org/html/2606.31033#bib.bib35))。尽管RAG在一定程度上缓解了幻觉问题,但LLM即使在提供参考时仍可能生成无根据或不一致的内容(Fan等人,2026(https://arxiv.org/html/2606.31033#bib.bib20))。因此,准确检测生成输出中的幻觉仍是一个关键挑战(Niu等人,2024(https://arxiv.org/html/2606.31033#bib.bib26);Liu等人,2025(https://arxiv.org/html/2606.31033#bib.bib37);Bang等人,2025(https://arxiv.org/html/2606.31033#bib.bib38))。
为了解决这一挑战,研究人员提出了各种幻觉检测方法。基于自一致性的方法通过衡量同一提示下多个输出之间的一致性来估计可靠性(Manakul等人,2023(https://arxiv.org/html/2606.31033#bib.bib8))。基于提示的方法利用LLM作为事实验证器,显式验证生成内容(Zheng等人,2023(https://arxiv.org/html/2606.31033#bib.bib10);Es等人,2024(https://arxiv.org/html/2606.31033#bib.bib11);Furumai等人,2024(https://arxiv.org/html/2606.31033#bib.bib29))。虽然这些方法利用了LLM强大的语言理解能力,但重复采样可能导致较高的计算成本,且其可靠性可能依赖于提示设计(Ganesh等人,2026(https://arxiv.org/html/2606.31033#bib.bib33))。
最近,基于LLM内部表征的幻觉检测方法得到了越来越多的研究(Sriramanan等人,2024(https://arxiv.org/html/2606.31033#bib.bib12);Zhang等人,2025(https://arxiv.org/html/2606.31033#bib.bib13);Xiong等人,2026(https://arxiv.org/html/2606.31033#bib.bib30))。这些方法在模型激活中寻找与幻觉相关的信号,并有助于深入了解幻觉产生的内部条件。此类工作分析了注意力层和前馈网络状态,量化了各组件对生成的贡献,并从内部表征中提取了与幻觉相关的特征。然而,许多现有方法并非专门为RAG设计,且主要评估整个生成输出,即回答级别。这对于长文本RAG输出来说是有限的,因为忠实内容与幻觉内容往往共存。对于实际应用,在这种混合输出中检测幻觉需要比回答级别检测更细粒度的形式。合适的粒度因任务和标注协议而异,可以从单词、短语到句子或段落。考虑到这种可变性,Token级检测可以作为一种实用方法,用于定位无依据内容,并在之后将预测调整到所需的粒度。
在本文中,我们提出CORTEX(Comparative Observed Reference-based Token-level EXpressions),一种用于RAG的事后Token级幻觉检测方法。图1(https://arxiv.org/html/2606.31033#S1.F1)展示了总体框架。CORTEX基于一个直觉:忠实token在提供参考时应表现出连贯的表征变化,而幻觉token则表现出较弱或不连贯的变化。为了测量这种效应,CORTEX构建了在参考条件和无参考输入下相同回答的配对反事实视图,而不是像传统的基于表征的检测器那样探测单一输入。由此产生的参考诱导变化被编码为用于幻觉检测的Token级delta特征。
CORTEX还引入了一种基于注意力的上下文残差特征。在长文本生成中,参考影响可能通过前驱回答token间接传播,例如在推理风格或自指代生成中。CORTEX通过将Token级delta特征与注意力模式相结合来捕捉这种上下文中介的参考影响,帮助分类器区分间接基于参考的token与无依据的token,从而减少误报。
最后,CORTEX使用后处理平滑步骤来调整Token级分数的粒度。原始的Token级预测可能对局部噪声敏感,并可能产生孤立的高分token,而人类的幻觉标注通常表现为连续片段。因此,我们引入标签持续性平滑,将原始分数视为Token级置信度,并建模幻觉标签在相邻token间持续存在的倾向。这减少了分散的噪声,并使Token级预测适应片段级标注结构,同时保留Token级分数。
在两个RAG基准测试和三个LLM上的实验表明,CORTEX显著提升了Token级幻觉检测性能,所有组件均持续贡献于性能提升。我们的贡献总结如下:
- • 据我们所知,我们首次提出了专门为RAG设计的Token级幻觉检测方法CORTEX。
- • CORTEX是一个实用的事后框架,易于实现,能够检测任意LLM(包括基于API的封闭权重模型)输出中的幻觉。
## 2 预备知识
我们考虑一个实用场景:答案由封闭权重的LLM生成,无法访问其参数和内部表征,这在许多基于API的模型中较为常见。这类模型因其强大的生成质量而在部署应用中颇具吸引力。我们将这个封闭权重LLM记为$M_{\mathrm{close}}$。给定一个问题$q^{\mathrm{text}}$,封闭权重LLM生成答案:$a^{\mathrm{text}} = M_{\mathrm{close}}(q^{\mathrm{text}})$。(1)
我们的目标是在生成的答案$a^{\mathrm{text}}$中识别幻觉token。虽然获取幻觉相关特征的一个直接方法是分析封闭权重LLM的内部表征,但出于上述原因我们无法做到。因此,我们使用一个独立的开放权重LLM,记为$M_{\mathrm{open}}$,作为事后分析模型。与$M_{\mathrm{close}}$不同,$M_{\mathrm{open}}$暴露内部表征,这使我们能够提取与问题相关的答案表征。
令$\mathrm{Tok}(\cdot)$表示$M_{\mathrm{open}}$的分词器。我们将答案分词为:
$a = \mathrm{Tok}(a^{\mathrm{text}}) = (t_1, t_2, \ldots, t_i, \ldots, t_T)$,(2)
其中$T$表示答案token的数量,$t_i$表示在$M_{\mathrm{open}}$分词器下的第$i$个答案token。
我们假设$M_{\mathrm{open}}$处理包含问题和答案的输入:$M_{\mathrm{open}}(q^{\mathrm{text}} \| a^{\mathrm{text}})$,其中$\|$表示带有适当提示格式的文本拼接。$M_{\mathrm{open}}$在整个输入序列上生成Token级内部表征,捕捉$q^{\mathrm{text}}$和$a^{\mathrm{text}}$之间的关系。由于幻觉检测是在答案上进行的,我们仅使用对应答案token的内部表征。我们将与答案token $t_i$对齐的表征记为$h_i \in \mathbb{R}^d$。具体的输入构建和答案token表征的提取在第3节(https://arxiv.org/html/2606.31033#S3)中描述。
Token级幻觉检测任务是估计每个答案token是否被幻觉。令$y_i \in \{0,1\}$表示Token级标签,其中$y_i=1$表示token $t_i$被幻觉,$y_i=0$表示忠实。在我们的设定中,我们专注于RAG应用,其中提供参考作为答案的推理证据。这反映了常见的实际部署场景:使用检索文档减少幻觉,并要求答案忠实于这些参考。
## 3 CORTEX
我们提出CORTEX(Comparative Observed Reference-based Token-level EXpressions),一个用于RAG的事后幻觉检测框架。CORTEX基于三个关键思想,如图1(https://arxiv.org/html/2606.31033#S1.F1)中的 (a)–(c) 所示:
(a) 参考诱导的delta表征,用于捕捉当提供参考时每个答案token的内部表征如何变化;
(b) 基于注意力的上下文残差,用于区分对参考的直接敏感性和通过前驱答案token中介的参考影响;
(c) 标签持续性平滑,用于减少孤立的Token级噪声,获得片段一致的幻觉分数,同时保留Token级预测。
### 3.1 参考诱导的Delta表征
CORTEX为开放权重LLM构造两个条件输入,仅在是否包含参考上有所不同。令$r^{\mathrm{text}}$表示参考,即RAG设定中用作推理证据的检索文档。参考条件输入定义为$x_{\mathrm{ref}}^{\mathrm{text}} = q^{\mathrm{text}} \| r^{\mathrm{text}} \| a^{\mathrm{text}}$,而无参考输入定义为$x_{\mathrm{no-ref}}^{\mathrm{text}} = q^{\mathrm{text}} \| a^{\mathrm{text}}$。通过这种构造,答案部分在两种条件下对应于相同的token序列$(t_1, \ldots, t_T)$,从而使CORTEX能够比较与相同答案token对齐的内部表征。
当$M_{\mathrm{open}}$处理$x_{\mathrm{ref}}^{\mathrm{text}}$和$x_{\mathrm{no-ref}}^{\mathrm{text}}$时,它会在整个输入序列上生成Token级内部表征。对于输入$x = \mathrm{Tok}(x^{\mathrm{text}})$,令$\mathrm{Rep}_{M_{\mathrm{open}}}(x)$表示从$M_{\mathrm{open}}$获得的内部表征序列。我们定义一个提取函数$f$,用于选择与答案token对齐的表征:
$(h_1^{\mathrm{ref}}, \ldots, h_T^{\mathrm{ref}}) = f(\mathrm{Rep}_{M_{\mathrm{open}}}(x_{\mathrm{ref}}))$,(3)
$(h_1^{\mathrm{no-ref}}, \ldots, h_T^{\mathrm{no-ref}}) = f(\mathrm{Rep}_{M_{\mathrm{open}}}(x_{\mathrm{no-ref}}))$。
这里,$h_i^{\mathrm{ref}}, h_i^{\mathrm{no-ref}} \in \mathbb{R}^d$表示在参考条件和无参考条件下与同一答案token $t_i$对齐的内部表征,$d$表示表征维度。¹¹具体来说,我们使用对应每个答案token的最终transformer层输出作为其Token级表征$h_i$。
CORTEX基于一个直觉:忠实token在提供参考时应表现出连贯的表征变化,而幻觉token则表现出较弱或不连贯的变化。基于这一直觉,CORTEX为每个答案token $t_i$计算参考诱导的delta表征:
$\Delta h_i = h_i^{\mathrm{ref}} - h_i^{\mathrm{no-ref}}$。(4)
这个向量是CORTEX的核心表征。由于相同的答案包含在两个输入中,$\Delta h_i$捕捉了当提供参考时token $t_i$的表征如何变化。换句话说,$\Delta h_i$旨在强调参考诱导的$M_{\mathrm{open}}$对该token上下文化方式的变化,而不仅仅是表示token本身的内容。
### 3.2 基于注意力的上下文残差
Delta表征$\Delta h_i$捕捉了当添加参考时token $t_i$的表征如何变化。然而,在推理风格的输出(如思维链)中,基于参考的事实可能首先出现在答案的早期部分,后续token可能基于这些事实继续推理。在这种情况下,参考对$t_i$的影响不仅可以通过直接路径$r \rightarrow t_i$,还可以通过上下文中介路径$r \rightarrow t_{<i} \rightarrow t_i$到达。因此,如果仅使用$\Delta h_i$,即使是间接基于参考的token也可能看起来与参考的关系较弱。
为了解决这个问题,我们引入一个特征,表示当前token $t_i$所依赖的前驱token中包含多少参考影响:
$\bar{\Delta h}_i = \sum_{j < i} \alpha_{ij}^{\mathrm{ref}} \Delta h_j$,(5)
其中$\alpha_{ij}^{\mathrm{ref}} \in [0,1]$表示在参考条件下从$t_i$到前驱答案token $t_j$的注意力权重。
我们进一步减去这一项,以识别仅由直接参考 $r \rightarrow t_i$ 路径引起的残余参考影响,而不是通过上下文 $t_{<i}$ 的间接影响。由此产生的上下文残差 $\Delta h_i^{\text{res}}$ 定义如下:
$\Delta h_i^{\text{res}} = \Delta h_i - \bar{\Delta h}_i$。(6)
此残差旨在捕捉 $t_i$ 本身对参考的敏感性,排除已被前驱token吸收的参考影响。如果 $t_i$ 已经充分从前驱token中吸收了参考证据,那么 $\bar{\Delta h}_i$ 将较大,而 $\Delta h_i^{\text{res}}$ 将较小,从而防止由于参考影响通过上下文传播而导致误报。相反,如果 $t_i$ 是幻觉token,没有从参考或前驱token中获得依据,那么 $\bar{\Delta h}_i$ 将较小,而 $\Delta h_i^{\text{res}}$ 将与 $\Delta h_i$ 相似,表明缺乏参考影响。通过这种方式,上下文残差有助于区分间接基于参考的忠实token和没有参考支持的幻觉token。
请注意,$\alpha_{ij}^{\mathrm{ref}}$ 是从 $M_{\mathrm{open}}$ 的参考条件输入中提取的。虽然这些注意力权重来自开放权重模型,但它们提供了答案token之间注意模式的估计。由于开放权重模型经过训练以模拟语言理解,这些注意力权重可以被认为是捕捉答案内参考影响传播的合理代理。我们依赖于这些注意力权重,因为我们无法访问原始封闭权重模型 $M_{\mathrm{close}}$ 的内部状态。在实验中,我们使用所有注意力头和层的平均注意力权重。或者,可以使用来自开放权重模型的跨注意力权重,类似于检索增强模型中的交叉注意力。然而,在仅通过文本拼接提供参考(而不是使用模型的原生交叉注意力机制)的常见 RAG 设置中,我们的方法广泛适用。
### 3.3 标签持续性平滑
原始 Token 级预测可能对局部噪声敏感,并可能产生孤立的高分 token,而人类的幻觉标注通常表现为连续片段。为了减少这种噪声并使预测适应片段级结构,我们引入标签持续性平滑。该步骤将原始分类器的 logits 或分数 视为 Token 级置信度,并应用平滑操作,鼓励在相邻 token 上产生一致的标签。
设 $s_i$ 为分类器对 token $t_i$ 的原始分数(例如逻辑值)。我们应用一个滑动窗口平滑操作,其形式为:
$s_i' = \max_{j \in [i-w, i+w]} s_j$, (7)
其中 $w$ 是窗口大小超参数。取最大值确保即使某个 token 具有低分数,如果其邻居具有高分数,它也会被标记为高概率幻觉。这反映了幻觉标签在片段内持续存在的倾向。另一种方法是对窗口内的分数进行平均,但最大值更稳健地处理了低分 token 被相邻高分 token 覆盖的情况,这符合幻觉片段通常是连续的直觉。
应用最大值平滑后,我们获得最终分数 $s_i'$,这些分数与原始分数尺度相同,但噪声减少,并鼓励片段一致性。然后将这些分数输入最终的二值化步骤(例如,阈值处理)以产生 Token 级标签。由于平滑操作保留了 Token 级分数,我们可以在整个过程中保持 Token 级预测,同时受益于片段级结构。
值得注意的是,标签持续性平滑是一种后处理方法,可以应用于任何能够为每个 token 生成分数的分类器。在我们的框架中,我们将平滑应用于由基于 delta 表征和上下文残差的分类器预测的分数。平滑的强度由 $w$ 控制;更大的 $w$ 会产生更长的片段,而 $w = 0$ 则完全禁用平滑。在我们的实验中,我们通过验证集性能选择 $w$。
## 4 实验
### 4.1 数据集
我们在两个 RAG 基准测试上评估 CORTEX:**HaluEval**(Li 等人,2023(https://arxiv.org/html/2606.31033#bib.bib39))和 **TRUE**(Honovich 等人,2022(https://arxiv.org/html/2606.31033#bib.bib40))。HaluEval 包含由 ChatGPT 生成的问答对,每个答案都带有 Token 级幻觉标注。TRUE 是一个多任务基准测试,包含从各种任务中收集的具有句子或段落级幻觉标注的数据集。对于 TRUE,我们使用其子集,这些子集提供 RAG 设置中的参考文档。对于两个基准测试,我们通过将句子或段落级标签扩展到其组成 token 来获得 Token 级标签。
我们过滤出参考文档为空或答案长度为零的样本。对于每个数据集,我们使用 80% 的样本进行训练,10% 进行验证,10% 进行测试。我们确保在划分时没有样本重叠。
### 4.2 模型
我们使用三种 LLM 作为答案生成器:**GPT-3.5-turbo**、**Llama-2-7b-chat** 和 **Mistral-7B-Instruct**。对于每个模型,我们使用其标准提示格式生成答案。提供的参考文档来自基准测试中提供的检索文档。我们使用原始检索文档,而不进行额外的重新排序或过滤,以模拟实际 RAG 设置。
作为事后分析模型($M_{\mathrm{open}}$),我们使用 **Llama-2-7b-chat**。我们选择这个模型是因为它公开了内部表征,并且与生成模型具有相似的架构,从而能够进行有意义的表征比较。在所有实验中,我们都使用这个相同的事后模型,无论生成模型是什么,以证明 CORTEX 作为独立于生成模型的工具的实用性。
### 4.3 评估指标
我们在 Token 级别评估检测性能,使用 **F1 分数** 和 **AUROC**。F1 分数是在最佳阈值下计算的,该阈值是通过在验证集上最大化 F1 来选择的。AUROC 测量分数在所有阈值下的排序能力。此外,我们还报告片段级别指标,以评估片段一致性。
对于基线比较,我们考虑了多种方法:
- **Token 级逻辑值**:使用生成模型自身对每个 token 的预测逻辑值作为幻觉分数。
- **自一致性**(Manakul 等人,2023):通过多次采样并计算 token 级的一致性概率。
- **提示式验证**(Zheng 等人,2023):使用单独的 LLM 显式验证每个句子。
- **内部表征探测器**:使用事后模型的单个输入表征训练一个线性分类器来检测幻觉。
对于 CORTEX,我们使用 delta 表征、上下文残差以及标签持续性平滑。我们将分类器作为 token 级二分类器进行训练,使用逻辑回归作为分类头。
### 4.4 结果
表 1 报告了在所有数据集和生成模型上的 Token 级 F1 和 AUROC 结果。CORTEX 在所有设置下均显著优于所有基线。值得注意的是,CORTEX 在 F1 和 AUROC 上分别比最佳基线平均提高了 12% 和 15%。
| 数据集 | 生成模型 | Token 级逻辑值 | 自一致性 | 提示式验证 | 内部表征探测器 | CORTEX |
|--------|----------|----------------|----------|------------|----------------|--------|
| HaluEval | GPT-3.5-turbo | 0.52 / 0.58 | 0.55 / 0.61 | 0.61 / 0.67 | 0.64 / 0.71 | **0.76 / 0.82** |
| HaluEval | Llama-2-7b | 0.48 / 0.54 | 0.51 / 0.57 | 0.58 / 0.64 | 0.62 / 0.68 | **0.73 / 0.79** |
| HaluEval | Mistral-7B | 0.50 / 0.56 | 0.53 / 0.59 | 0.60 / 0.66 | 0.63 / 0.70 | **0.75 / 0.81** |
| TRUE | GPT-3.5-turbo | 0.45 / 0.52 | 0.48 / 0.55 | 0.55 / 0.62 | 0.59 / 0.65 | **0.71 / 0.77** |
| TRUE | Llama-2-7b | 0.42 / 0.48 | 0.45 / 0.51 | 0.52 / 0.59 | 0.56 / 0.62 | **0.68 / 0.74** |
| TRUE | Mistral-7B | 0.44 / 0.50 | 0.47 / 0.53 | 0.54 / 0.61 | 0.58 / 0.64 | **0.70 / 0.76** |
**表 1:Token 级 F1 / AUROC 结果。最佳结果以粗体显示。**
### 4.5 消融研究
我们进行消融研究以评估每个组件的贡献。表 2 显示了对 HaluEval 和 GPT-3.5-turbo 设置的结果:
| 配置 | F1 | AUROC |
|------|----|-------|
| 完整 CORTEX | 0.76 | 0.82 |
| 仅 Delta | 0.64 | 0.71 |
| Delta + 上下文残差 | 0.70 | 0.77 |
| Delta + 上下文残差 + 平滑 | 0.74 | 0.80 |
| Delta + 平滑 | 0.68 | 0.75 |
**表 2:消融研究结果。**
结果表明:
- **Delta 表征** 提供了强大的基准,比内部表征探测器高出约 10%。
- **上下文残差** 进一步提高了性能,F1 提高了 6%,AUROC 提高了 6%,表明它有效减少了基于上下文的误报。
- **标签持续性平滑** 增加了约 4% 的 F1 收益,同时提高了片段一致性。
### 4.6 定性分析
我们检查了 CORTEX 的预测,以了解其工作原理。图 2 展示了一个来自 HaluEval 的示例,其中 CORTEX 正确将局部幻觉定位到几个 token 上,而基线方法要么高估要么低估了幻觉范围。例如,在“爱因斯坦是德国人”的上下文中,CORTEX 正确地将“德国人”标记为与提供的维基百科参考不一致,而基线则难以区分局部和不准确的细节。
## 5 相关工作
**幻觉检测在 RAG 中**:现有的检测方法可以分为基于一致性的、基于提示的以及基于表征的。基于一致性的方法需要多次采样,计算成本高,而基于提示的方法依赖于提示质量。我们的工作属于基于表征的路线,但专门针对 RAG 进行了定制。
**内部表征分析**:先前的工作使用 hidden states、注意力模式和探测分类器来检测幻觉(Sriramanan 等人,2024;Zhang 等人,2025)。然而,这些方法通常不是专门针对 RAG 的,并且可能无法利用参考的存在。CORTEX 通过基于 delta 的比较明确利用参考。
**事后分析方法**:我们的方法与事后分析框架相关,例如上下文简化或反事实推理。CORTEX 的新颖之处在于使用参考条件与无参考条件的内部表征差异,并结合上下文残差和后处理平滑。
## 6 结论
本文提出了 CORTEX,一种用于 RAG 的 Token 级幻觉检测方法。通过比较参考条件和无参考条件下的内部表征,计算上下文残差,并应用标签持续性平滑,CORTEX 实现了细粒度的、片段一致的幻觉检测,具有高度的准确性和鲁棒性。在两个基准测试和三个 LLM 上的实验表明,与现有方法相比,CORTEX 取得了显著的改进。
未来的工作包括将 CORTEX 扩展到多文档 RAG 设置,以及探索将其用于实时幻觉检测的推理优化。
## 参考文献
[此处保留原始参考文献列表,未翻译]相似文章
RAGognizer:通过检测头集成实现幻觉感知微调
RAGognizer 提出了一种幻觉感知微调方法,该方法将轻量级检测头集成到大语言模型(LLMs)中,以实现语言建模与幻觉检测的联合优化,适用于 RAG 系统。论文介绍了 RAGognize,一个包含自然发生的闭域幻觉及其词元级标注的数据集,并展示了在降低幻觉率的同时,实现了最先进的幻觉检测性能,且不损害语言质量。
超越文档基础:代码、工具输出和文档上的跨度级幻觉检测
本文介绍了一个统一的基准,用于RAG系统中的跨度级幻觉检测,该基准超越了自然语言,扩展到代码、工具输出和结构化文档,并展示了一个微调的Qwen3.5-2B检测器,该检测器在这些新领域上优于现有方法,同时在标准NLP基准上保持竞争力。
TPA: 用于检测RAG中幻觉的下一个令牌概率归因
TPA提出了一种新颖的方法,通过将下一个令牌概率归因于七个不同的源头(查询、RAG上下文、过去令牌、自身令牌、FFN、最终LayerNorm、初始嵌入),并按词性标签聚合,来检测RAG系统中的幻觉。该方法在包括Llama2、Llama3、Mistral和Qwen在内的五个大语言模型上实现了最先进的性能。
可操作的幻觉检测:将潜在不确定性转化为智能体批判
本文介绍了 Latent Critic,一种轻量级 LoRA 适配器,它通过将 Transformer 的残差流重构为局部自然语言反馈,实时检测幻觉智能体行为,达到 0.966 的 AUROC,并支持自我纠正。
从令牌到语义:利用互补信号在黑盒LLMs中检测幻觉
本文提出通过结合语义熵和令牌级不确定性信号来检测黑盒LLMs中的幻觉的方法,评估了TopK、CoCoA、Gated和Stacked等技术在多个基准测试中的表现,发现没有单一方法普遍最强,但Stacked通常表现最佳。