幻觉自我对弈:通过进化生成器引导强化检测器

arXiv cs.CL 论文

摘要

介绍幻觉自我对弈(HSP),一种通过强化学习利用进化生成器引导检测器的框架,使小型LLM在忠实性幻觉检测上无需外部监督即可媲美先进LLM。

arXiv:2607.07993v1 Announce Type: new 摘要:识别LLM生成输出中的忠实性幻觉仍具挑战性,因高质量标注数据稀缺。近期工作依赖先进LLM合成训练数据,包括理由、标签和幻觉声明。然而,这些方法将生成器视为静态组件,限制了检测器的迭代改进。为解决此限制,我们提出幻觉自我对弈(HSP),一种新颖框架,使检测器能够与进化生成器共同引导。HSP包含两个从同一基础模型初始化的角色:一个检测模型输出忠实性的检测器,以及一个生成越来越难检测的幻觉响应的生成器。具体而言,检测器首先在人工标注数据上微调,然后作为奖励模型,通过来自AI反馈的强化学习(RLAIF)训练生成器。反过来,进化后的生成器合成幻觉数据,通过基于规则的强化学习进一步优化检测器。在RAGTruth基准和两个模型系列上的实验表明,所提框架能逐步增强小型LLM,使其无需外部监督即可匹配甚至超越先进LLM。我们的代码可在 https://anonymous.4open.science/r/Hallucination-Self-Play-50B5 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:12

# 幻觉自我博弈:通过演化生成器自举增强检测器

来源:https://arxiv.org/html/2607.07993

Shiping Yang¹,², Shining Liang², Weihao Liu³, Wenbiao Ding², Linjun Shou², Lu Cheng³, Angel X. Chang¹

¹西蒙菲莎大学  
²微软  
³伊利诺伊大学芝加哥分校  

###### 摘要

识别LLM生成输出中忠实性幻觉仍具挑战,主要原因是高质量标注数据稀缺。近期研究依赖先进LLM来合成训练数据,包括推理过程、标签和幻觉陈述。然而,这些方法将生成器视为静态组件,限制了检测器的迭代改进。为克服这一局限,我们提出幻觉自我博弈(HSP)框架,使检测器能够与演化生成器自举。HSP包含两个角色,初始化自同一基础模型:检测器评估模型输出是否忠实,生成器则产生越来越难以检测的幻觉响应。具体而言,检测器先经人工标注数据微调,随后被用作奖励模型,通过基于AI反馈的强化学习(RLAIF)训练生成器。反过来,演化后的生成器合成幻觉数据,通过基于规则的强化学习进一步优化检测器。在RAGTruth基准和两个模型系列上的实验表明,所提框架能逐步增强小型LLM,使其在不依赖外部监督的情况下匹配甚至超越先进LLM。我们的代码见 https://anonymous.4open.science/r/Hallucination-Self-Play-50B5。

## 1 引言

尽管大型语言模型(LLM)在多个领域展现出卓越能力 (Li et al., 2025; Yu et al., 2025b; Zhang et al., 2025; Jiang et al., 2026),它们在处理长尾知识或过时信息时仍易产生幻觉。检索增强生成(RAG)通过将模型响应锚定在检索文档中,已成为提升事实性的有效范式 (Arslan et al., 2024; Yang et al., 2025b)。然而,即使使用了RAG,LLM仍会出现忠实性幻觉,即生成与所提供上下文矛盾或无法支持的陈述 (Yang et al., 2023; Huang et al., 2025; Jiang and Ferraro, 2026)。因此,检测这类幻觉对于提供可信赖的LLM服务至关重要。

先前的工作利用先进LLM判断模型响应是否包含幻觉 (Dhuliawala et al., 2024; Jacovi et al., 2025; Seo et al., 2025)。这些方法性能虽优,但由于推理成本高、延迟大,在实际应用中不可行。这促使了轻量级专用检测器的开发,以实现高效幻觉检测。然而,人类标注的高成本和稀缺性限制了检测器性能的进一步提升。为应对这一问题,近期研究通过定制生成流程直接合成幻觉陈述 (Cao et al., 2023; Tang et al., 2024; Tan et al., 2024; Lei et al., 2025)。这类方法的一个关键局限是幻觉生成器通常是静态的,缺乏对检测器能力演化的适应性。结果,检测器很快达到性能瓶颈,因为合成的幻觉变得过于简单,无法为进一步改进提供有效的训练信号。

为克服这一局限,我们提出**幻觉自我博弈(HSP)**,一种两个角色之间的闭环交互:**生成器**和**检测器**,两者都从同一基础模型初始化。生成器根据检测器的反馈被优化,以产生多样且具有挑战性的幻觉;而检测器则通过RLVR在生成的合成数据上进行训练。这种交互使两个角色无需外部监督即可共同进化。虽然自我博弈在代码生成和数学推理等易验证任务中已取得巨大成功 (Zhao et al., 2025; Chen et al., 2025b; Liang et al., 2026),但其在幻觉检测中的应用仍未被充分探索,主要原因是验证所生成幻觉有效性和正确性的根本挑战。缺乏可靠的验证机制,训练过程容易受到奖励欺骗(reward hacking)的影响,即生成器可能利用表面捷径获取奖励,而非产生真正有挑战性的幻觉。为此,我们利用问答数据集中的真实标签作为验证代理,并引入额外安全措施。

我们在RAGTruth基准上评估HSP,涵盖两种设置。在**不含CoT的检测器**设置中,我们展示HSP可作为即插即用方法,仅需一轮即可进一步提升微调后的检测器。在更具挑战性的**含CoT的检测器**设置中,我们证明自我博弈能使小型模型以完全自举方式达到与先进LLM相当的性能,无需外部推理过程监督。

我们的贡献可归纳为三点:(1) 将自我博弈范式扩展到幻觉检测任务,克服静态生成器的局限。(2) 引入额外验证机制以缓解奖励欺骗。进一步的消融研究证实这些机制在抑制此类行为方面有效,这对维持合成数据质量和检测器稳定训练至关重要。(3) 实验表明我们的框架取得了强性能,并释放了完全自举学习的潜力。

## 2 相关工作

### 2.1 幻觉检测

现有忠实性幻觉检测方法主要沿两个方向。第一种依赖先进LLM评估LLM生成输出 (Dhuliawala et al., 2024; Jacovi et al., 2025; Seo et al., 2025)。虽然有效,但这些方法在实践中往往低效,因为它们依赖先进LLM。为降低成本,第二个研究方向专注于训练轻量级、可部署的检测器。由于人类标注数据稀缺,近期研究转向合成幻觉生成以训练能力更强的检测模型 (Cao et al., 2023)。MiniCheck (Tang et al., 2024) 使用先进LLM合成训练数据,而FactCG (Lei et al., 2025) 通过基于图的多跳增强进一步增加数据复杂度。然而,现有方法依赖静态生成器,其固定的幻觉模式逐渐变得容易被检测器识别,从而限制了进一步改进。为解决这一问题,我们提出幻觉自我博弈框架,通过演化生成器自举检测器。

### 2.2 自我博弈

自我博弈是强化学习中的一种范式,其中智能体通过与自身副本或共同进化的对手交互来改进 (Schmidhuber, 2013; Schaul, 2024)。该范式在AlphaGo (Silver et al., 2017a) 和AlphaZero (Silver et al., 2017b) 取得重大进展后变得流行,后者证明仅凭自我博弈即可在复杂决策任务中实现超人类表现,无需人类监督。最近,自我博弈在大型语言模型中也被积极探索。Language Self-Play (Kuba et al., 2025) 提出挑战者-求解器框架,语言模型通过自我博弈生成训练样例,无需人工标注数据即可自我改进。AbsoluteZero (Zhao et al., 2025) 进一步探索此范式,实现了自我博弈推理,模型生成推理问题并通过代码执行器验证解。另一类工作将自我博弈形式化为对抗博弈 (Goodfellow et al., 2020)。例如,SPC (Chen et al., 2025b) 设计了生成器与评论家之间的对抗博弈,以提升评论家能力。尽管取得这些进展,现有自我博弈工作主要集中在提升数学或代码任务的推理性能。相比之下,我们的工作将自我博弈应用于幻觉检测,提出了幻觉自我博弈框架,使检测器能够持续自我改进。

## 3 方法论

在本节中,我们提出**幻觉自我博弈(HSP)**框架,通过演化生成器自动合成难以检测的幻觉响应,从而自举检测器(图1)。我们首先形式化检测器和生成器的任务,并详细说明这两个角色如何从同一基础模型初始化(§3.1)。接着,我们介绍两个角色的训练算法及相应的奖励设计(§3.2)。最后,我们描述闭环自我博弈流程,说明检测器与生成器之间的迭代交互(§3.3)。

![图1:HSP框架概述](https://arxiv.org/html/2607.07993#S3.F1)  
图1:HSP框架概述。生成器通过RLAIF演化,冻结的检测器提供奖励信号。为简洁起见,省略了缓解奖励欺骗的组件(上图)。检测器通过RLVR在冻结生成器生成的合成数据上进行优化。Faith Gen表示基础模型M被提示生成忠实响应(下图)。两个角色在闭环中交互,每次交替冻结一个角色,训练另一个角色。

### 3.1 两个角色:检测器与生成器

HSP框架由两个交互角色组成:检测器和生成器。两个角色都从同一基础模型实例化,但针对不同的输入、输出和训练目标进行专门化。

#### 3.1.1 任务形式化

##### 幻觉检测

给定一个支撑文档 `doc` 和一个 LLM 生成的陈述 `c`,检测器模型 `D` 负责判断该陈述是忠实还是幻觉。我们认为一个陈述是忠实的当且仅当它被支撑文档完全支持;反之,如果它与所提供上下文矛盾或无法验证,则视为幻觉。虽然先前工作通常将幻觉检测形式化为二分类任务 (Yang et al., 2023; Tang et al., 2024; Seo et al., 2025),但许多实际应用需要定位具体的幻觉片段。为此,借鉴 Niu et al. (2024) 的方法,我们训练模型生成结构化输出序列 `z`,以JSON格式表示幻觉片段。形式上,检测器 `D` 建模条件概率:

\[
P_D(y, z \mid doc, c), \tag{1}
\]

其中 `y` 是从 `z` 导出的二值标签,若 `z` 为空(即未识别到幻觉片段),则 `y=0`,否则 `y=1`。近期工作表明,学习到的推理过程有助于幻觉片段检测 (Su et al., 2025)。因此,我们将检测器进一步扩展为一个变体,该变体不仅预测幻觉片段,还生成推理过程 `cot`(即思维链)来证明其预测。该变体可形式化为:

\[
P_D(y, z, cot \mid doc, c). \tag{2}
\]

##### 幻觉生成

给定一个查询 `q` 及其对应的支撑文档 `doc`,生成器模型 `G` 被设计为有意合成幻觉陈述。这类合成陈述表面看似合理,但包含与给定文档不一致的内容。形式上:

\[
P_G(c \mid q, doc, y=1), \tag{3}
\]

其中 `y=1` 表示生成器被条件化以生成幻觉。

#### 3.1.2 角色初始化

此阶段旨在为模型赋予基本的幻觉检测和幻觉生成能力,作为后续自我博弈强化学习阶段的初始化。

##### 初始化检测器

我们通过在小型数据集 `D_sft` 上对基础模型 `M` 进行监督微调(SFT)来冷启动检测器 `D`。我们考虑检测器的两种变体,并描述其 SFT 数据的获取方式。对于不含思维链的检测器变体,`D_sft` 来自人工标注的 RAGTruth 数据集 (Niu et al., 2024)。每个训练实例包含一个支撑文档 `doc`、一个生成的陈述 `c` 以及一个带有标注幻觉片段的结构化标签 `z`。对于含思维链的检测器变体,现有的训练数据集仅提供预测标签,缺乏推理过程标注。弥补这一差距的常见方法是利用先进 LLM 合成带有推理过程的数据用于蒸馏 (Song et al., 2024)。相比之下,我们研究小型 LLM 是否能在没有标注推理过程数据的情况下,自我自举其幻觉片段检测的推理能力。因此,我们采用拒绝采样策略,从模型自身挖掘高质量的推理路径,以片段级别的标注作为过滤信号。具体地,对于每个 `(doc, c)` 对,我们从基础模型 `M` 中采样多个候选推理过程,指示其同时生成推理轨迹和幻觉片段。未能识别所有标注幻觉片段的候选被拒绝,仅保留预测片段完全覆盖真实标注的候选。所得的样本被视为伪标注的推理过程数据,并汇总形成 `D_sft`。利用构建的 SFT 数据集,我们微调检测器以最大化目标输出 `o` 的条件似然:

\[
\mathcal{L}_{\text{sft}}(\theta_D) = -\mathbb{E}_{(doc, c, o) \sim \mathcal{D}_{\text{sft}}} \left[ \log P_D(o \mid doc, c) \right], \tag{4}
\]

其中对于不含 CoT 的检测器,`o = z`;对于含 CoT 的检测器,`o = (z, cot)`。

相似文章

PARALLAX: 区分真实幻觉检测与基准构建伪影

arXiv cs.CL

本文揭示了LLM幻觉检测领域报道的许多进展实际上源于基准构建伪影,其中真实答案被嵌入到提示中,使得简单的文本相似度基线方法能够获得近乎完美的分数。通过大规模受控评估,作者证明,在适当控制下,大多数方法的表现接近随机水平,除了对上层隐藏状态的监督探针(如SAPLMA)以及他们提出的DRIFT。

HalluSAE:利用稀疏自编码器检测大型语言模型中的幻觉

arXiv cs.CL

北京航空航天大学等机构的研究人员提出了HalluSAE,这是一个结合稀疏自编码器与相变理论的框架。该框架通过将生成过程建模为穿越势能地形的轨迹,来检测大型语言模型(LLM)中的幻觉,并精准定位发生事实性错误的关键过渡区域。

幻觉检测中的自动层选择

arXiv cs.AI

本文提出了用于大语言模型幻觉检测的自动层选择方法,并引入了固有维度首个有效峰值(FEPoID),这是一种无需训练的标准,能够一致地识别出最优中间层,优于现有启发式方法。

将幻觉视为异常:通过概率电路进行动态干预

arXiv cs.CL

本文提出了 PCNet,这是一种在大型语言模型(LLM)残差流上训练为可计算密度估计器的概率电路,用于将幻觉检测为几何异常。同时,本文还引入了 PC-LDCD,一种仅在生成幻觉 token 时才进行干预的动态修正方法,实现了近乎完美的检测率并降低了错误修正率。