面向多样性的微调方法用于基于不确定性的幻觉检测

arXiv cs.AI 论文

摘要

本文提出了面向多样性的微调策略,通过鼓励多样化的生成来改进大型语言模型中基于不确定性的幻觉检测,从而通过语义熵使幻觉更易检测。

arXiv:2607.16643v1 公告类型: new 摘要:现有的幻觉检测方法通常在推理阶段进行,而不对模型本身进行任何修改。本文旨在探索能够增强模型幻觉可检测性的微调策略。我们聚焦于基于语义熵的检测方法,并观察到许多错误输出未被检测到,因为模型在多次运行中产生了几乎相同的错误答案。为了解决这一问题,我们提出面向多样性的微调,以鼓励更多样化的生成。我们引入了两种具体策略:一种基于监督微调(SFT),另一种基于直接偏好优化(DPO)。我们进行了大量实验来评估我们的方法,并分析了微调前后模型的行为。我们发现,采用我们的微调方法后,模型对于幻觉答案产生低语义熵响应的可能性降低,从而提高了幻觉检测的有效性,最终结果优于或与最先进方法相当。代码将公开发布。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:39

# 面向多样性的微调:基于不确定性的幻觉检测
来源: https://arxiv.org/html/2607.16643
Qiuyuan Li1,2, Hongliang Dai1,2, Piji Li1,2  
1 南京航空航天大学人工智能学院, 南京, 中国  
2 脑机智能技术教育部重点实验室, 南京, 中国  
\{qiuyli, hongldai, pjli\}@nuaa\.edu\.cn

###### 摘要

现有的幻觉检测方法通常在推理阶段进行,而不对模型本身做任何修改。本文旨在探索能够提升模型幻觉可检测性的微调策略。我们聚焦于基于语义熵的检测方法,并观察到许多错误输出之所以未被检测到,是因为模型在多次运行中产生了几乎相同的错误答案。为解决此问题,我们提出了面向多样性的微调方法,以鼓励生成更多样化的输出。我们引入了两种具体策略:一种基于监督微调(SFT),另一种基于直接偏好优化(DPO)。我们进行了大量实验来评估所提出的方法,并分析模型在微调前后的行为。我们发现,采用我们的微调方法后,模型对于产生幻觉的答案,不再倾向于输出低语义熵的响应,从而提升了幻觉检测的有效性,最终取得了优于或可媲美当前最优方法的结果。相关代码将公开发布。

面向多样性的微调:基于不确定性的幻觉检测

Qiuyuan Li1,2, Hongliang Dai1,2††thanks:通讯作者。, Piji Li1,2  
1 南京航空航天大学人工智能学院, 南京, 中国  
2 脑机智能技术教育部重点实验室, 南京, 中国  
\{qiuyli, hongldai, pjli\}@nuaa\.edu\.cn

参见图注
图 1: 面向多样性微调的动机。一个基础大语言模型可能会重复生成同一个错误答案,导致低语义熵,使得幻觉检测被遗漏。面向多样性的微调能诱发错误样本之间的语义变化,增加熵值,从而使这类幻觉更容易被检测到。

## 1 引言

尽管取得了显著进展,大语言模型(LLMs)仍然存在幻觉问题:生成语言上看似合理但事实上错误或无依据的输出 (Ji et al., 2023 (https://arxiv.org/html/2607.16643#bib.bib45))。这一持续存在的挑战削弱了其可靠性,并限制了其在现实世界应用中的实用性 (Weidinger et al., 2021 (https://arxiv.org/html/2607.16643#bib.bib49))。鉴于完全消除幻觉存在巨大的理论和实践挑战 (Xu et al., 2024 (https://arxiv.org/html/2607.16643#bib.bib50)),可靠地检测 LLMs 的幻觉输出已成为一项重要的研究优先事项 (Manakul et al., 2023 (https://arxiv.org/html/2607.16643#bib.bib15); Kuhn et al., 2023 (https://arxiv.org/html/2607.16643#bib.bib26); Azaria and Mitchell, 2023 (https://arxiv.org/html/2607.16643#bib.bib17))。

虽然已有许多幻觉检测方法被提出 (Ji et al., 2023 (https://arxiv.org/html/2607.16643#bib.bib45); Manakul et al., 2023 (https://arxiv.org/html/2607.16643#bib.bib15)),但它们通常在模型训练完成后,于推理阶段应用。尽管这些事后处理方法易于部署,但其有效性会受到限制,因为它们操作的是静态模型,而这些模型在开发时并未考虑未来的幻觉检测需求。因此,本文探索能提升 LLMs 中幻觉可检测性的微调策略。具体来说,我们专注于提升基于语义熵的方法的检测性能 (Farquhar et al., 2024 (https://arxiv.org/html/2607.16643#bib.bib27)),因为该方法广受认可。该方法通过识别多次采样响应中的语义不一致性来检测幻觉。我们的初步实验揭示,在使用语义熵时,大量幻觉无法被检测到,因为模型表现出高的词元级别置信度,并在独立运行中生成几乎相同的响应。这一观察表明,鼓励模型生成更多样化响应的面向多样性的微调,有可能在这些情况下诱发语义不一致性,从而使幻觉能被正确识别。

我们引入了两种用于幻觉检测的面向多样性的微调策略。第一种方法采用监督微调(SFT)(Ouyang et al., 2022 (https://arxiv.org/html/2607.16643#bib.bib24)),利用一种“一对多”的映射,其中每个输入提示与一组语义等价的目标输出配对。第二种方法利用直接偏好优化(DPO)(Rafailov et al., 2023 (https://arxiv.org/html/2607.16643#bib.bib47))。对于给定的输入,它激励模型同时生成多个响应,这些响应具有高词汇多样性但共享相同的语义含义。之后,我们采用 Farquhar 等人 (2024 (https://arxiv.org/html/2607.16643#bib.bib27)) 提出的框架,通过测量模型多个响应之间的语义熵来在推理阶段识别幻觉。

我们进行了大量实验来分析我们的方法并评估其有效性。结果表明,我们的两种微调策略都能使模型为给定输入生成更多样化的输出,并增强幻觉检测效果。我们的分析显示,虽然所有实例的多样性都增加了,但输出之间的语义一致性 (Kuhn et al., 2023 (https://arxiv.org/html/2607.16643#bib.bib26)) 在产生幻觉和未产生幻觉的案例中表现出显著差异。具体来说,微调主要在模型产生幻觉时会放大输出中的语义不一致性,这有效地增强了通过语义熵对先前假阴性案例的检测。因此,我们的方法取得了优于或可媲美当前最先进方法的性能。

我们的主要贡献总结如下:

- •据我们所知,我们是首个通过在微调阶段进行干预来改进幻觉检测的工作。
- •我们提出了两种面向多样性的微调策略,旨在通过解决因模型在多次运行中生成相同响应而导致幻觉未被检测到的问题,来改进基于语义熵的幻觉检测。
- •我们进行了大量实验来分析我们方法的行为,并证明它能在不同数据集上持续提升幻觉检测性能。

## 2 相关工作

### 2.1 大语言模型中的幻觉检测

幻觉仍然是大语言模型一个持续存在的基本挑战,尤其是在开放域和知识密集型生成任务中。现有的检测方法大致可分为三类。外部验证方法通过将模型输出与检索到的证据或外部知识源进行核对来评估事实性 (Lewis et al., 2020 (https://arxiv.org/html/2607.16643#bib.bib8); Min et al., 2023 (https://arxiv.org/html/2607.16643#bib.bib9))。虽然在受限环境中有效,但其性能在很大程度上依赖于检索质量和外部监督。

基于不确定性和一致性的方法通过词元级别的似然度、对数概率、置信度估计或多次采样生成的答案一致性来评估响应的可靠性 (Kadavath et al., 2022 (https://arxiv.org/html/2607.16643#bib.bib12); Lin et al., 2022 (https://arxiv.org/html/2607.16643#bib.bib13); Wang et al., 2022 (https://arxiv.org/html/2607.16643#bib.bib14); Manakul et al., 2023 (https://arxiv.org/html/2607.16643#bib.bib15))。这些方法因其不需要显式外部证据而具有吸引力,但当模型一致重复同一个错误答案时,它们可能会失效。

基于表示的方法通过探测隐藏状态、注意力模式或激活统计信息来识别与幻觉相关的信号 (Azaria and Mitchell, 2023 (https://arxiv.org/html/2607.16643#bib.bib17); Burns et al., 2022 (https://arxiv.org/html/2607.16643#bib.bib18); Su et al., 2024 (https://arxiv.org/html/2607.16643#bib.bib19))。然而,这些方法通常需要辅助分类器或任务特定的监督,增加了系统复杂性。

### 2.2 大语言模型中的生成多样性

生成多样性在自然语言生成领域早有研究,包括对话、摘要和开放式文本生成。早期方法主要依赖推理阶段的策略,如温度缩放、top-k 采样和核采样 (Fan et al., 2018 (https://arxiv.org/html/2607.16643#bib.bib22); Holtzman et al., 2019 (https://arxiv.org/html/2607.16643#bib.bib21)),这些方法增加了表层变化,但在遵循指令的 LLMs 中可能不会产生有意义的语义多样性。

近期方法通过对比解码进一步提升多样性,该方法倾向于专家模型偏好的词元,同时惩罚干扰模型偏好的词元 (Li et al., 2023 (https://arxiv.org/html/2607.16643#bib.bib29); Su et al., 2022 (https://arxiv.org/html/2607.16643#bib.bib30))。训练阶段的目标函数,如 SimCTG (Su et al., 2022 (https://arxiv.org/html/2607.16643#bib.bib30))、不可能性训练 (Welleck et al., 2019 (https://arxiv.org/html/2607.16643#bib.bib31)) 和基于 MMI 的重加权 (Li et al., 2016 (https://arxiv.org/html/2607.16643#bib.bib32)),也鼓励多样化输出,但通常会引入额外的训练或推理复杂性。

以数据为中心的方法,如 Mix-Review (He et al., 2021 (https://arxiv.org/html/2607.16643#bib.bib33)),主要通过数据增强或正则化来提升多样性。然而,这些方法并非专门设计用于改进基于不确定性的幻觉检测,而这正是我们工作的焦点。

### 2.3 语义不确定性和基于熵的度量

语义不确定性通过将生成的响应聚类成语义等价类,并计算所得分布上的熵,来衡量语义层面而非表层形式的变化 (Kuhn et al., 2023 (https://arxiv.org/html/2607.16643#bib.bib26))。它对释义具有鲁棒性,适用于具有多个有效答案的任务 (Farquhar et al., 2024 (https://arxiv.org/html/2607.16643#bib.bib27))。然而,其有效性依赖于足够多样化的样本:经过指令微调的 LLM 即使在不确定时也可能产生有限的语义变化,导致低熵或退化熵 (Sharma et al., 2023 (https://arxiv.org/html/2607.16643#bib.bib34))。重复采样或激进的解码策略可以增加多样性,但会引入额外的成本和稳定性问题 (Kossen et al., 2024 (https://arxiv.org/html/2607.16643#bib.bib28))。

## 3 预备知识与初步研究

### 3.1 预备知识

遵循现有研究 (Tong et al., 2025a (https://arxiv.org/html/2607.16643#bib.bib51), b (https://arxiv.org/html/2607.16643#bib.bib52); Wang et al., 2025 (https://arxiv.org/html/2607.16643#bib.bib35); Hu et al., 2025 (https://arxiv.org/html/2607.16643#bib.bib53)),我们专注于问答任务中的幻觉检测。

语义熵通过衡量多次独立模型生成之间的语义一致性来识别幻觉。例如,当被问及“加拿大的首都是什么?”时,如果模型产生语义不同的输出,如“多伦多”、“蒙特利尔”、“是温哥华”和“答案是多伦多”,由此产生的高语义熵通常表明可能存在幻觉。相反,如果模型一致地生成语义等价的响应,如“渥太华”、“渥太华是首都”和“是渥太华”,那么答案更可能是正确的。

基于此观察,该方法将语义等价的答案聚类到一起,并衡量语义层面的不确定性,而非词元序列层面。具体来说,采用了一种基于自然语言推理(NLI)的增量聚类方法。给定一个问题 q 和一个采样的候选答案集合 A={a_1, a_2, ..., a_N},它遍历每个候选答案 a_i,将其分配到一个语义簇。对于每个由 r_j 表示的现有簇 C_j,它通过 NLI 模型进行双向蕴含检查来评估语义等价性。当且仅当一个候选答案 a_i 与代表 r_j 相互蕴含时,它才被整合到簇 C_j 中。如果一个候选答案与所有现有簇都不满足此双向条件,则创建一个新簇来容纳它。遵循先前关于语义不确定性和语义熵的工作 (Kuhn et al., 2023 (https://arxiv.org/html/2607.16643#bib.bib26); Farquhar et al., 2024 (https://arxiv.org/html/2607.16643#bib.bib27)),我们使用基于双向蕴含的增量语义聚类;为完整起见,完整过程总结在算法 1 (https://arxiv.org/html/2607.16643#algorithm1) 中 (Farquhar et al., 2024 (https://arxiv.org/html/2607.16643#bib.bib27))。

最后,计算这些语义簇分布上的熵。令 p(C_j) 表示分配给簇 C_j 的生成序列的经验比例。语义熵定义为:

SE(q) = -∑_C_j p(C_j) log_2 p(C_j)。

低的 SE 分数反映了生成输出之间的强共识,表明尽管表层措辞不同,但大多数答案传达了相同的含义。相反,高的 SE 分数反映了显著的语义分歧,模型在事实上不相容的答案之间摇摆不定,因此作为幻觉检测的不确定性信号。

参见图注
图 2: 面向多样性的微调数据构建。SFT 流程为每个问题生成多个语义等价的答案,为每个多样化答案创建一个训练实例。DPO 流程构建偏好对,其中高多样性的答案集优于重复性、低多样性的输出,从而鼓励生成多样化但语义忠实的输出。

### 3.2 初步研究

通过分析基于语义熵的幻觉检测,我们发现许多幻觉未被检测到(假阴性),因为模型在多次独立运行中产生了几乎相同的响应。具体来说,在使用 LLaMA3-8B-Instruct 对 SQuAD 数据集生成 10 个独立响应时,模型在大约 12% 的幻觉案例中,在整个迭代过程中生成了相同的输出。表 9 (https://arxiv.org/html/2607.16643#A3.T9)(附录 C.2 (https://arxiv.org/html/2607.16643#A3.SS2))展示了这一现象。图 1 (https://arxiv.org/html/2607.16643#S0.F1) 说明了这种失败模式。当基础 LLM 在多次采样运行中反复生成同一个错误答案时,采样得到的响应表现出高度自一致性和低语义熵。结果,这个产生幻觉的答案被赋予低不确定性分数,可能会被基于一致性的幻觉检测方法遗漏。这一观察启发了面向多样性的微调:通过鼓励模型在不确定时产生更多样化的响应,产生幻觉的情况更有可能暴露出语义不一致性。

相似文章

为什么微调会导致幻觉及其解决方案

arXiv cs.CL

本论文研究了监督微调(SFT)如何通过导致知识退化而增加大语言模型的幻觉问题,并提出了一种基于自蒸馏的方法来缓解这一问题,同时保留预训练阶段获得的既有事实知识。作者将语义干涉识别为SFT引起幻觉的主要机制,并演示了包括参数冻结和自蒸馏在内的解决方案。

RAGognizer:通过检测头集成实现幻觉感知微调

arXiv cs.CL

RAGognizer 提出了一种幻觉感知微调方法,该方法将轻量级检测头集成到大语言模型(LLMs)中,以实现语言建模与幻觉检测的联合优化,适用于 RAG 系统。论文介绍了 RAGognize,一个包含自然发生的闭域幻觉及其词元级标注的数据集,并展示了在降低幻觉率的同时,实现了最先进的幻觉检测性能,且不损害语言质量。

多模态大语言模型的统一幻觉模糊测试

arXiv cs.CL

本文介绍了UniHall,一个基于统一分类法的细粒度幻觉基准,以及自适多模态模糊测试(SAMF),一个用于多模态LLM的自进化压力测试框架。实验表明,最先进的模型在模糊测试下性能显著下降,并揭示了有用性与幻觉之间的权衡。