MoE中是否存在知识注入?探索MoE中专家感知的对比解码以缓解LLMs的幻觉

arXiv cs.CL 论文

摘要

本文研究了混合专家(MoE)模型中是否存在层间差异,并提出了EAACD,一种专家感知的自适应对比解码方法,利用高层中的专家激活模式来减少LLMs在问答任务中的幻觉。

arXiv:2607.20426v1 公告类型:新 摘要:现有的LLM幻觉缓解方法,包括提示工程和模型优化,要么难以改变模型的内部知识,要么跨领域泛化能力差。对比解码通过利用LLM中的层间差异来缓解幻觉。然而,先前的研究仅探索了基于Transformer的模型(如GPT),忽略了其他有效的框架,例如混合专家(MoE)模型。由于MoE改变了传统Transformer架构,我们进行了实证研究以探究MoE中是否存在类似的层间差异。我们的结果表明,在具有共享专家的MoE中并不存在这种差异;然而,在不同的MoE中,较高层在事实性输出和非事实性输出之间表现出不同的专家激活模式。基于此,我们提出了EAACD,一种专家感知的自适应对比解码方法,利用MoE高层中的专家差异来缓解QA任务中的幻觉。EAACD根据高层专家的置信度和一致性,将其分为一个高可靠性组和几个低可靠性组。它将高可靠性组的预测与每个低可靠性组的预测进行对比,以校准模型的原始预测。为了增强这种对比,EAACD通过注意力和掩码放大低可靠性专家的幻觉,以提供更强的负面参考。EAACD在四个数据集上优于所有基线。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:15

# MoE中存在知识注入吗?探索MoE中专家感知的对比解码以缓解LLM的幻觉

来源: https://arxiv.org/html/2607.20426
Xinyue Fang¹, Zhiliang Tian¹, Zhen Huang¹¹¹¹footnotemark:¹, Ziyi Pan¹, Zhihua Wen¹, Xi Wang¹, Quntian Fang¹, Dongsheng Li¹ ¹国防科技大学计算机科学与技术学院 \{fangxinyue (https://arxiv.org/html/2607.20426v1/mailto:[email protected]), tianzhiliang (https://arxiv.org/html/2607.20426v1/mailto:[email protected]), huangzhen (https://arxiv.org/html/2607.20426v1/mailto:[email protected]), panziyi (https://arxiv.org/html/2607.20426v1/mailto:[email protected]), zhwen (https://arxiv.org/html/2607.20426v1/mailto:[email protected]), wangxi25 (https://arxiv.org/html/2607.20426v1/mailto:[email protected]), fangquntian (https://arxiv.org/html/2607.20426v1/mailto:[email protected]), dsli (https://arxiv.org/html/2607.20426v1/mailto:[email protected])\}@nudt\.edu\.cn

###### 摘要

现有的LLM幻觉缓解方法,包括提示工程和模型优化,要么难以改变模型的内部知识,要么跨域泛化能力差。对比解码通过利用LLM的逐层差异来缓解幻觉。然而,先前的研究只探索了基于Transformer的模型(例如GPT),忽略了其他有效的框架,如混合专家(MoE)模型。由于MoE改变了传统的Transformer架构,我们进行实证研究来调查MoE中是否存在类似的逐层差异。我们的结果表明,在具有共享专家的MoE中不存在这种差异;尽管如此,在不同的MoE中,较高层在事实输出和非事实输出之间表现出不同的专家激活模式。基于此,我们提出了**EAACD**,一种专家感知的自适应对比解码方法,它利用MoE高层中的专家差异来缓解QA任务上的幻觉。EAACD根据高层专家的置信度和一致性,将其分为一个高可靠性组和几个低可靠性组。它将高可靠性组的预测与每个低可靠性组的预测进行对比,以校准模型的原始预测。为了加强这种对比,EAACD通过注意力机制和掩码机制放大低可靠性专家产生的幻觉,从而提供更强的负面参考。EAACD在四个数据集上优于所有基线¹¹¹代码:anonymous.4open.science/r/EAACD-D388/ (https://arxiv.org/html/2607.20426v1/anonymous.4open.science/r/EAACD-D388/)。

MoE中存在知识注入吗?探索MoE中专家感知的对比解码以缓解LLM的幻觉

Xinyue Fang¹, Zhiliang Tian¹††thanks:通讯作者, Zhen Huang¹¹¹footnotemark:¹, Ziyi Pan¹, Zhihua Wen¹,Xi Wang¹,Quntian Fang¹,Dongsheng Li¹¹国防科技大学计算机科学与技术学院\{fangxinyue (https://arxiv.org/html/2607.20426v1/mailto:[email protected]), tianzhiliang (https://arxiv.org/html/2607.20426v1/mailto:[email protected]), huangzhen (https://arxiv.org/html/2607.20426v1/mailto:[email protected]), panziyi (https://arxiv.org/html/2607.20426v1/mailto:[email protected]), zhwen (https://arxiv.org/html/2607.20426v1/mailto:[email protected]), wangxi25 (https://arxiv.org/html/2607.20426v1/mailto:[email protected]), fangquntian (https://arxiv.org/html/2607.20426v1/mailto:[email protected]), dsli (https://arxiv.org/html/2607.20426v1/mailto:[email protected])\}@nudt\.edu\.cn

## 1 引言

大型语言模型(LLM)表现出强大的性能,但存在幻觉问题,限制了其应用(Fang等,2025c (https://arxiv.org/html/2607.20426#bib.bib79);Liu等,2025a (https://arxiv.org/html/2607.20426#bib.bib80))。现有的缓解方法主要包括:(1) **提示工程**使用任务指令来引导模型生成事实性输出(Mondal等,2024 (https://arxiv.org/html/2607.20426#bib.bib52))。这易于应用,但无法从根本上改变模型的内部知识(Cheng等,2025 (https://arxiv.org/html/2607.20426#bib.bib53))。(2) **模型参数优化**通过补充知识对LLM进行微调(Wang等,2022 (https://arxiv.org/html/2607.20426#bib.bib7))。这些方法通过校准模型的内部知识来缓解幻觉。但它们缺乏领域泛化能力,并且微调数据中的潜在错误可能加剧幻觉(Iyer等,2022 (https://arxiv.org/html/2607.20426#bib.bib9))。

参照图注图1:先前模型内对比解码与EAACD(我们的方法)的概述。先前的模型内对比解码依赖于基于Transformer的模型中的“知识注入”,限制了其在MoE中的适用性。我们的EAACD利用MoE层内的专家多样性来有效缓解幻觉。为了提高领域泛化能力并减少对微调数据的依赖,研究人员提出了对比解码,它通过使用可靠性较低的输出作为负面参考来提高输出的准确性(Li等,2023 (https://arxiv.org/html/2607.20426#bib.bib18))。这种方法包括:(1) **模型间对比解码**将原始模型的输出与不可靠模型的输出进行比较(Yang等,2024a (https://arxiv.org/html/2607.20426#bib.bib21))。这些方法使用不可靠模型的输出作为负面参考,从原始模型的输出中去除此类负面信息。然而,如果不可靠模型产生事实性输出,这可能会对原始模型的预测产生不利影响(Yin等,2025 (https://arxiv.org/html/2607.20426#bib.bib69))。(2) **模型内对比解码**利用单个模型内部的差异,对比较低层和较高层之间的logits以获得下一个token的概率(Yang等,2025 (https://arxiv.org/html/2607.20426#bib.bib20))。研究人员(Chuang等,2023 (https://arxiv.org/html/2607.20426#bib.bib23))发现,基于Transformer的模型(例如GPT)存在一种“知识注入”现象,即较高层在生成过程中融入了更多的事实知识,而较低层则存储较少的事实知识。基于此,研究人员开发了几种变体(Gera等,2023 (https://arxiv.org/html/2607.20426#bib.bib25);Das等,2025 (https://arxiv.org/html/2607.20426#bib.bib26)),它们利用层间差异来缓解幻觉,无需外部资源。

最近,混合专家(MoE)架构因其出色的性能已成为构建大型LLM(例如DeepSeek-R1(Guo等,2025 (https://arxiv.org/html/2607.20426#bib.bib70)),GPT-4(Achiam等,2023 (https://arxiv.org/html/2607.20426#bib.bib71)))的流行方法。然而,即使是最先进的MoE模型仍然存在幻觉问题(Su等,2025 (https://arxiv.org/html/2607.20426#bib.bib31))。MoE将模型拆分为多个专家,并动态地将每个token路由到其中一小部分专家(Zhao等,2024 (https://arxiv.org/html/2607.20426#bib.bib32))。这种设计改变了模型的结构,使得经典Transformer模型现有的模型内对比解码在缓解MoE模型中的幻觉时面临挑战。因为MoE模型可能不会表现出与经典Transformer模型相同的层间差异。

为了解决这些问题,我们探讨MoE模型是否表现出经典Transformer模型中的“知识注入”现象。我们发现这种现象取决于MoE架构:(1) **“知识注入”仅出现在没有共享专家的MoE中,而不会出现在具有共享专家的MoE中**。这表明模型内对比解码可能仅在没有共享专家的MoE模型中有效。考虑到这一局限性,我们探索是否可以利用专家之间的差异来进行对比解码。通过检查事实输出与非事实输出期间的专家激活模式,我们发现:(2) **在所有MoE架构中,较高层在事实输出和非事实输出之间始终表现出不同的专家激活模式**。这一见解使我们能够利用高层专家差异进行模型内对比解码,以缓解所有MoE中的幻觉。

在本文中,我们提出了一种专家感知的自适应对比解码策略(EAACD),它将高可靠性专家与低可靠性专家分开;高可靠性专家将低可靠性专家中放大的幻觉视为负面参考,通过对比解码来增强事实性(图1 (https://arxiv.org/html/2607.20426#S1.F1))。我们的实证结果表明,在不同MoE架构中,较高层在生成事实性输出与非事实性输出时会表现出不同的专家激活。由于路由器的目的是为特定场景选择最合适的专家,其在事实和非事实情况下的不同偏好表明专家在事实性输出生成方面的能力不同。为了利用专家之间的固有差异进行对比解码,我们基于置信度和一致性将专家分为一个高可靠性组和多个低可靠性组。为了确保低可靠性专家在对比期间提供有效的负面参考,我们通过注意力机制和掩码机制放大低可靠性专家中的幻觉。最后,我们的对比解码模块根据低可靠性预测与高可靠性预测之间的差异,自适应地惩罚低可靠性预测,并使用对比结果校准原始预测,以缓解QA任务上的幻觉。

我们的主要贡献是:(1) 据我们所知,我们是第一个探索MoE模型中“知识注入”现象以及事实与非事实输出之间专家激活差异的。(2) 我们揭示了“知识注入”以及事实与非事实输出期间专家激活差异如何与MoE架构相关。(3) 我们提出了一种专家感知的自适应对比解码方法,无需外部资源即可缓解MoE模型的幻觉。(4) 我们的方法在四个数据集上达到了最先进的水平。

## 2 相关工作

**LLM中的幻觉缓解**旨在减少LLM输出中的事实不一致性(Si等,2022 (https://arxiv.org/html/2607.20426#bib.bib2))。现有的缓解方法:(1) **提示工程**通过在提示中包含少量示例来提高模型的事实性(Brown等,2020 (https://arxiv.org/html/2607.20426#bib.bib1))。思维链(Chain-of-Thought)(Mondal等,2024 (https://arxiv.org/html/2607.20426#bib.bib52))提示通过中间步骤引导模型以提高事实性。Ji等(2023 (https://arxiv.org/html/2607.20426#bib.bib6))提出了一种迭代式自我反思方法,结合先前的输出进行纠正。(2) **优化模型参数**使模型的内部知识与事实保持一致(Wang等,2022 (https://arxiv.org/html/2607.20426#bib.bib7))。监督微调(SFT)帮助LLM从标记数据中学习任务特定特征并提高准确性(Iyer等,2022 (https://arxiv.org/html/2607.20426#bib.bib9);Shi等,2023 (https://arxiv.org/html/2607.20426#bib.bib10))。模型编辑通过定位和干预来消除幻觉(Zheng等,2023 (https://arxiv.org/html/2607.20426#bib.bib12);Zhang等,2024 (https://arxiv.org/html/2607.20426#bib.bib13))。

**对比解码缓解幻觉**通过比较模型之间或同一模型不同部分的输出来实现(Li等,2023 (https://arxiv.org/html/2607.20426#bib.bib18);Chuang等,2023 (https://arxiv.org/html/2607.20426#bib.bib23)),主要分为两种类型:(1) **模型间对比解码**比较大模型与较不准确模型的输出(Chen等,2024 (https://arxiv.org/html/2607.20426#bib.bib22))。Li等(2023 (https://arxiv.org/html/2607.20426#bib.bib18))使用较小的模型来校准较大模型的输出。Zhang等(2025 (https://arxiv.org/html/2607.20426#bib.bib19))在幻觉数据上微调原始模型,构建一个事实性较差的模型作为原始模型的负面比较器。(2) **模型内对比解码**通过利用模型内部的差异来缓解幻觉(Wu等,2025 (https://arxiv.org/html/2607.20426#bib.bib72);Shi等,2024a (https://arxiv.org/html/2607.20426#bib.bib24))。DoLa(Chuang等,2023 (https://arxiv.org/html/2607.20426#bib.bib23))将模型的最终层预测与较早层的预测进行对比,以突出可靠输出。Das等(2025 (https://arxiv.org/html/2607.20426#bib.bib26))基于逐层熵选择较低层,提高了DoLa的性能。上下文感知解码(Context-Aware Decoding)(Shi等,2024b (https://arxiv.org/html/2607.20426#bib.bib40))比较上下文感知与上下文不可知的输出,以缓解幻觉。

**混合专家(MoE)**(Li等,2025 (https://arxiv.org/html/2607.20426#bib.bib51))使LLM能够在保持效率的同时扩展模型容量。MoE架构可分为:(1) **无共享专家的MoE**完全解耦专家(Jiang等,2024 (https://arxiv.org/html/2607.20426#bib.bib33))。Mixtral 8x7B(Jiang等,2024 (https://arxiv.org/html/2607.20426#bib.bib33))使用大小相等、独立的专家,并在推理时激活top-2。LLaMA-MoE(Zhu等,2024 (https://arxiv.org/html/2607.20426#bib.bib37))采用非重叠划分以获得更好的泛化能力。(2) **具有共享专家的MoE**具有始终激活的共享专家,而其他专家则被路由(Zhao等,2024 (https://arxiv.org/html/2607.20426#bib.bib32))。DeepSeekMoE(Dai等,2024 (https://arxiv.org/html/2607.20426#bib.bib28))和XMoE(Yang等,2024b (https://arxiv.org/html/2607.20426#bib.bib30))将专家拆分为子专家,并在推理时激活top-K。Cartesian-MoE(Su等,2025 (https://arxiv.org/html/2607.20426#bib.bib31))合并共享和路由专家以扩大组合能力。

## 3 实证研究

我们进行了一项实证研究,以探索MoE模型中能够实现模型内对比解码以缓解幻觉的一般性差异。它包含两个关键实验。首先,我们检查具有不同架构的MoE模型是否表现出经典Transformer模型中观察到的“知识注入”现象。结果表明,“知识注入”仅发生在没有共享专家的MoE中,而在具有共享专家的MoE中不会发生。因此,我们转而探索所有MoE模型中事实输出与非事实输出之间更普遍的差异。

参照图注图2:不同模型中最终层与每个较低层之间的JSD(按10^5缩放)。列标签指示每一步的token。行标签指示层索引。输入样本来自TruthfulQA数据集;其他数据集的结果见附录A (https://arxiv.org/html/2607.20426#A1)。参照图注图3:不同MoE架构在TruthfulQA上生成事实性和非事实性输出时,各层的专家激活模式。列标签指示专家索引。我们展示了LLaMA MoE(无共享专家)和Qwen MoE(有共享专家;每四个专家显示一个)的结果;完整结果见附录C (https://arxiv.org/html/2607.20426#A3)。参照图注图4:各种MoE架构和数据集中事实输出与非事实输出之间专家激活模式的差异(x轴为层索引)。

### 3.1 实验设置

我们研究了两种主流的MoE架构:LLaMA-MoE(Zhu等,2024 (https://arxiv.org/html/2607.20426#bib.bib37))和Mixtral(Jiang等,2024 (https://arxiv.org/html/2607.20426#bib.bib33)),作为无共享专家的MoE。

相似文章

更少专家,更快解码:面向混合专家模型的成本感知推测解码

arXiv cs.CL

本文提出EcoSpec,一种针对混合专家模型的成本感知推测解码框架,在草稿选择阶段考虑了专家激活成本。通过在无需修改目标模型验证规则的情况下减少专家足迹,该方法在DeepSeek-V3.1、Qwen3-235B-A22B和GPT-OSS-120B等大规模MoE模型上实现了高达1.62倍的加速。

解耦的Mixture-of-Experts用于参数化知识注入

arXiv cs.CL

Decoupled Mixture-of-Experts (DMoE) 提出了一种用于参数化知识注入的模块化架构,将专家和路由器从基础模型中解耦,以实现高效的自回归推理并缓解灾难性遗忘。

Transformer 中的专家混合模型 (MoEs)

Hugging Face Blog

Hugging Face 的博客文章,介绍 Transformer 中的专家混合模型 (MoEs) 架构,涵盖从密集模型到稀疏模型的转变、权重加载优化、专家并行计算以及基于 MoE 的语言模型训练技术。