Mixture-of-Experts模块包含强烈的幻觉检测信号
摘要
本文介绍了InnerExpert,这是一种利用Mixture-of-Experts信号在LLMs中进行逐词元幻觉检测的方法,性能优于现有技术。
arXiv:2608.17687v1 公告类型:新
摘要:尽管大型语言模型(LLMs)被广泛使用,但它们仍然受限于一个根本问题:生成看似合理却虚假的内容,即幻觉。大多数现有检测方法在答案或句子级别操作,然而逐词元检测对于定位幻觉片段和实现细粒度干预至关重要。本文探讨了使用Mixture-of-Experts(MoE)范式来解决这一差距。在MoE架构中,单次前向传播通过路由机制激活稀疏的专家子集(即每层不同的前馈网络),产生内部信号(如路由器熵、专家分歧和专家使用模式),这些信号在密集架构中不可用,且此前未被用于幻觉检测。为此,我们引入了InnerExpert,这是首个利用这些MoE特定信号进行逐词元幻觉检测的方法。InnerExpert将路由级和标准Transformer信号组合成紧凑的逐词元特征向量,由轻量级检测器分类,该检测器使用LLM-as-a-judge管道生成的标签进行训练,从而实现无需手动注释的持续模型更新。我们的结果表明,InnerExpert在五个数据集和两个MoE架构上优于现有方法,最高达到0.91的答案级和0.76的词元级AUROC,同时只需一次前向传播。
查看缓存全文
缓存时间: 2026/08/19 10:12
# 混合专家模型模块包含强幻觉检测信号 来源:https://arxiv.org/abs/2608.17687 查看PDF (https://arxiv.org/pdf/2608.17687) > 摘要:尽管被广泛使用,大型语言模型(LLMs)仍受限于一个根本问题:生成看似合理但虚假的内容,即幻觉。现有检测方法大多作用于答案或句子层面,而逐词检测对于定位幻觉片段和实现细粒度干预至关重要。本文探索利用混合专家(MoE)范式来解决这一缺口。在MoE架构中,单次前向传播通过路由机制激活专家(即各层独立的前馈网络)的稀疏子集,产生在密集架构中不可用且尚未被用于幻觉检测的内部信号(如路由器熵、专家分歧度和专家使用模式)。为此,我们提出了InnerExpert——首个利用这些MoE特有信号进行逐词幻觉检测的方法。InnerExpert将路由级与标准Transformer信号融合为紧凑的逐词特征向量,由轻量检测器分类,检测器则通过LLM-as-a-judge流程产生的标签进行训练,从而实现无需人工标注的模型持续更新。结果表明,InnerExpert在五个数据集和两种MoE架构上超越现有方法,最高可达0.91的答案级与0.76的词级AUROC值,且仅需单次前向传播。 ## 提交历史 来自:Joao Fonseca \[查看邮件 (https://arxiv.org/show-email/ba1e6d05/2608.17687)\] **\[v1\]**2026年8月18日 星期二 12:00:20 UTC \(503 KB\)
相似文章
MoE中是否存在知识注入?探索MoE中专家感知的对比解码以缓解LLMs的幻觉
本文研究了混合专家(MoE)模型中是否存在层间差异,并提出了EAACD,一种专家感知的自适应对比解码方法,利用高层中的专家激活模式来减少LLMs在问答任务中的幻觉。
幻觉检测中的自动层选择
本文提出了用于大语言模型幻觉检测的自动层选择方法,并引入了固有维度首个有效峰值(FEPoID),这是一种无需训练的标准,能够一致地识别出最优中间层,优于现有启发式方法。
PARALLAX: 区分真实幻觉检测与基准构建伪影
本文揭示了LLM幻觉检测领域报道的许多进展实际上源于基准构建伪影,其中真实答案被嵌入到提示中,使得简单的文本相似度基线方法能够获得近乎完美的分数。通过大规模受控评估,作者证明,在适当控制下,大多数方法的表现接近随机水平,除了对上层隐藏状态的监督探针(如SAPLMA)以及他们提出的DRIFT。
关注未见质量:通过软混合字母估计揭示 LLM 幻觉
研究者提出 SHADE,一种混合估计器,在仅能获取少量黑盒样本时,融合 Good-Turing 覆盖率与图谱线索,量化语义不确定性并检测大模型幻觉。
重访最大池化网络:分析语义概率在幻觉检测多重实例学习中的作用
本文分析了大语言模型中的幻觉检测问题,提出了一种最大池化方法,该方法通过消除昂贵的语义一致性计算来提高效率,同时保持具有竞争力的性能。