标签
本文评估了大语言模型内部表示中的幻觉信号是否能够跨语言和领域泛化,重点关注阿拉伯语↔英语,使用TruthfulQA和HalluScore进行评估。结果表明,大多数模型具有可迁移性,跨语言性能取决于类别可分性和语言对齐程度。
介绍了Magnet——一个基于角色的多智能体目标驱动叙事引擎,用于长篇故事生成,以及Atlas——一个基于图的流水线,用于检测生成叙事中的幻觉。该框架相比单模型基线和IBSEN提高了连贯性并减少了幻觉。
本文介绍了一个统一的基准,用于RAG系统中的跨度级幻觉检测,该基准超越了自然语言,扩展到代码、工具输出和结构化文档,并展示了一个微调的Qwen3.5-2B检测器,该检测器在这些新领域上优于现有方法,同时在标准NLP基准上保持竞争力。
提出了CORTEX,一种针对RAG的令牌级幻觉检测方法,通过比较有无检索文档时LLM的内部表示来识别无根据的文本片段。它改进了长文本RAG输出中幻觉的细粒度定位。
本文对大语言模型中基于探针的不确定性估计进行了分解研究,表明原始隐藏状态和注意力特征在域内表现良好,但结构化特征在分布偏移下更为鲁棒,并提供了预训练探针作为现成基线。
GAVEL 提出了一个新任务,用于验证、解释和定位图像-文本对中的错误,并附带一个数据集和基准。一个监督基线显示出相对于强闭源模型的改进。
MedBench v5 是一个面向临床多模态模型的动态、过程导向的基准测试,集成了幻觉检测和压力测试,超越静态问答,评估在信息流压力下的推理和稳定性。
提出HCPD,一种零源幻觉检测方法,采用类人标准探询机制将判断分解为可解释的标准,优于当前最先进的基线方法。
本文将对基于最优传输的幻觉检测扩展到NMT和抽象式摘要中的所有解码器层,发现检测主要集中在早期层,并且由于忠实性失败无法通过注意力集中检测到,几何信号在摘要任务中迁移效果不佳。
将词元级幻觉检测重新表述为最快变化检测问题,建立了检测延迟的理论下界,并表明因果循环模型实现了接近最优的性能,优于线性基线。
一篇被ICML 2026接收的论文提出了通过信息预算弃权门实现可预测幻觉的方法,并发布了ntkMirror——一种免训练的开源权重实现,通过在信息不足时弃权来减少幻觉,在约24%弃权率下实现0.0–0.7%的幻觉率。
OpenHalDet 是一个用于大语言模型幻觉检测的统一基准,它标准化了跨不同生成场景的评估,并支持黑盒、灰盒和白盒检测方法。
提出证据图一致性(EGC)框架,利用基于图的结构一致性进行RAG中的幻觉检测,揭示了不同模型家族间有效性的差异。
本文展示了Whisper在面对静音、噪声或音乐时产生的幻觉故障,可以完全通过内部激活和稀疏自编码器来检测和缓解,无需微调即可大幅降低幻觉率。
本文介绍了CHARM框架,用于检测和缓解多步骤智能体RAG流水线中的级联幻觉问题——早期阶段产生的错误会在推理步骤中不断传播并放大。CHARM在多个基准测试中实现了89.4%的级联检测率和82.1%的错误传播降低率,且延迟开销较低。
KG-Guard是一个轻量级的基于图的框架,用于检测基于LLM的知识库问答中的幻觉。它将LLM视为黑盒,使用图编码器与MLP分类器来识别幻觉答案节点,在参数少得多的前提下优于基线方法。
FLaG 是一个轻量级的幻觉检测框架,适用于大语言模型,通过潜在证据组和基于能量的路由对正确性进行建模,在多个基准测试中实现了 SOTA 性能。
LLM-FACETS 是一个开源评估框架,旨在帮助从业者评估LLM的透明度与问责制,重点关注隐私和数据流透明度。它提供浏览器界面和插件架构,支持多种审计机制,包括令牌级对数概率可视化和 RAG Triad 指标。
介绍了HDSR和HDSR-PL方法,这些方法使用幻觉检测器来指导迭代自我改进和偏好学习,在MIMIC-IV-Note上使用Llama和Gemma模型进行临床摘要时,幻觉减少高达48%。
本文提出了一种针对高风险领域LLM输出的神经符号验证架构,结合形式化符号方法与神经语义分析。在一个医疗器械损伤评估系统上进行的评估显示,该架构对结构化实体的幻觉检测率超过83%,语义虚构的检测率达72%,报告创建时间缩短30%。