标签
作者在数据集上对Jev裁判器进行了基准测试,通过从人类标注示例中学习,将其校准误差降低了68.1%,提高了生产环境中置信度的对齐性,同时分类准确性没有显著变化。
本研究探究了基于单语数据训练的幻觉检测探针在Hinglish上的迁移效果,结果显示检测性能稳健,且Hindi和Hinglish中的幻觉率高于英语。
本文提出了一种通过分析注意力图中的拓扑特征来检测LLMs中幻觉的方法,在多个基准测试中显示出相对于现有基线的改进。
本文提出了一种基于注意力分散的无监督指标,用于检测大型语言模型中的幻觉,在使用Qwen2.5模型家族的数学推理基准测试中显示出显著的AUC提升。
QAgent 通过评分正确性、检测幻觉与真实依据的对比、验证策略遵守情况以及基准测试 RAG 来自动化 AI 代理的质量保证,从而防止不良响应传递给客户。
一篇关于VLMs幻觉检测的系统论文已被EMNLP 2026接受,参与SHROOM共享任务,该任务在UncertaiNLP研讨会上举办,专注于标记和标注VLM输出中的幻觉字符跨度。
本文引入LexAgentHallu,一个用于剖析法律AI智能体中幻觉的层次化基准测试,通过细粒度指标评估多步轨迹。
OmniHallu引入了一个统一的幻觉检测框架,适用于多模态大语言模型,涵盖图像、视频和音频模态的理解与生成任务,并包括一个基准测试和多智能体架构。
作者正在开发针对AI代理的付费调用工具,以提高研究准确性,例如公司研究和声明检查,并请求社区对定价和JSON响应格式提出意见。
本文介绍了HalluPeer,这是一个基于分类体系的基准测试,用于检测科学同行评审中的幻觉,并提供了标注数据以评估和改进检测方法。
本文提出通过结合语义熵和令牌级不确定性信号来检测黑盒LLMs中的幻觉的方法,评估了TopK、CoCoA、Gated和Stacked等技术在多个基准测试中的表现,发现没有单一方法普遍最强,但Stacked通常表现最佳。
本文介绍了InternReviewer和InternAdvocate,这是一个利用智能体强化学习与客观奖励,在学术同行评审与回应中开发AI智能体的框架,旨在提升推理深度、引用准确性并减少幻觉。
本文介绍了ClaimProbe,一个用于检测深度研究报告中幻觉和错误归因的声明级审计框架,以及ClaimWriter,一个分层写作者,可将幻觉减少高达4.5倍,同时提高事实召回率。
SpanCalib-VLM提出了一种混合系统,该系统结合了多模态序列标注器和生成式视觉语言模型,以增强幻觉跨度检测和校准,并在SHROOM-Visions任务中实现了性能提升。
本文提出了一种无标签方法,使大型语言模型在不确定时拒绝回答,利用内部置信信号,并展示其在性能上与监督式拒绝回答调优相匹配。
LongNovel 引入了一个多尺度基准测试,用于评估长上下文小说摘要中的幻觉,基于中英文小说构建,以改进LLM评估。
本文介绍了InnerExpert,这是一种利用Mixture-of-Experts信号在LLMs中进行逐词元幻觉检测的方法,性能优于现有技术。
本文研究大语言模型如何将长上下文中的概念距离压缩为短可导航路径,展示了其潜在空间中的“六度分隔”现象,并将此框架应用于检测检索增强生成系统中的幻觉。
BEAR-Bench引入了一个双语(英语和俄语)基准,用于评估多模态模型在文本丰富的专业文档上的推理能力,评估了16个模型并突出了性能差距。
本文介绍了一个在LLMs中通过将输出token与输入证据对齐来检测幻觉片段的任务,提出了一种基于编码器的模型,该模型使用预测置信度来检测幻觉,无需人工对齐。