基准是否低估了 LLM 的性能?采用以大语言模型为先、人工仲裁的评估方法评估幻觉检测
摘要
本文通过采用以大语言模型为先、人工仲裁的评估方法重新评估幻觉检测数据集,研究了标准基准是否低估了大语言模型(LLM)的性能。研究发现,在仲裁过程中融入大语言模型的推理能力可以提高评估的一致性,并表明针对容易产生歧义的任务,采用模型辅助的重新评估能产生更可靠的基准。
arXiv:2605.08462v1 公告类型:新发布
摘要:幻觉问题在大语言模型(LLM)中依然是一个持续存在的挑战,特别是在基于上下文的设置中,如检索增强生成(RAG)和智能体(agentic)AI 系统。本研究聚焦于摘要任务中的上下文幻觉检测。我们通过比较原始基准标注与 Gemini 2.5 Flash 和 GPT-5 Mini 基于推理和片段(span)的预测,分析了 QAGS-C 和 SummEval 数据集。为了解决人工标注与大语言模型判断之间的系统性差异,我们让 2 位跨文化仲裁员参与人工仲裁流程,对所有存在冲突的样本进行了重新评估。经过重新评估后,QAGS-C 数据集上三方(人工、GPT 和 Gemini)的一致性提高了 6.38%,SummEval 数据集上提高了 7.62%。同样,模型准确率也有所提升,GPT 在 QAGS-C 上提高了 4.25%,在 SummEval 上提高了 2.34%,而 Gemini 分别提高了 8.51% 和 3.80%。值得注意的是,当大语言模型提供明确推理时,仲裁员经常支持模型的判断而非原始人工标注。人工仲裁员之间的一致性总体在 83% 到 87% 之间。这些发现表明,对于容易产生歧义的任务,单次标注可能是不够的,而模型辅助的重新评估能产生更可靠的基准。
查看缓存全文
缓存时间: 2026/05/12 06:48
# 基准测试是否低估了 LLM 的性能?通过 LLM 优先的人为仲裁评估来评估幻觉检测 来源:https://arxiv.org/abs/2605.08462 查看 PDF (https://arxiv.org/pdf/2605.08462) > 摘要:幻觉仍然是大型语言模型(LLMs)中持续存在的挑战,特别是在基于上下文的环境中,例如 RAG 和智能体(Agentic)AI 系统。本研究专注于摘要任务中的上下文幻觉检测。我们分析了 QAGS-C 和 SummEval 数据集,通过比较原始基准标注与 Gemini 2.5 Flash 和 GPT-5 Mini 基于推理和跨度(span)的预测结果来进行分析。为了解决人工标签与 LLM 判断之间的系统性分歧,我们通过两名跨文化仲裁员对存在冲突的样本进行了人工仲裁重新评估。经过重新评估后,三方一致性(人类、GPT 和 Gemini 之间)在 QAGS-C 上提高了 6.38%,在 SummEval 上提高了 7.62%。同样,模型准确率也得到了提升,GPT 在 QAGS-C 和 SummEval 上分别提高了 4.25% 和 2.34%,而 Gemini 分别提升了 8.51% 和 3.80%。值得注意的是,当 LLM 提供明确的推理过程时,仲裁员经常支持模型的判断而非原始的人工标注。整体人工仲裁员的一致性率在 83% 到 87% 之间。这些发现表明,对于容易产生歧义的任务,单次标注可能不足够,而模型辅助的重新评估能产生更可靠的基准。 ## 提交历史 作者:İsmail Furkan Atasoy \[查看邮箱 (https://arxiv.org/show-email/14ee8f0e/2605.08462)\] **\[v1\]** 2026年5月8日 星期五 20:27:44 UTC \(530 KB\)
相似文章
PARALLAX: 区分真实幻觉检测与基准构建伪影
本文揭示了LLM幻觉检测领域报道的许多进展实际上源于基准构建伪影,其中真实答案被嵌入到提示中,使得简单的文本相似度基线方法能够获得近乎完美的分数。通过大规模受控评估,作者证明,在适当控制下,大多数方法的表现接近随机水平,除了对上层隐藏状态的监督探针(如SAPLMA)以及他们提出的DRIFT。
法律大语言模型的幻觉应被评估为法律依据的缺失
这篇立场论文主张,法律大语言模型的幻觉应被视为法律依据的缺失而非事实性错误,并提出一个新的基准框架来评估法律人工智能系统。
最有趣的基准测试之一及其对对齐的意义
文章讨论了大语言模型幻觉的公共基准测试如何推动快速改进,并探讨了对对齐的启示,强调需要透明度和诚实度的基准测试。
LLM置信度估计的不同方法基准测试
本文对LLM置信度估计的各种黑盒与白盒方法进行了基准测试,包括口头化置信度、语言不确定性、推理长度、P(Answer)、P(True)和自我一致性,比较它们在主动学习和安全分类等任务中的有效性。
@dair_ai: // 你的LLM评判与专家意见相左 // 构建LLM评判者可能颇具挑战性。这里展示了一个有趣的案例,说明为何…
本文介绍了UPHELD,这是一个带有大量人工标注的基准,用于评估对话型LLM,以及Mixture-of-Judges框架,可将评估准确性提高30%。