基准是否低估了 LLM 的性能?采用以大语言模型为先、人工仲裁的评估方法评估幻觉检测
摘要
本文通过采用以大语言模型为先、人工仲裁的评估方法重新评估幻觉检测数据集,研究了标准基准是否低估了大语言模型(LLM)的性能。研究发现,在仲裁过程中融入大语言模型的推理能力可以提高评估的一致性,并表明针对容易产生歧义的任务,采用模型辅助的重新评估能产生更可靠的基准。
查看缓存全文
缓存时间: 2026/05/12 06:48
# 基准测试是否低估了 LLM 的性能?通过 LLM 优先的人为仲裁评估来评估幻觉检测 来源:https://arxiv.org/abs/2605.08462 查看 PDF (https://arxiv.org/pdf/2605.08462) > 摘要:幻觉仍然是大型语言模型(LLMs)中持续存在的挑战,特别是在基于上下文的环境中,例如 RAG 和智能体(Agentic)AI 系统。本研究专注于摘要任务中的上下文幻觉检测。我们分析了 QAGS-C 和 SummEval 数据集,通过比较原始基准标注与 Gemini 2.5 Flash 和 GPT-5 Mini 基于推理和跨度(span)的预测结果来进行分析。为了解决人工标签与 LLM 判断之间的系统性分歧,我们通过两名跨文化仲裁员对存在冲突的样本进行了人工仲裁重新评估。经过重新评估后,三方一致性(人类、GPT 和 Gemini 之间)在 QAGS-C 上提高了 6.38%,在 SummEval 上提高了 7.62%。同样,模型准确率也得到了提升,GPT 在 QAGS-C 和 SummEval 上分别提高了 4.25% 和 2.34%,而 Gemini 分别提升了 8.51% 和 3.80%。值得注意的是,当 LLM 提供明确的推理过程时,仲裁员经常支持模型的判断而非原始的人工标注。整体人工仲裁员的一致性率在 83% 到 87% 之间。这些发现表明,对于容易产生歧义的任务,单次标注可能不足够,而模型辅助的重新评估能产生更可靠的基准。 ## 提交历史 作者:İsmail Furkan Atasoy \[查看邮箱 (https://arxiv.org/show-email/14ee8f0e/2605.08462)\] **\[v1\]** 2026年5月8日 星期五 20:27:44 UTC \(530 KB\)
相似文章
PARALLAX: 区分真实幻觉检测与基准构建伪影
本文揭示了LLM幻觉检测领域报道的许多进展实际上源于基准构建伪影,其中真实答案被嵌入到提示中,使得简单的文本相似度基线方法能够获得近乎完美的分数。通过大规模受控评估,作者证明,在适当控制下,大多数方法的表现接近随机水平,除了对上层隐藏状态的监督探针(如SAPLMA)以及他们提出的DRIFT。
LLM置信度估计的不同方法基准测试
本文对LLM置信度估计的各种黑盒与白盒方法进行了基准测试,包括口头化置信度、语言不确定性、推理长度、P(Answer)、P(True)和自我一致性,比较它们在主动学习和安全分类等任务中的有效性。
评估 LLM 在受控实验中作为人类代理的可靠性
本论文通过比较 LLM 生成的数据与人类在准确性感知调查中的反应,评估现成 LLM 是否能可靠地模拟受控行为实验中的人类反应。研究发现,虽然 LLM 能捕捉方向性效应和聚合信念更新模式,但它们的效应大小与人类尺度不一致,这有助于澄清合成 LLM 数据何时可以作为行为代理。
行动之前:面向前瞻性假设发现的LLM基准测试
本文介绍了HypoArena,这是一个用于评估LLMs从非完整证据中主动构建假设空间能力的基准,在15个前沿LLM上的实验揭示了能力分层。
对概率算子进行逻辑推理的LLM能力基准测试
本文介绍了一个包含14,320个程序化生成提示词的基准测试,用于评估LLM在涉及“probably”“might”“must”等概率算子的逻辑推理上的表现。作者对29个模型进行了测试,发现了系统性的答案偏差,并表明只有9个模型的表现超过了随机水平。