零差距并非恢复:分层逐题概率评估与基准污染的逐步缓解
摘要
本文批判了现有的基准污染缓解指标,并提出了SA-PPG(逐题概率差距的分层聚合)以实现更可靠的评估,同时提出了RailCap,一种解码时缓解方法,通过限制贪婪回退令牌来抑制记忆。
查看缓存全文
缓存时间: 2026/08/10 08:05
# 基准污染的分层按问题概率评估与逐步缓解 来源:https://arxiv.org/html/2608.07341 Ruijie Hou<sup>1</sup>、Yueyang Jiao<sup>1</sup>、Zhao Wang、Yingming Li<sup>2</sup> <sup>1</sup>两位作者对本工作贡献相同。 <sup>2</sup>Yingming Li 为通讯作者。 浙江大学 [email protected],yingming@
相似文章
StepGap: 一种混合NLI-LLM检测器用于多跳问答中的步骤级证据缺口检测
StepGap是一个混合NLI-LLM决策树,用于检测多跳问答中的步骤级证据缺口,并将其标记为矛盾声明、无关证据或缺失桥梁。它在实现有竞争力的F1分数的同时,提供了一种可分解的结构,当用作强化学习的过程奖励时,可以提高下游问答的性能。
Excess Separability: Nuisance-Controlled Residual-Stream Probing for Benchmark Contamination Detection
This paper proposes a nuisance-controlled residual-stream probing protocol to detect benchmark contamination in language models, showing that naive probing fails and their corrected method controls false positives while achieving reasonable power.
为稳健的 RAG 评估生成无知识泄露的基准测试
本文介绍了 SeedRG,这是一个半合成的基准测试生成管道,旨在通过创建保留推理结构但不在模型参数记忆中的新实例,消除检索增强生成 (RAG) 评估中的知识泄露。
EverydayGPT:面向高效安全混合GPT-RAG对话问答的置信门控路由
EverydayGPT 引入置信门控路由(CGR)机制,该机制针对每个查询决定使用RAG、直接GPT生成还是拒绝,在85%的查询上实现120倍延迟降低,同时保持答案质量,这在500问题基准测试中得到验证。
识别与解决知识型VQA基准测试的陷阱:审计、修复与增强
本文对知识型VQA基准进行了审计,揭示了系统性的假设违反,使得准确率成为误导性指标。它提出了一种修复协议和多实体增强方法,以恢复答案可推导性和问题清晰度,表明修正后的设置产生了显著不同的模型排名。