零差距并非恢复:分层逐题概率评估与基准污染的逐步缓解

arXiv cs.CL 论文

摘要

本文批判了现有的基准污染缓解指标,并提出了SA-PPG(逐题概率差距的分层聚合)以实现更可靠的评估,同时提出了RailCap,一种解码时缓解方法,通过限制贪婪回退令牌来抑制记忆。

arXiv:2608.07341v1 公告类型:新\n摘要:来自公共基准的测试数据不可避免地泄漏到预训练语料中,一旦被记忆就会抬高评估分数。\textbf{污染缓解评估}在解码过程中进行干预,以抑制记忆并恢复受污染模型的真实能力,但其主流指标 \textbf{G-AP}(\textbf{G}ap of \textbf{A}ggregate \textbf{P}erformance,即总体表现差距)存在缺陷。离散的正确/错误读数无法刻画逐题表现;先平均再求差会让过度抑制和欠抑制相互抵消;而均匀的逐题权重会诱使策略将解题概率推向干净模型的高频值。我们提出 \textbf{SA-PPG}(\textbf{S}tratified \textbf{A}ggregate of \textbf{P}er-question \textbf{P}robability \textbf{G}aps,即逐题概率差距的分层聚合):通过采样估计每道题的解题概率,将其与干净模型逐题求差,并按干净模型的解题概率所定义的分组进行聚合。现有缓解策略先估计污染所在位置,再基于该估计进行操作,因此其准确性取决于估计的准确性。\textbf{RailCap} 则在生成过程中判断污染:每当样本回落到贪婪轨迹上时,将下一个轨迹令牌限制为亚军令牌,不断累积抑制,直到响应分布充分分散。在多个受污染模型和基准上,SA-PPG 显示先前策略的恢复效果被大幅高估,而 RailCap 取得了最低的 SA-PPG。
查看原文
查看缓存全文

缓存时间: 2026/08/10 08:05

# 基准污染的分层按问题概率评估与逐步缓解  
来源:https://arxiv.org/html/2608.07341  
Ruijie Hou<sup>1</sup>、Yueyang Jiao<sup>1</sup>、Zhao Wang、Yingming Li<sup>2</sup>   
<sup>1</sup>两位作者对本工作贡献相同。  
<sup>2</sup>Yingming Li 为通讯作者。  
浙江大学  
[email protected],yingming@

相似文章

识别与解决知识型VQA基准测试的陷阱:审计、修复与增强

arXiv cs.CL

本文对知识型VQA基准进行了审计,揭示了系统性的假设违反,使得准确率成为误导性指标。它提出了一种修复协议和多实体增强方法,以恢复答案可推导性和问题清晰度,表明修正后的设置产生了显著不同的模型排名。