LLM回测中的时间泄漏:测量、验证与调整分数

arXiv cs.LG 论文

摘要

本文表明,在LLM回测中,标准的前/后训练截止检查对时间泄漏的检测毫无信息量,因为近因效应会模仿泄漏。文章提出了使用已知截止点和匹配的干净对照组的新估计器,以测量泄漏并计算调整分数,并在前沿模型上进行了验证。

arXiv:2608.02985v1 公告类型:新 摘要:LLM回测中污染的标准检查很简单:比较训练截止前后的分数。我们证明这一检查毫无信息量。四个旗舰模型在它们不可能记住的问题上未通过检查:每个评分的题目都是在它们的截止日期之后解决的。原因是结构性的。模型对接近其截止日期的时期了解得更多是合理的,因此近因效应模仿了泄漏,我们证明没有任何被动回测能将这两者与真正的技能区分开来。测量,而不仅仅是检测,需要来自回测之外的信息。我们以两种形式提供这些信息。已知的截止点识别边界处的泄漏;匹配的干净对照组则能全局识别泄漏,并产生泄漏调整后的分数。我们还推导出泄漏隐藏的位置:它集中在那些让大众惊讶且在训练中被充分覆盖的结果上,并且部分记忆会被不成比例地奖励。我们通过在双胞胎模型中植入泄漏来验证这些估计器与真实情况,它们能恢复注入的剂量,并在干净问题上返回空值。部署在前沿模型上,它们检测到一个截止点局部化的特征,并且在审计的效能下限处,清除了五个模型的明显优势完全来自近因效应。回测不必被丢弃;它们需要一个可辩护的参考。
查看原文
查看缓存全文

缓存时间: 2026/08/05 07:44

# 测量、验证与调整分数

来源:https://arxiv.org/html/2608.02985

## 大型语言模型回测中的时间泄漏:测量、验证与调整分数

Zeyu Zhang
[email protected]
西北大学统计与数据科学系

Bradly C. Stadie
[email protected]
西北大学统计与数据科学系

###### 摘要

LLM 回测中污染的标准检查很简单:比较训练截止日期前后的分数。我们证明这种检查毫无信息量。四个旗舰模型在它们不可能记忆的问题上无法通过该检查:每个问题都在其截止日期之后才揭晓结果。原因是结构性的。模型对接近截止日期的时间段合法地知道更多,因此“近因性”模仿了泄漏,我们证明没有任何被动回测能将这两者与真实技能区分开。测量,而不仅仅是检测,需要来自回测外部的信息。我们以两种形式提供这种信息。已知的截止日期可以识别边界处的泄漏;匹配的干净对照可以在全局范围内识别泄漏,并产生泄漏调整分数。我们还推导出泄漏隐藏的位置:它集中在那些让大众感到意外且训练中覆盖良好的结果上,而部分记忆会获得不成比例的奖励。我们通过将泄漏植入孪生模型来验证估计器与真实情况的一致性,它们能够恢复注入的剂量并在干净问题上返回零结果。部署在前沿模型上时,它们检测到一个截止日期局部的特征,并且在审计的效能下限上,为五个模型洗清了嫌疑——这些模型的表面优势仅仅是近因性。回测不需要被丢弃;它们需要一个可靠的参考。

## 1 引言

大型语言模型越来越多地通过*回测*来评估:模型被要求在某个历史日期,对结果已经揭晓的事件进行预测,其得分被视为它预测真实未来能力的证据(Halawi et al.,2024 (https://arxiv.org/html/2608.02985#bib.bib15); Karger et al.,2025 (https://arxiv.org/html/2608.02985#bib.bib23); Lopez-Lira et al.,2025 (https://arxiv.org/html/2608.02985#bib.bib29); Paleka et al.,2026 (https://arxiv.org/html/2608.02985#bib.bib35); Gao et al.,2025 (https://arxiv.org/html/2608.02985#bib.bib10))。威胁在于时间泄漏:一个网络规模的训练语料库可能已经描述了被“预测”的结果,因此高分可能反映记忆而非技能。标准的防御是前/后检查,它比较模型训练截止日期前后的分数,并将优势落在截止日期之前一侧的模型标记为可疑(Jain et al.,2025 (https://arxiv.org/html/2608.02985#bib.bib21); Benhenda,2026 (https://arxiv.org/html/2608.02985#bib.bib1))。

图1 (https://arxiv.org/html/2608.02985#S1.F1)显示了该检查的失败。我们对五个旗舰模型在官方 ForecastBench 面板上进行了评分,仅限于在其记录的训练截止日期之后揭晓结果的问题,因此任何结果都不可能出现在它们的训练数据中。五个模型中有四个仍然未通过该检查,出现了高达\+0.061\+0.061的虚假“泄漏”差距。我们将记录的截止日期理解为所有训练数据的边界。第D.2节 (https://arxiv.org/html/2608.02985#A4.SS2)的匹配窗口检查支持这一理解:在一个共同窗口中,所有五个差距都一起消失了。

图1:不可能泄漏的模型仍然无法通过朴素的污染检查。每行是一个模型(括号中是截止月份),仅对在其截止日期至少 30 天后揭晓结果的问题进行评分,因此其结果不可能在其训练数据中。x 轴是其朴素差距Δ=s̄early−s̄late\\Delta=\\bar{s}\_\\{\\mathrm{early}\\}-\\bar{s}\_\\{\\mathrm{late}\\},窗口在其中位揭晓日期处分割,其中s=(c0−Y)2−(P−Y)2s=(c\_\{0\}-Y)^\{2\}-(P-Y)^\{2\}是模型预测PP相对于大众预测c0c\_\{0\}的 Brier 改进(越高越好);Δ\>0\\Delta\>0意味着在较旧问题上表现更好,这是审计解读为泄漏的模式。须状线:聚类自助法 95% 置信区间;∗:置信区间排除零。结果:五个旗舰模型中有四个被标记,Δ=+0.044\\Delta=+0.044至\+0.061∗\+0.061^\{\\ast\};仅近因性就产生了泄漏模式。

这种失败是结构性的,而非某个基准的缺陷。回测分数混合了三个组成部分。*技能*是评估想要测量的东西。*近因性*是随截止日期距离而变化的合法知识:训练数据更密集地覆盖近期时段,而截止日期之后的知识会变得过时(Lazaridou et al.,2021 (https://arxiv.org/html/2608.02985#bib.bib24))。*泄漏*是记忆的结果信息,它是不合法的。同一个截止日期驱动了后两者:一个在截止日期附近揭晓的问题,既是模型合法地知道更多的问题,也是其结果更可能存在于语料库中的问题。因此,前/后对比同时测量了近因性和泄漏,而仅近因性就能重现泄漏特征。其他失败模式——幻觉、校准不良、提示敏感性(Huang et al.,2025 (https://arxiv.org/html/2608.02985#bib.bib18); Xiong et al.,2024 (https://arxiv.org/html/2608.02985#bib.bib53); Sclar et al.,2024 (https://arxiv.org/html/2608.02985#bib.bib43))——会降低截止日期两侧的诚实表现;只有泄漏是回测特有的,并且它会抬高分数。因此,实践中重要的问题不是污染是否存在——它通常存在(Sainz et al.,2023 (https://arxiv.org/html/2608.02985#bib.bib40); Golchin & Surdeanu,2024 (https://arxiv.org/html/2608.02985#bib.bib13))——而是它抬高了分数多少,以及分数能否被修正。现有工具无法回答这个问题。检测方法确立了污染的存在,而不是它的价值(Oren et al.,2024 (https://arxiv.org/html/2608.02985#bib.bib34); Zawalski et al.,2026 (https://arxiv.org/html/2608.02985#bib.bib57)),而提示层面的补救措施无法抑制回忆(Lopez-Lira et al.,2025 (https://arxiv.org/html/2608.02985#bib.bib29))。静态基准上的干净参考估计无法迁移,因为回测通过日期而非成员资格来定义“干净”(Singh et al.,2024 (https://arxiv.org/html/2608.02985#bib.bib46); Haimes et al.,2024 (https://arxiv.org/html/2608.02985#bib.bib14))。重新训练一个真正干净的参考模型会失败,因为其截止日期必须早于每一个评估问题,这会使模型过于过时,无法代表被审计的模型(Drinkall et al.,2024 (https://arxiv.org/html/2608.02985#bib.bib6))。本文通过四个步骤回答了这个定量问题:我们证明膨胀量无法仅从预测和结果中识别,推导出它集中的位置,表明一个外部参考就能恢复测量,并通过将泄漏植入孪生模型来验证估计器与真实情况的一致性。部署在前沿系统上时,这些估计器检测到一个截止日期局部的特征,并且在设计的效能下限上,为五个模型洗清了嫌疑——这些模型的表面优势仅仅是近因性。

##### 贡献。

- •标准检查毫无信息量(第3节 (https://arxiv.org/html/2608.02985#S3))。泄漏膨胀量无法仅从回测分数中识别:识别集合是一个尖锐区间,更多数据不会缩小它。平坦的前/后剖面不是回测干净的证据,而图1 (https://arxiv.org/html/2608.02985#S1.F1)显示了真实旗舰模型上的相反失败。
- •泄漏不是一个比率;它遵循一条规律(第4节 (https://arxiv.org/html/2608.02985#S4))。每个问题上的膨胀量等于诚实的不确定性乘以一个具有双重好处的提取因子:一半的泄漏信号已经产生四分之三的完全膨胀量。泄漏集中在大众感到意外且训练覆盖密集的地方,因此平均污染率是错误的审计对象。
- •一个经过验证的审计配方(第5节 (https://arxiv.org/html/2608.02985#S5)、6 (https://arxiv.org/html/2608.02985#S6)和7 (https://arxiv.org/html/2608.02985#S7))。选择一个参考——已知的截止日期(回归断点)或匹配的干净对照(双重差分)——运行匹配估计器,并报告带有其假设的泄漏调整分数;释义探测可以检测泄漏但无法测量它。估计器在孪生模型中以剂量、位置和逐问题剖面恢复植入的泄漏,在干净孪生体上返回零结果,并在真实场景中表现诚实。第8节 (https://arxiv.org/html/2608.02985#S8)将这项工作置于污染文献中;证明、估计器细节和完整的实验配置在附录中。

## 2 问题设置

##### 机制。两个日期支配着时间泄漏,图2 (https://arxiv.org/html/2608.02985#S2.F2)使机制精确化。*截止日期* t0t\_\{0\}是真实预测可以使用的信息边界;部署模型的*训练截止日期*是T\>t0T\>t\_\{0\}。截至t0t\_\{0\}的世界状态生成了真实预测者可用的训练语料库Dclean\\mathcal\{D\}\_\{\\mathrm\{clean\}\},而较晚的状态W\+W\_\{\+\}是“桥梁”训练数据Dbridge\\mathcal\{D\}\_\{\\mathrm\{bridge\}\}(在t0t\_\{0\}之后但TT之前编写的文本)和已实现结果YY的潜在共同原因。因此,一个在Dclean∪Dbridge\\mathcal\{D\}\_\{\\mathrm\{clean\}\}\\cup\\mathcal\{D\}\_\{\\mathrm\{bridge\}\}上训练的模型可以通过后门路径W\+→Dbridge→y^corruptW\_\{\+\}\\to\\mathcal\{D\}\_\{\\mathrm\{bridge\}\}\\to\\hat\{y\}\_\{\\mathrm\{corrupt\}\}获取关于YY的信息,即图2 (https://arxiv.org/html/2608.02985#S2.F2)中的红色泄漏路径,而基准问题从未逐字出现在训练中。时间知识泄漏就是这个后门流;它将一个使用桥梁数据训练的模型(y^corrupt\\hat\{y\}\_\{\\mathrm\{corrupt\}\})与一个没有使用它的完全相同模型(y^clean\\hat\{y\}\_\{\\mathrm\{clean\}\})区分开来。像“*国家XX会在 2023 年第四季度进入衰退吗?*”这样的问题,如果在截止日期前揭晓,就有资格发生泄漏,模型可能只是回忆已报道的结果;如果在截止日期后揭晓,则是干净的,模型必须进行推理。W(t0)W(t\_\{0\})W\+W\_\{\+\}Dclean\\mathcal\{D\}\_\{\\mathrm\{clean\}\}YYDbridge\\mathcal\{D\}\_\{\\mathrm\{bridge\}\}y^clean\\hat\{y\}\_\{\\mathrm\{clean\}\}y^corrupt\\hat\{y\}\_\{\\mathrm\{corrupt\}\}泄漏在问题日期t0t\_\{0\}之前泄漏窗口(t0,T\](t\_\{0\},\\,T\]图2:时间泄漏是训练文本和结果共同原因导致的间接信息流,而非逐字重叠。模型的训练截止日期TT晚于截止日期t0t\_\{0\};当问题在(t0,T\](t\_\{0\},T\]内揭晓时,它有资格发生泄漏。较晚的世界状态W\+W\_\{\+\}决定了结果YY(黑色,顶部),同时也生成了桥梁数据Dbridge\\mathcal\{D\}\_\{\\mathrm\{bridge\}\},即在(t0,T\](t\_\{0\},T\]内编写的文本。部署的模型在Dclean\\mathcal\{D\}\_\{\\mathrm\{clean\}\}*加上*Dbridge\\mathcal\{D\}\_\{\\mathrm\{bridge\}\}上训练,因此红色路径W\+→Dbridge→y^corruptW\_\{\+\}\\\!\\to\\\!\\mathcal\{D\}\_\{\\mathrm\{bridge\}\}\\\!\\to\\\!\\hat\{y\}\_\{\\mathrm\{corrupt\}\}将结果信息带入模型,而基准问题从未出现在训练中;反事实的干净模型y^clean\\hat\{y\}\_\{\\mathrm\{clean\}\}(蓝色)仅从Dclean\\mathcal\{D\}\_\{\\mathrm\{clean\}\}学习。

##### 记号。我们审计一个参考截止日期为TT的回测模型;TT的不确定性通过敏感性分析处理,而非视为已知。对于随机问题,我们观察到已实现结果Y∈{0,1}Y\\in\\\{0,1\\\};模型在固定确定性协议下的预测P∈[0,1]P\\in\[0,1\];*运行变量* GG,即问题揭晓日期与截止日期之间的带符号距离,泄漏合格问题为负(g<0g<0),干净问题为正;以及一个无需模型即可观察到的无泄漏难度协变量XX,例如同期的大众预测。我们使用 Brier 损失l=(P−Y)2\\ell=(P-Y)^\{2\}进行评分,这是一个严格适当的分数;第5节 (https://arxiv.org/html/2608.02985#S5)的识别结果只需要一个有界损失。核心可观测对象是条件平均损失

m(x,g)=E[(P−Y)2∣X=x,G=g],m(x,g)\\;=\\;\\mathbb\{E\}\\big\[(P-Y)^\{2\}\\mid X=x,\\ G=g\\big\],(1)

它可以在回测有数据的任何地方通过回归估计。

##### 目标。泄漏将截止日期前的损失降低到模型合法信息所能达到的水平以下。记m0(x,g)m\_\{0\}(x,g)为*诚实表面*:部署模型仅使用合法信息时会产生的损失。它仍然随gg变化,因为合法知识取决于与截止日期的时间距离;这种变化就是近因性,理论对其形状或方向不施加任何限制。本文的目标是*膨胀量*

B=E[m0(X,G)−m(X,G)∣G<0]≥0,B\\;=\\;\\mathbb\{E\}\\big\[\\,m\_\{0\}(X,G)\-m(X,G)\\mid G<0\\,\\big\]\\;\\geq\\;0,(2)

即回测在有资格发生泄漏的问题上低估模型诚实误差的平均量。本文的目标是对膨胀量及其置信区间的估计,以及由此产生的*泄漏调整*分数。附录A (https://arxiv.org/html/2608.02985#A1)整理了所有符号和常规正则性约定;证明在附录B (https://arxiv.org/html/2608.02985#A2)中。

## 3 仅凭分数无法测量泄漏

一个完成的回测产生*被动数据*:\(P,Y,X,G\)\(P,Y,X,G\)的抽样。本节证明,无论评分多少问题,膨胀量BB都不是它们联合定律的泛函,并精确隔离了缺失的内容,这决定了第5节 (https://arxiv.org/html/2608.02985#S5)中补救措施的形式。(2 (https://arxiv.org/html/2608.02985#S2.E2))中BB的定义将可观测表面mm与诚实表面m0m\_\{0\}进行比较,因此内容在于哪些对\(m0,L\)\(m\_\{0\},L\)是可行的。

###### 定义 1(操作性风险分解)。一对函数m0:X×R→[0,1]m\_\{0\}:\\mathcal\{X\}\\times\\mathbb\{R\}\\to\[0,1\]和L:X×R→RL:\\mathcal\{X\}\\times\\mathbb\{R\}\\to\\mathbb\{R\}是mm的一个*操作性分解*,如果

m(x,g)=m0(x,g)−L(x,g)。m(x,g)=m\_\{0\}(x,g)\-L(x,g)。(3)

可行的对总是存在的(\(m,0\)\(m,0\)就是一个);内容通过符号和支持限制进入。

###### 假设 1(截止日期前非负泄漏)。存在一个操作性分解\(m0,L\)\(m\_\{0\},L\),使得L(x,g)≥0L(x,g)\\geq 0并且对于每个g≥0g\\geq 0,L(x,g)=0L(x,g)=0。支持限制说未来无法泄漏。对于一个*冻结*模型(没有检索工具,没有截止日期后的微调;截止日期不确定性通过敏感性分析处理,第2节 (https://arxiv.org/html/2608.02985#S2)),在TT之后揭晓的结果不可能被看到,而在截止日期之前,记忆的信息通过L≥0L\\geq 0降低损失。近因性存在于m0m\_\{0\}中:诚实表面可以以任何方式依赖于gg,特别是理论从不假设模型在总体上更了解近期时段。在假设1 (https://arxiv.org/html/2608.02985#Thmassumption1)下,膨胀量为B=E[L(X,G)∣G<0]B=\\mathbb\{E\}\[L(X,G)\\mid G<0\],如 (2 (https://arxiv.org/html/2608.02985#S2.E2))所示。

{restatable} [被动分数的尖锐部分识别]theoremthmnonident 仅凭假设1 (https://arxiv.org/html/2608.02985#Thmassumption1),BB不是\(P,Y,X,G\)\(P,Y,X,G\)定律的泛函:任何一个在{g<0}\\\{g<0\\\}上满足m≤m~0≤1m\\leq\\tilde\{m\}\_\{0\}\\leq 1且在{g≥0}\\\{g\\geq 0\\\}上满足m~0=m\\tilde\{m\}\_\{0\}=m的延续m~0:X×R→[0,1]\\tilde\{m\}\_\{0\}:\\mathcal\{X\}\\times\\mathbb\{R\}\\to\[0,1\]都定义了一个可行的

相似文章

LLM微调中数据选择的长期影响

arXiv cs.LG

本文研究了多阶段LLM微调中数据选择策略的长期影响,揭示了短视选择会损害未来适应能力。为此,提出了一种长期视角感知选择(LHAS)目标以缓解这些问题。

量化并缓解前沿大语言模型中的过早闭合

arXiv cs.CL

本文定义并衡量了前沿大语言模型中的过早闭合现象,发现即使正确选项被移除或需要澄清时,模型仍频繁给出自信的回答,凸显了医疗应用中的一个关键安全问题。

衡量而非优化:预测LLM遗忘中的恢复

arXiv cs.CL

提出了J-Access,一种使用雅可比透镜的推理时审计方法,用于衡量未学习(unlearned)LLM中残余知识的可访问性,发现可访问性可预测恢复速度,但直接最小化它并不能促进真正的删除。