无需先验的模型预测信息泄露盲检测
摘要
本文提出了一种决策理论框架,仅利用模型输出和结果来检测预测模型中的数据泄露,证明了某些泄露类型无需外部基准或训练代码即可识别。
arXiv:2606.11267v1 公告类型:新
摘要:数据泄露——模型被基线时不可用的信息污染——是基于机器学习的科学中主要的可重复性失败,然而检测工具需要训练代码、外部数据或领域专业知识。没有任何工具能处理审计员最常持有的产物:模型的输出。我们研究仅凭预测和结果能对泄露做出何种判断。我们提出一个决策理论框架,其中泄露诊断是预测风险/结果律的泛函,通过一个与恰当评分规则和决策曲线分析相关的阈值加权来参数化。我们证明了一个严格的不可能性:一个经过重新校准的泄露,如果匹配了诚实模型的校准和判别能力,则无法通过预测的\emph{任何}函数与诚实性能区分开来,因此除非外部提供了可达到判别的上限,否则这类宽泛的泄露无法被检测。然后我们证明泄露无法隐藏什么:一个近乎确定性的子群——近标签泄露的特征——会产生一个持续的单位纯度头部,任何非确定性结果的合法预测器都无法制造,从而得到一个无先验的测试。这些结果将泄露组织成一个三分法——失校准、宽校准和确定性——每种都有匹配的检测器和失败模式。我们在英国生物银行(UK Biobank)上使用具有已知分级严重性的时间窗共病泄露进行验证,测量到该终点上$\Delta\cstar \approx 0.007$的检测下限,低于此阈值的残留泄露无法从输出中检测到,且太小不足以改变结论。数值下限因队列和终点而异;结构性的教训是普遍性的:仅输出检测在残留泄露与诚实的更强预测器无法区分时失效。该测试在普通硬件上不到一秒即可得出预测向量的判断结果。
查看缓存全文
缓存时间: 2026/06/11 13:45
# 模型预测信息泄露的无先验盲检测 来源:https://arxiv.org/html/2606.11267 Laurence A. Jacobs¹,²,∗ ¹苏黎世大学分子心脏病学中心,瑞士苏黎世 ²墨西哥国立大学复杂性科学中心,墨西哥墨西哥城 ∗通讯作者:[email protected] (https://arxiv.org/html/2606.11267v1/mailto:[email protected]) ###### 摘要 数据泄露——预测模型被基线时不可用的信息污染——是基于机器学习的科学中最主要的可重复性失败原因,然而当前使用的检测工具需要训练代码、全新的外部数据或领域专业知识。没有任何工具能作用于审计者最常持有的制品:模型输出。我们探究仅凭预测结果和实际结果列表能推断出哪些关于泄露的信息。我们提出了一个决策理论框架,在该框架中,泄露诊断是预测风险/结果律的泛函,由阈值加权参数化,使其与适当评分规则和决策曲线分析相对应。在此框架内,我们证明了一个严格的不可能性:经过重新校准的泄露,若能匹配诚实模型的校准与区分度,则通过*任何*预测值的函数都无法与诚实表现区分开。因此,广泛的泄露类型只有在外部提供了可实现区分度上限时才可检测。然后我们证明了泄露无法隐藏什么:一个近乎确定性的子组——近乎标签泄露的特征——会产生持续的纯净头部,而任何对非确定性结果的合法预测器都无法制造这种头部,从而得到一个无先验的检验。这些结果将泄露组织成三分法——未校准、广泛校准和确定性——每一类都有匹配的检测器和明确的失效模式。我们在英国生物银行上使用时窗共病泄露(具有已知的分级严重程度)验证了该三分法,测得了在该终点上的检测下限 ΔC∗≈0.007,低于此值的残余泄露既无法通过输出检测到,也太小以至于无法改变结论。该数值下限取决于队列、患病率、终点和泄露机制;结构性启示是普遍的:仅输出检测恰好会在残余泄露与诚实的更强预测器不可区分且缺乏外部基准的情况下失效。最终测试接收一个预测向量,在普通硬件上不到一秒钟返回判决。 ## 1 引言 泄露发生在模型使用部署时无法合法获取的信息进行训练时,导致报告的性能反映了模型在实际使用中无法复现的量\[12 (https://arxiv.org/html/2606.11267#bib.bib1),14 (https://arxiv.org/html/2606.11267#bib.bib22)\]。近期调查将其识别为导致结果不可复现的普遍且跨领域的原因,影响到许多学科中数百项已发表的研究,并且表明一旦纠正了泄露,复杂模型相对于简单基线的明显优势往往消失\[11 (https://arxiv.org/html/2606.11267#bib.bib2)\]。在审计最深入的领域之一,Roberts等人\[16 (https://arxiv.org/html/2606.11267#bib.bib18)\]审查了62篇COVID-19影像模型,发现无一被认为适合临床使用,而泄露是主要失败模式之一。因此,泄露并非小众建模错误,而是对预测性主张证据价值的系统性威胁。 现有的检测方法都在结果的上游阶段工作。对训练流程的静态分析可以检测机械性泄露——训练/测试污染、分割前预处理拟合、测试重复使用\[4 (https://arxiv.org/html/2606.11267#bib.bib15)\]——但这需要源代码\[26 (https://arxiv.org/html/2606.11267#bib.bib3)\]。外部验证通过无法复现来暴露泄露,但需要独立队列,而大多数研究从未获得独立队列。PROBAST和TRIPOD等偏倚风险和报告工具通过专家评估来捕捉泄露,但耗时且需要受试者和方法学两方面的专业知识\[25 (https://arxiv.org/html/2606.11267#bib.bib4),10 (https://arxiv.org/html/2606.11267#bib.bib5),2 (https://arxiv.org/html/2606.11267#bib.bib14),1 (https://arxiv.org/html/2606.11267#bib.bib19)\]。而编辑、复现者或内部审计者最常实际持有的制品——模型在评估集上的预测连同实际结果——却没有自己的检验。 我们提出一个精确的问题:*仅凭预测风险与结果的对(p̂,y),能对泄露做出哪些判断?*答案既不是“一切”也不是“无”,本文的贡献在于精确划出界限并提供处于界限好一侧的检测器。 #### 贡献。 (i) 一个决策理论框架(第2节 (https://arxiv.org/html/2606.11267#S2)),其中输出级别的泄露诊断是阈值加权的净收益泛函,通过混合表示与适当评分规则相关联。(ii) 一个不可能性定理(第3节 (https://arxiv.org/html/2606.11267#S3)):在区分度上匹配的校准泄露对任何(p̂,y)泛函均不可见,因此广泛类型的泄露仅相对于外部区分度上限可检测。(iii) 一个无先验的积极结果(第4节 (https://arxiv.org/html/2606.11267#S4)):持续的纯净头部仅凭结果非确定性的定性假设即可证实泄露。(iv) 由此产生的三分法(第5节 (https://arxiv.org/html/2606.11267#S5))。(v) 在英国生物银行上使用时窗泄露进行验证,测得灵敏度下限(第7节 (https://arxiv.org/html/2606.11267#S7))。(vi) 一个可部署的亚秒级检验。 ## 2 框架 #### 设置。 一个模型为i=1,...,n产生预测风险p̂_i∈[0,1],并带有二元结果y_i∈{0,1}。我们将(p̂_i,y_i)视为来自[0,1]×{0,1}上联合律P的样本,基准率π=E[y]。若E[y|p̂]=p̂,则预测器是*校准*的;这对应于Van Calster等人\[23 (https://arxiv.org/html/2606.11267#bib.bib26),22 (https://arxiv.org/html/2606.11267#bib.bib20)\]层次中的中度校准。区分度用C∗报告¹。 ¹全文我们用C∗表示Harrell的一致性统计量\[7 (https://arxiv.org/html/2606.11267#bib.bib12)\],即随机选择的病例排在随机选择的对照之上的概率。 #### 净收益及其阈值加权。 对于决策阈值τ,基于{p̂≥τ}行动的净收益为NB(τ)=1n∑i[yi1{p̂i≥τ}−(1−yi)1{p̂i≥τ}τ1−τ]\[24 (https://arxiv.org/html/2606.11267#bib.bib6)\],其中τ/(1−τ)是伤害-收益交换率。遵循期望净收益框架\[9 (https://arxiv.org/html/2606.11267#bib.bib9)\],我们通过(0,1)上的密度η对净收益在阈值上加权, ENBη=∫01NB(τ)η(τ)dτ=1n∑i[yiH(p̂i)−(1−yi)G(p̂i)], (1)其中H(p)=∫0pη,G(p)=∫0pη(τ)τ1−τdτ。根据适当评分规则的Schervish混合表示\[17 (https://arxiv.org/html/2606.11267#bib.bib7),5 (https://arxiv.org/html/2606.11267#bib.bib8),6 (https://arxiv.org/html/2606.11267#bib.bib10)\],η是混合测度:每个η选择一个适当得分,并将其质量转向τ→1产生对最严格操作点敏感的泛函。方程(1)因此是一个*族*探针,而非单个数字。本文中我们采用均匀默认η≡1,这足以展示三种机制;具有特定决策阈值范围的应用(如低τ筛查、高τ治疗选择)允许检测器变体专注于该范围而不修改框架。这种表示很重要,因为泄露不必是全局性的;它可能仅出现在临床相关阈值区域或预测分布的极端风险头部。 #### 两个泄露可观测量。 记r_i=y_i−p̂_i,w(p)=H(p)+G(p),(1)分解为ENNη= B̃η+1n∑ir_iw(p̂_i),其中B̃η仅依赖于p̂。加权残差产生一个检验校准零假设y|p̂∼Bernoulli(p̂)的*离散*统计量, Vη=∑iw(p̂_i)2r_i2∑iw(p̂_i)2p̂_i(1−p̂_i),Enull[Vη]=1,Vη=1+Op(n−1/2)。 (2)另外,将预测值降序排列,累积*纯度*ρ(k)=k−1∑i≤ky(i)(前k个事件率)总结了风险分布的头部。我们区分其*广度*(最大顶部比例使得ρ−ρref>ε)和*尖峰*(最大顶部比例使得绝对ρ≥1−δ),如第3节和第4节所示,两者衡量的东西不同。 ## 3 不可能性结果 泄露由*合法性*定义:若某个特征携带了预测时不可用的关于y的信息,则为不合法\[12 (https://arxiv.org/html/2606.11267#bib.bib1)\]。合法性是数据生成过程时间/因果结构的性质——它外生于(p̂,y)的律P。这是限制的根源。我们通过两个简短引理使限制可见;不可能性命题随之直接得出。 ###### 引理1(确定)。 [0,1]×{0,1}上的校准律P由其得分边际F=Law(p̂)确定: P(dp,y=1)=pF(dp),P(dp,y=0)=(1−p)F(dp),因此NB(τ),ENBη和C∗都是F的泛函。 ###### 引理2(诚实世界可实现性)。 对于[0,1]上的每个分布F,存在一个*诚实*预测器,其诱导律等于引理1的校准律P(F)。具体地,令X∼F是合法观测到的预测时协变量,抽取y|X=p∼Bernoulli(p),并取p̂_h=X。 引理2不应被理解为每个校准预测律在同一科学问题中均可由无泄露模型实现。它展示了更尖锐的东西:(p̂,y)的联合律不包含p̂生成时所依据信息集的记录。因此,无需关于可容许预测时σ-代数的外部知识,同一输出律既兼容合法也兼容非法的生成机制。 ###### 命题1(校准匹配泄露的不可见性)。 令诚实过程和泄露过程在[0,1]×{0,1}上诱导律P_h和P_l。每个输出级别的诊断是泛函T(P),因此若P_h=P_l,则基于(p̂,y)的任何检验都无法区分它们。由引理1,两个具有相同得分边际的校准预测器共享P,因此在输出上不可区分。由引理2,每个校准的泄露律是某个诚实预测器的律;因此校准、边际匹配的泄露对任何预测函数不可见。 引理1、2和命题的证明见附录A (https://arxiv.org/html/2606.11267#A1)。 ###### 推论1(广泛类型需要先验)。 一个仅通过提高C∗的校准泄露无法从输出单独标记出来,因为其律与同一C∗下真正更优的诚实模型的律重合。检测它需要一个外生上界C_max∗,即无泄露下可实现的区分度——一个特定于结果的先验。 命题1是所有输出级别检测的下限。它同时也是解放性的:它精确告诉我们哪种泄露*无法*隐藏,即那种将P推出合法可实现律类,而无需精确知道该类即可验证的泄露。仅输出机制与成员推断攻击\[18 (https://arxiv.org/html/2606.11267#bib.bib21)\]所处的机制相同:一个密切相关的访问机制,但目标相反——我们审计的是过程而非训练集。 ## 4 泄露无法隐藏什么 ###### 引理3(纯度上限)。 假设结果在预测时不是确定性的:不存在可容许事件S使得在非零集上P(y=1|S)=1。那么对于每个合法预测器,前k个纯度满足ρ(k)<1对于每个跨越非零比例的分组k,并且持续的非零宽度纯净头部是不可能的。因此,观察到非零顶部比例上的持续纯净高原证实使用了使结果(近乎)确定性的信息——这些信息在预测时无法合法获取——仅需结果非确定性的单一定性先验。 ###### 证明概要。 一个合法校准预测器的前k个纯度收敛于所选集上真实风险的平均值,该平均值由上确界可容许条件风险界定;非确定性使得该上确界在任何非零集上<1。近乎标签泄露将非零子集置于条件风险→1,打破了界限。附录A (https://arxiv.org/html/2606.11267#A1)。∎ 引理3是无先验的积极结果:第2节的*尖峰*统计量,与广度不同,逃脱了命题1,因为纯净头部律位于任何非确定性结果的诚实类之外。另外,引起未校准的泄露留下Vη≠1,可通过(2)无先验检测;但进行重新校准的泄露返回Vη→1,因此这一信号虽然免费但可规避。 ## 5 三分法 P
相似文章
Leak It:黑盒语言模型训练数据提取的概率方法
本文提出了一种从黑盒语言模型中提取训练数据的概率方法,表明聚合的成员推断指标掩盖了逐文档泄露,并介绍了“leakit”审计工具。
语言模型中的无意上下文泄露
本研究探讨了语言模型上下文窗口中的敏感信息如何意外泄露至输出,使得通过新攻击方法重建秘密成为可能,实验结果表明在多款专有模型中泄露问题显著。
提示不足:在儿科就诊中测量与LLMs共享决策的监督基线与泄漏控制
本研究将LLMs的零样本提示与监督基线进行比较,用于检测儿科临床就诊中的共享决策,发现监督模型优于零样本方法,并突出了评估管道中的关键数据泄漏问题。
NumLeak: 公开数值基准作为基础模型中的潜在标签
本文介绍了NumLeak框架,用于检测基础模型在预训练中记忆公开数值基准而非展示样本外技能的情况,并表明顶级LLM能高保真地回忆起如Fama-French回报率等值,提出了一种简单的系统提示防御方法。
区块链分析中的建模决策:基于树模型与序列模型的泄漏感知评估
本文介绍了一个用于以太坊参与者分类的泄漏感知评估框架,将XGBoost等基于树的模型与序列深度学习模型(Transformer、BiLSTM)进行比较。作者发现,在减少泄漏的条件下,XGBoost优于序列模型,同时具有更低的延迟和能耗。