探析表格上下文学习的记忆机制

arXiv cs.LG 论文

摘要

本文研究了使用上下文学习的表格基础模型中的参数化记忆现象,提出了一种探测框架(IclMem)来分离基于上下文的预测与记忆。发现在特定条件下存在适度的记忆信号,但在现实训练场景下基本消失。

arXiv:2606.31208v1 公告类型:新 摘要:大型表格模型(LTMs),即利用上下文学习(ICL)的表格基础模型,在表格任务上取得了最先进的性能。虽然大型语言模型已知会无意中记忆训练数据,但LTMs的记忆动态仍很大程度上未被探索。我们研究了表格ICL中参数化记忆的可能性。我们引入了ICLMEM,一种探测框架,旨在将基于上下文的预测与参数化记忆分离开来。我们的零信息多项选择上下文剥离了有效的上下文模式,迫使模型依赖其参数记忆。我们受控的微调设置建立了成员身份的真实基础,并考虑了常见的陷阱,如分布偏移、特征污染、基率谬误,并且预训练的基础模型作为参考来校准样本难度。我们对一个领先的真实世界训练的LTM进行的受控评估在10个任务中的8个检测到了适度的记忆信号(AUC高达0.67,1%假阳性率下的真阳性率>0.1)。值得注意的是,记忆信号在低基数任务和二值任务中最强。然而,在现实训练条件下它们基本消失。我们的发现显示了LTM在特定情况下的记忆信号(单任务微调,固定样本跨多个epoch,小查询规模)。为保护敏感数据,必须采取适当措施,我们对此进行了讨论。
查看原文
查看缓存全文

缓存时间: 2026/07/01 05:34

# 探测表格上下文学习中的记忆效应
来源:https://arxiv.org/html/2606.31208
###### 摘要

大型表格模型(LTMs),即利用上下文学习(ICL)的表格基础模型,在表格任务上达到了最先进的性能。虽然大型语言模型(LLMs)已知会无意中记忆训练数据,但LTMs的记忆动态在很大程度上尚未被探索。我们研究了表格ICL中参数化记忆的潜力。我们提出了IclMem,一个旨在将基于上下文的预测与参数化记忆分离的探测框架。我们的零信息多项选择上下文去除了有效的上下文模式,迫使模型依赖于其参数化记忆。我们的可控微调设置建立了成员身份的真实情况,并考虑了常见陷阱,例如分布偏移、特征污染、基率谬误,以及将预训练基础模型作为参考来校准样本难度。我们在一个领先的真实世界训练的LTM上进行的受控评估,在10个任务中的8个检测到中等记忆信号(AUC高达0.670.67,1%1%误报率下的TPR >0.1 >0.1)。值得注意的是,低基数任务和二分类任务的记忆信号最强。然而,在现实的训练条件下,这些信号在很大程度上消失。我们的发现表明LTM在特定情况下(使用固定样本进行单任务微调,历经许多epoch且查询量较小)存在记忆信号。必须采取适当措施来保护敏感数据,我们将对此进行讨论。

表格基础模型,上下文学习,隐私,成员推断

## 1 引言

表格数据在医疗和金融等企业应用及领域占据主导地位(Chui等人,2018 (https://arxiv.org/html/2606.31208#bib.bib168))。大型表格模型(LTMs)(Van Breugel and Van Der Schaar, 2024 (https://arxiv.org/html/2606.31208#bib.bib186); Hollmann 等人,(https://arxiv.org/html/2606.31208#bib.bib143); Spinaci 等人,(https://arxiv.org/html/2606.31208#bib.bib145)),即表格基础模型,通过利用上下文学习(ICL)对未见任务进行零样本预测,在表格预测方面达到了最先进的性能(Brown等人,2020 (https://arxiv.org/html/2606.31208#bib.bib167))。在推理时,模型接收一个上下文(例如历史示例行)以及一个缺失目标字段需要预测的查询行。虽然LTMs通常在合成数据上进行预训练(Hollmann 等人,(https://arxiv.org/html/2606.31208#bib.bib143); Qu等人,2025 (https://arxiv.org/html/2606.31208#bib.bib144)),但最近的模型整合了真实世界的表格语料库(Spinaci 等人,(https://arxiv.org/html/2606.31208#bib.bib145); Garg等人,2025 (https://arxiv.org/html/2606.31208#bib.bib169); Ma等人,2024 (https://arxiv.org/html/2606.31208#bib.bib170)),例如,通过对多样化的真实世界任务组合进行微调以提高性能(Grinsztajn等人,2025 (https://arxiv.org/html/2606.31208#bib.bib189))。虽然LLMs已知会无意中记忆训练数据(Chen等人,2026 (https://arxiv.org/html/2606.31208#bib.bib179); Hayes等人,2025 (https://arxiv.org/html/2606.31208#bib.bib153); Szep等人,2026 (https://arxiv.org/html/2606.31208#bib.bib177)),但LTMs的记忆动态在很大程度上尚未被探索。严格的记忆探测对于为敏感微调数据制定潜在的缓解措施至关重要,例如差分隐私以及调整数据预处理和训练机制。

问题设定。

传统 LLM ICLx1x_{1}y1y_{1}⋯\cdotsxnx_{n}yny_{n}上下文CC模型提供者查询qq用户目标:推断 q∈Cq\in CLLM预测y^\hat{y}LTM ICLx1x_{1}y1y_{1}⋯\cdotsxnx_{n}yny_{n}上下文CC查询qq用户目标:推断 q∈Dq\in DLTMMθM_{\theta}在DD上微调预测y^\hat{y}

图1:LLM与LTM的记忆探测比较。左:在具有ICL的LLMs中,模型提供者提供一个敏感上下文CC,用户试图通过用户控制的查询来提取它。右:在LTMs中,用户同时控制上下文CC和查询qq。在IclMem中,上下文用于探测qq是否从敏感的微调数据DD中被记忆。在ICL范式中,给定查询的输入特征xqx_{q}和上下文 C={ (x1,y1), ..., (xn,yn) }C=\{ (x_{1},y_{1}), \dots, (x_{n},y_{n}) \} 示例,模型预测缺失的目标值 yqy_{q}。对于LTMs,用户同时提供上下文CC和查询qq,如图1 (https://arxiv.org/html/2606.31208#S1.F1)所示。我们假设一个LTMMΘM_{\Theta}由数据所有者在敏感数据DD上进行微调,该所有者向用户提供对微调后LTM的访问权限。这种设置为任意操纵CC以探测模型在来自DD包含或排除的数据的上下文-查询对上的行为差异打开了可能性。相比之下,现有关于ICL隐私的工作主要假设模型提供者定义了一个敏感的CC,攻击者试图通过操纵查询qq(Wen等人,2024 (https://arxiv.org/html/2606.31208#bib.bib149); Duan等人,2024 (https://arxiv.org/html/2606.31208#bib.bib173))通过成员推断攻击(MIA)来提取。MIA(Shokri等人,2017 (https://arxiv.org/html/2606.31208#bib.bib40))旨在推断特定记录是否为训练数据的一部分,将MIA迁移到LTMs提出了独特的挑战。与能够生成任意文本以在巨大输出空间上提取记忆化令牌的LLMs不同(Carlini等人,2021 (https://arxiv.org/html/2606.31208#bib.bib43)),LTMs是仅编码器架构,严格限制预测只能针对CC中提供的预定义候选标签(Spinaci 等人,(https://arxiv.org/html/2606.31208#bib.bib145); Hollmann 等人,(https://arxiv.org/html/2606.31208#bib.bib143))。更重要的是,虽然掩码语言建模可以诱导记忆化(Hartmann等人,2023 (https://arxiv.org/html/2606.31208#bib.bib190)),但LTMs作为先验数据拟合网络(PFNs)运行(Müller等人,2021 (https://arxiv.org/html/2606.31208#bib.bib181))。它们被训练为推断上下文中的结构联系,而不是记忆明确的目标(Müller等人,2021 (https://arxiv.org/html/2606.31208#bib.bib181))。这提出了一个基本且尚未解答的问题:*本质上被训练进行ICL的LTMs具有什么样的记忆档案?*为了研究LTMs的记忆能力,我们提出了IclMem并应用MIA。具体来说,我们通过将CC作为主动探测机制进行操作来测试候选查询行的成员身份(图1 (https://arxiv.org/html/2606.31208#S1.F1))。我们假设,通过仔细修改CC以消除区分性信息,它破坏了模型基于上下文的预测能力。被迫放弃上下文推理,模型转而依赖其记忆的参数化知识。对于DD中的成员行,我们期望预测表现出更高的置信度并对上下文操作保持鲁棒(Choquette-Choo等人,2021 (https://arxiv.org/html/2606.31208#bib.bib172); Yeom等人,2018 (https://arxiv.org/html/2606.31208#bib.bib41))。我们确定了LTMs中记忆化的特定情况(第4.2节 (https://arxiv.org/html/2606.31208#S4.SS2))并讨论了保护措施(第6节 (https://arxiv.org/html/2606.31208#S6))。

## 2 相关工作

虽然LTMs(Hollmann 等人,(https://arxiv.org/html/2606.31208#bib.bib143); Qu等人,2025 (https://arxiv.org/html/2606.31208#bib.bib144); Spinaci 等人,(https://arxiv.org/html/2606.31208#bib.bib145); Garg等人,2025 (https://arxiv.org/html/2606.31208#bib.bib169))迅速发展,但对其隐私属性的研究仍然有限(Nayyeri等人,2026 (https://arxiv.org/html/2606.31208#bib.bib180))。现有LTM隐私文献主要关注测试时规避和对抗鲁棒性,而非记忆化(Simonetto等人,2024 (https://arxiv.org/html/2606.31208#bib.bib146); Djilani等人,2025 (https://arxiv.org/html/2606.31208#bib.bib147); Anwar等人,2024 (https://arxiv.org/html/2606.31208#bib.bib148))。相反,ICL隐私研究主要集中在LLMs上,探测隐藏上下文示例的泄露(Wen等人,2024 (https://arxiv.org/html/2606.31208#bib.bib149); Duan等人,2024 (https://arxiv.org/html/2606.31208#bib.bib173))或文本语料库中的表格记忆化(German等人,2025 (https://arxiv.org/html/2606.31208#bib.bib150); Bordt等人,2024 (https://arxiv.org/html/2606.31208#bib.bib184))。为了评估记忆化,最先进的MIA通常依赖于影子模型(Carlini等人,2022a (https://arxiv.org/html/2606.31208#bib.bib151); Zarifzadeh等人,2024 (https://arxiv.org/html/2606.31208#bib.bib152))。然而,为大型模型训练影子模型在计算上是禁止的(Hayes等人,2025 (https://arxiv.org/html/2606.31208#bib.bib153)),并且在预训练分布未知的情况下会产生不可靠的误报界限(Zhang等人,2025 (https://arxiv.org/html/2606.31208#bib.bib154))。为了对LTMs进行隐私评估,我们采用了来自鲁棒性评估MIA(Choquette-Choo等人,2021 (https://arxiv.org/html/2606.31208#bib.bib172))和属性推断(AIA)(Jayaraman and Evans, 2022 (https://arxiv.org/html/2606.31208#bib.bib183); Annamalai等人,2024 (https://arxiv.org/html/2606.31208#bib.bib156); Salem等人,2023 (https://arxiv.org/html/2606.31208#bib.bib37))的技术。虽然AIA旨在根据部分记录推断未知的敏感值,但我们的目标是推断记录的成员身份。为了评估LTMs的记忆化,我们调整了AIA的多项选择测试和标签随机化,并将零信息上下文操作与通过预训练基础模型的难度校准相结合(Watson等人,2022 (https://arxiv.org/html/2606.31208#bib.bib175))。

## 3 主要贡献

我们提供了对LTMs记忆化的首次系统评估。我们的贡献如下:

- •我们提出了IclMem,一个旨在将基于上下文的预测与参数化记忆分离的探测框架。我们的零信息多项选择上下文去除了上下文模式,迫使模型依赖于参数化记忆。
- •我们通过考虑分布偏移(通过数据预处理)、特征污染(通过数据去重)、基率混淆(通过标签随机化)以及内在低复杂度样本(通过难度校准),避免了常见的MIA误报。
- •我们对LTM ConTextTab进行了广泛评估,涉及来自CARTE的10个多样化的分类和回归任务的1,128种微调配置。
- •在我们的受控设置中(单任务微调和固定上下文-查询对),我们在10个任务中的8个检测到中等记忆化(AUC >0.5\text{AUC} >0.5 且 TPR@r% >0.1\text{TPR}_{@r\%} >0.1,其中 r∈{1,10}r\in\{1,10\})。该信号在具有小训练查询量(Q=50Q=50)的低基数和二分类任务中更高,但在实际设置下(例如,较大的Q=512Q=512、多数据集训练、随机上下文-查询采样)(附录D (https://arxiv.org/html/2606.31208#A4))基本上消失。

总的来说,我们的发现揭示了LTMs中的记忆能力,这有助于制定适当的保护措施。接下来,我们介绍我们的方法和设置(第4节 (https://arxiv.org/html/2606.31208#S4)),详细说明我们的评估(第5节 (https://arxiv.org/html/2606.31208#S5)),并以局限性、缓解措施和未来工作(第6节 (https://arxiv.org/html/2606.31208#S6))作结。

## 4 方法与设置

我们介绍IclMem,一个旨在探测LTMs记忆化并缓解常见MIA评估陷阱的框架(表4 (https://arxiv.org/html/2606.31208#A1.T4),附录A.1 (https://arxiv.org/html/2606.31208#A1.SS1))。首先,我们概述评估LTMs的独特挑战。然后,我们讨论IclMem的两个阶段(图3 (https://arxiv.org/html/2606.31208#A1.F3),附录A (https://arxiv.org/html/2606.31208#A1))。即,通过仔细的数据预处理和跨epoch固定的查询-上下文对进行的受控微调(第4.1节 (https://arxiv.org/html/2606.31208#S4.SS1)),以及通过针对预训练基础模型校准的一套上下文操作进行的记忆化探测(第4.2节 (https://arxiv.org/html/2606.31208#S4.SS2))。

评估LTMs的挑战。LTMs依赖ICL从上下文中推断结构性的特征-目标相关性,这种机制直观上构成了一种障碍,阻碍了对模型参数化记忆的访问。此外,与具有巨大输出词汇量的LLMs不同,LTMs是仅编码器架构,严格约束只能输出针对上下文中存在的特定候选标签的概率。我们的上下文操作通过零信息多项选择协议解决了这些挑战(第4.2节 (https://arxiv.org/html/2606.31208#S4.SS2))。

### 4.1 建立记忆化真实情况

IclMem预处理数据以消除伪影,并执行受控微调以诱导记忆化。

数据预处理。为了避免数据伪影被解释为记忆化信号,IclMem仔细预处理数据。首先,我们对记录进行去重,以防止*特征污染*,即成员集和非成员集中出现相同记录,这会夸大记忆化信号。其次,我们确保不相交的成员和非成员拆分之间的分布接近,以排除*分布偏移*。具体来说,对于分类任务,通过总变差距离 TVD <0.05\text{TVD} <0.05(Gibbs and Su, 2002 (https://arxiv.org/html/2606.31208#bib.bib166))控制目标标签分布;对于回归任务,通过Kolmogorov–Smirnov统计量 KS <0.05\text{KS} <0.05(Massey Jr, 1951 (https://arxiv.org/html/2606.31208#bib.bib165))控制(即经验累积密度函数之间的差异)(表6 (https://arxiv.org/html/2606.31208#A1.T6),附录A.2 (https://arxiv.org/html/2606.31208#A1.SS2))。为了缓解*基率谬误*,即模型利用标签分布预测可能的结果,我们采取了两项措施。首先,我们在训练上下文中强制标签分布均匀,防止模型通过坍塌到多数类预测来最小化损失。其次,遵循(Annamalai等人,2024 (https://arxiv.org/html/2606.31208#bib.bib156)),我们应用标签随机化,即打乱目标标签同时保留边际分布,迫使模型学习统计上不可能的映射。

受控微调。为了诱导记忆化,我们对固定的上下文-查询对进行微调,最多500个epoch。具体来说,每个训练步骤处理一个大小为QQ的查询行批次的静态上下文集C′C^{\prime}。我们针对不同的学习率 η∈{10−1,10−2,10−3,10−4}\eta\in\{10^{-1},10^{-2},10^{-3},10^{-4}\} 和查询量 Q∈{50,512}Q\in\{50,512\} 进行微调。我们在训练中改变QQ以测试其对记忆化的影响。较小的QQ应该会放大单个查询行的贡献,而较大的QQ会稀释它们。我们的评估支持这种动态,表明较大的Q=512Q=512阻碍记忆化(第5节 (https://arxiv.org/html/2606.31208#S5))。

### 4.2 使用IclMem探测记忆化

探测阶段旨在通过将零信息上下文操作与通过基础模型的难度校准相结合来检测记忆化信号。

多项选择协议。为了将预期的基于上下文的模型预测与意外的参数化记忆分开,我们提出了一种模仿多项选择问题的零信息策略。对于每个查询行 q=(xq,yq)q=(x_{q},y_{q}) 和候选标签集YY,我们构建一个探测上下文 CbaseC_{base},其中恰好包含|

相似文章

表格上下文学习器能否泛化到生物分子性质预测?

arXiv cs.LG

本文研究了在合成因果表上预训练的表格上下文学习模型能否从有限的标注数据泛化到生物分子性质的预测。作者发现,这些模型在蛋白质适应性回归任务上具有竞争力,但在小分子分类中,表示选择至关重要。

MemTrain:自监督上下文记忆训练

arXiv cs.CL

MemTrain 提出了一种自监督训练框架,通过在维基百科语料上使用掩码重建和中间记忆召回代理任务,增强 LLM 智能体的上下文记忆能力,在下游记忆密集型 QA 基准上取得了高达 17.67 个百分点的提升。

基础模型代理的部署时记忆化

arXiv cs.AI

本文提出了基础模型代理中“部署时记忆化”的概念,分析了记忆设计选择(摘要激进程度、检索广度、删除模式)如何影响个性化效用、提取风险和删除保真度,并提出了新的指标,如个性化召回率、对抗提取率和遗忘残留分数。

面向高效长上下文生成的Context Memorization

Hugging Face Daily Papers

提出了attention-state memory,一种免训练方法,将预计算的注意力状态存储在轻量级记忆中,以提高长前缀推理的准确率并降低延迟,在基准测试中优于传统方法。