大语言模型能泄露训练数据,但它们愿意吗?对LLM记忆的倾向性感知评估
摘要
PropMe是一个倾向性感知框架,用于评估LLM的记忆,区分强制复现能力和自然倾向,使用SimpleTrace在开放模型和数据集上进行确定性归因。
查看缓存全文
缓存时间: 2026/06/05 10:07
论文页面 - 大型语言模型能泄露训练数据,但它们愿意吗?面向倾向感知的LLM记忆评估
来源:https://huggingface.co/papers/2606.06286
摘要
PropMe框架通过区分强制复现能力与自然倾向,评估语言模型的记忆行为。该框架利用SimpleTrace实现确定性归因,并跨开放模型与数据集使用倾向变换指标。
大型语言模型能够复现训练数据,但现有的记忆评估研究大多衡量模型是否可以被强制复现数据,而非衡量模型在常规使用中是否会自然复现。我们提出PropMe——一种面向倾向感知的记忆评估框架,该框架对比了基于前缀的能力攻击与非对抗性评估。我们提出了一种度量变换方法,将其应用于现有函数后,可创建倾向度量指标。我们进一步介绍了SimpleTrace,这是一个基于infini-gram的轻量级追踪管线,能够确定性将模型生成内容归因至大规模训练语料库,并计算逐字、近逐字及倾向变换后的记忆度量指标。通过对两个全开放模型(Comma和DFM Decoder)在两个数据集(Common Pile和Dynaword)以及两种语言上的评估,我们发现能力与倾向之间存在持续差距:前缀攻击引发的记忆信号明显强于通用提示或数据集特定提示,而倾向分数总体保持较低。因此,模型在直接诱导下能够泄露训练数据,但在更常见的非对抗性设置中很少这样做。我们还发现,从Comma持续预训练的DFM Decoder在Common Pile上表现出更低的记忆能力和记忆倾向,证实当后续训练强调部分不同数据时,记忆能力可能下降。我们的结果表明,并鼓励记忆审计应同时报告最坏情况下的可提取性与常规泄露倾向,以便更全面地理解这一现象。
查看arXiv页面 (https://arxiv.org/abs/2606.06286)
查看PDF (https://arxiv.org/pdf/2606.06286)
GitHub0 (https://github.com/N-essuno/PropMe)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.06286)
在您的智能体中获取此论文:
hf papers read 2606.06286
没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2606.06286以将其链接至此页面。
引用此论文的数据集0
没有数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2606.06286以将其链接至此页面。
引用此论文的 Spaces0
没有 Space 链接此论文
在Space README.md中引用arxiv.org/abs/2606.06286以将其链接至此页面。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection)以将其链接至此页面。
相似文章
大语言模型真的能遗忘吗?通过对抗性评估揭示遗忘差距
该研究揭示了大语言模型在机器遗忘方面的显著差距,表明对抗性评估能够揭示遗忘信息的可恢复性,即使在使用强标准指标的情况下,凸显了对抗性压力测试的必要性。
论大语言模型适应性的局限:模型内化先验对标注任务性能的影响
本文研究了LLM的内化先验如何影响零样本标注性能,发现近三分之二的错误抵抗基于提示的修正,并引入了定义特定熟悉度(DSF)作为比记忆化指标更好的预测因子。
STALE:LLM智能体能否识别记忆何时失效?
本文识别了LLM智能体中的一个关键失效模式:当新证据与先前信念冲突时,它们无法更新个性化记忆。本文引入了STALE基准和一个三维探测框架,揭示了即使最佳模型也仅达到55.2%的准确率,并提出了CUPMem作为鲁棒记忆修正的原型。
LifeMem: 为LLM代理赋能终身经验复用
LifeMem是一个终身学习框架,它通过聚类交互轨迹来提取可复用技能,使LLM代理能够在多个环境中迁移知识,从而减少遗忘并提升跨任务迁移能力。
超越困惑度:面向LLM测试时训练中部署记忆声明的行为评估框架
本文介绍了一种行为评估框架,用于校准关于LLM测试时训练中部署时记忆的声明,提出了证据阶梯和显式基线,以弥合代理指标与行为证据之间的差距。