membership-inference

标签

Cards List
#membership-inference

基于参考的LLM蒸馏检测

arXiv cs.LG · 6天前 缓存

本文介绍了一种基于参考的方法,通过成员推断来检测LLM是否是从特定教师模型蒸馏而来。该方法在受控设置下实现了近乎完美的准确性,并提供了关于QwQ、DeepSeek-R1和GPT-OSS之间潜在蒸馏关系的新证据。

0 人收藏 0 人点赞
#membership-inference

遗忘算法审计

arXiv cs.LG · 2026-07-08 缓存

提出一种实用的审计器,利用成员推理攻击来计算遗忘参数ε的数据依赖下界,发现经过认证的算法(如模型裁剪、回退删除)与经验方法(如基于Hessian的遗忘、梯度上升)之间有明显差异:前者达到严密的下界,后者表现出较大的下界,表明遗忘效果不佳。

0 人收藏 0 人点赞
#membership-inference

专有数据集保护的水印技术

arXiv cs.LG · 2026-07-02 缓存

本文提出利用水印技术保护专有数据集,防止其被未经授权用于训练生成模型,并证明在特定条件下,基于水印的数据集推理可以达到与传统基于损失的方法相当的成员检测性能。

0 人收藏 0 人点赞
#membership-inference

探析表格上下文学习的记忆机制

arXiv cs.LG · 2026-07-01 缓存

本文研究了使用上下文学习的表格基础模型中的参数化记忆现象,提出了一种探测框架(IclMem)来分离基于上下文的预测与记忆。发现在特定条件下存在适度的记忆信号,但在现实训练场景下基本消失。

0 人收藏 0 人点赞
#membership-inference

无影子模型或保留数据的数据集使用推断

arXiv cs.LG · 2026-06-26 缓存

介绍了一种实用的数据集使用推断(DUI)框架,该框架通过合成非成员和混合比例估计,在无需影子模型或保留数据的情况下,估计用于训练生成模型的数据集比例。

0 人收藏 0 人点赞
#membership-inference

MGI: Member vs Generated Inference

arXiv cs.LG · 2026-06-24 缓存

介绍了 Member vs Generated Inference (MGI) 任务,用于区分生成模型中的训练成员与生成输出,并提出了 Data Circuit Breaker (DCB),一种结合自编码器和潜在生成器信号的三阶段方法,在自回归和扩散模型中均优于现有方法。

0 人收藏 0 人点赞
#membership-inference

CheckMIABench:语言模型成员推断攻击的坚实基础

arXiv cs.LG · 2026-06-17 缓存

本文介绍了CheckMIABench,这是一个用于评估语言模型成员推断攻击的基准,利用中间检查点避免分布偏移。该基准评估了对Pythia和OLMo模型的攻击,并发布了一个开源库。

0 人收藏 0 人点赞
#membership-inference

LLM-as-a-Discriminator:当合成表格看起来仍然真实

arXiv cs.LG · 2026-06-10 缓存

本文提出了一种基于LLM鉴别的方法,用于审计合成表格数据的隐私,通过让LLM将样本分类为真实或合成,表明LLM鉴别可以作为一种实用的隐私审计信号。

0 人收藏 0 人点赞
#membership-inference

领域自适应大语言模型中的训练数据审计:LoRA-MINT

arXiv cs.CL · 2026-06-08 缓存

LoRA-MINT 是一种用于对经 LoRA 微调的大语言模型进行成员推理测试的方法,在判断数据是否用于训练方面实现了高精度,并超越了基线方法。

0 人收藏 0 人点赞
#membership-inference

Rectified Flows 泄露之处:沿插值路径表征成员信号

Hugging Face Daily Papers · 2026-06-05 缓存

本文通过分析插值路径,研究了对 Rectified Flows 的成员推断攻击,揭示了训练数据与测试数据重构之间的钟形差距,该差距在训练过程中累积。

0 人收藏 0 人点赞
#membership-inference

大语言模型中的预训练数据暴露:成员推理、数据污染及安全影响综述

arXiv cs.CL · 2026-05-27 缓存

统一综述大语言模型中的预训练数据暴露(PDE),涵盖成员推理、数据污染和安全影响,并回顾了攻击与防御方法。

0 人收藏 0 人点赞
#membership-inference

离散扩散语言模型上的成员推断攻击

arXiv cs.LG · 2026-05-19 缓存

本文研究了针对微调掩码扩散语言模型(MDLMs)的成员推断攻击(MIA)。提出了一种白盒攻击,利用模型在不同掩码比率下的重构损失构建46维特征向量,取得了较高的AUC分数,表明MDLMs的脆弱性超出先前预期。

0 人收藏 0 人点赞
#membership-inference

生成模型在轨迹生成中的隐私评估

arXiv cs.LG · 2026-05-18 缓存

本文系统性地研究了轨迹数据生成模型中的隐私风险,发现了经验隐私评估中的空白,并对代表性模型展示了成员推理攻击。

0 人收藏 0 人点赞
#membership-inference

表格扩散模型中的隐私泄露:影响因素、攻击者知识与评估指标

arXiv cs.LG · 2026-05-11 缓存

本研究论文探讨了表格扩散模型中的隐私泄露问题,量化了训练设置、合成选择以及攻击者知识对隐私风险的影响。研究发现,即使在没有完美知识或庞大资源的情况下,攻击者仍能成功实施攻击,并揭示了启发式隐私评估指标的潜在缺陷。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈