CheckMIABench:语言模型成员推断攻击的坚实基础
摘要
本文介绍了CheckMIABench,这是一个用于评估语言模型成员推断攻击的基准,利用中间检查点避免分布偏移。该基准评估了对Pythia和OLMo模型的攻击,并发布了一个开源库。
arXiv:2606.17464v1 Announce Type: new
摘要:成员推断攻击(MIA)是评估机器学习模型隐私属性的标准方法。尽管已有多次尝试评估语言模型上的MIA,但现有文献在构建清晰评估以测试新技术方面遇到了诸多困难。特别是,成员与非成员集合之间的微妙分布偏移可能破坏MIA的统计有效性;近期工作通过表明“盲目”方法(无模型访问)在相同基准上的表现远优于已发表方法,进一步强调了这一点。本文利用训练数据在训练过程中固定点前后的数据来自同一分布这一洞察,构建了一个用于对LLM进行原则性MIA评估的基准。因此,所有具有中间检查点和公开训练数据的开源模型都可以转换为MIA测试平台。我们将该框架应用于Pythia和OLMo系列模型(参数从70M到7B)上的六种已发表攻击。为促进进一步的隐私研究,我们开源了一个模块化库,用于在此设置中设计和实施攻击:https://github.com/safr-ai-lab/pandora_llm。
查看缓存全文
缓存时间: 2026/06/17 05:38
# CheckMIABench: 语言模型成员推理攻击的坚实基础 来源:https://arxiv.org/abs/2606.17464 查看PDF (https://arxiv.org/pdf/2606.17464) > 摘要:成员推理攻击(MIAs)是评估机器学习模型隐私属性的标准方法。尽管已有多次尝试在语言模型上评估MIAs,但现有文献在构建干净评估以测试新技术方面遇到了诸多困难。特别是,成员集与非成员集之间的微妙分布偏移可能破坏MIAs的统计有效性;近期工作通过展示无法访问底层模型的"盲"方法在同一基准上的表现远优于已发表方法,进一步强调了这一点。本文通过利用训练过程中固定点前后的训练数据来自同一分布的见解,构建了一个用于对LLMs进行原则性MIAs评估的基准。因此,所有具有中间检查点和公开训练数据的开源模型都可以转化为MIA测试平台。我们将我们的框架应用于对Pythia和OLMo系列模型(参数规模从70M到7B)的六种已发表攻击。为促进进一步的隐私研究,我们开源了一个用于在此场景下设计和实现攻击的模块化库:this https URL (https://github.com/safr-ai-lab/pandora_llm)。 ## 提交历史 来自:Jason Wang [查看邮件 (https://arxiv.org/show-email/07100efe/2606.17464)] **[v1]**2026年6月16日星期二 03:26:15 UTC (100 KB)
相似文章
离散扩散语言模型上的成员推断攻击
本文研究了针对微调掩码扩散语言模型(MDLMs)的成员推断攻击(MIA)。提出了一种白盒攻击,利用模型在不同掩码比率下的重构损失构建46维特征向量,取得了较高的AUC分数,表明MDLMs的脆弱性超出先前预期。
EvalDetectBench:用于测量前沿语言模型评估意识的基准
本文介绍了EvalDetectBench,这是一个用于测量前沿语言模型评估意识的开放基准和流水线,旨在解决现有方法中的偏差,以提升AI安全评估。
MCBench: 面向全模态大语言模型的多语境安全评估基准
MCBench是一个新基准,用于评估全模态大语言模型在视觉、音频和文本模态下的安全性。它包含1196个场景,并发现当前模型难以进行跨模态安全推理。
Inspect India Evals:面向印度语言文化语境的大语言模型开放评估框架
介绍Inspect India Evals,一个用于在印度语言文化语境中评估大语言模型的开源框架,包含六项基准测试,涵盖多语言能力、偏见、安全性和文化知识。对五个模型的测试显示,Sarvam-M 24B和Gemma 2 27B表现领先。
JUMP:微调扩散语言模型上的单次成员推理
本文提出JUMP,一种针对微调离散扩散语言模型的单次成员推理攻击,利用其任意顺序和并行解码特性,以更少的查询次数提高检测准确率。