CheckMIABench:语言模型成员推断攻击的坚实基础
摘要
本文介绍了CheckMIABench,这是一个用于评估语言模型成员推断攻击的基准,利用中间检查点避免分布偏移。该基准评估了对Pythia和OLMo模型的攻击,并发布了一个开源库。
arXiv:2606.17464v1 Announce Type: new
摘要:成员推断攻击(MIA)是评估机器学习模型隐私属性的标准方法。尽管已有多次尝试评估语言模型上的MIA,但现有文献在构建清晰评估以测试新技术方面遇到了诸多困难。特别是,成员与非成员集合之间的微妙分布偏移可能破坏MIA的统计有效性;近期工作通过表明“盲目”方法(无模型访问)在相同基准上的表现远优于已发表方法,进一步强调了这一点。本文利用训练数据在训练过程中固定点前后的数据来自同一分布这一洞察,构建了一个用于对LLM进行原则性MIA评估的基准。因此,所有具有中间检查点和公开训练数据的开源模型都可以转换为MIA测试平台。我们将该框架应用于Pythia和OLMo系列模型(参数从70M到7B)上的六种已发表攻击。为促进进一步的隐私研究,我们开源了一个模块化库,用于在此设置中设计和实施攻击:https://github.com/safr-ai-lab/pandora_llm。
查看缓存全文
缓存时间: 2026/06/17 05:38
# CheckMIABench: 语言模型成员推理攻击的坚实基础 来源:https://arxiv.org/abs/2606.17464 查看PDF (https://arxiv.org/pdf/2606.17464) > 摘要:成员推理攻击(MIAs)是评估机器学习模型隐私属性的标准方法。尽管已有多次尝试在语言模型上评估MIAs,但现有文献在构建干净评估以测试新技术方面遇到了诸多困难。特别是,成员集与非成员集之间的微妙分布偏移可能破坏MIAs的统计有效性;近期工作通过展示无法访问底层模型的"盲"方法在同一基准上的表现远优于已发表方法,进一步强调了这一点。本文通过利用训练过程中固定点前后的训练数据来自同一分布的见解,构建了一个用于对LLMs进行原则性MIAs评估的基准。因此,所有具有中间检查点和公开训练数据的开源模型都可以转化为MIA测试平台。我们将我们的框架应用于对Pythia和OLMo系列模型(参数规模从70M到7B)的六种已发表攻击。为促进进一步的隐私研究,我们开源了一个用于在此场景下设计和实现攻击的模块化库:this https URL (https://github.com/safr-ai-lab/pandora_llm)。 ## 提交历史 来自:Jason Wang [查看邮件 (https://arxiv.org/show-email/07100efe/2606.17464)] **[v1]**2026年6月16日星期二 03:26:15 UTC (100 KB)
相似文章
离散扩散语言模型上的成员推断攻击
本文研究了针对微调掩码扩散语言模型(MDLMs)的成员推断攻击(MIA)。提出了一种白盒攻击,利用模型在不同掩码比率下的重构损失构建46维特征向量,取得了较高的AUC分数,表明MDLMs的脆弱性超出先前预期。
MCBench: 面向全模态大语言模型的多语境安全评估基准
MCBench是一个新基准,用于评估全模态大语言模型在视觉、音频和文本模态下的安全性。它包含1196个场景,并发现当前模型难以进行跨模态安全推理。
MM-JudgeBias:评测 MLLM-as-a-Judge 组合偏差的基准
研究者发布 MM-JudgeBias 基准,揭示多模态大模型在充当自动评判器时的系统性组合偏差,对 26 个 SOTA MLLM 在 1,800 条样本上进行测试。
Artifact-Bench:评估多模态大语言模型在检测与评估AI生成视频伪影方面的能力
Artifact-Bench是一个综合性基准,用于评估多模态大语言模型在检测和分析AI生成视频伪影方面的表现,揭示了它们的显著局限性以及与人类感知的错位。
IMCBench:面向图像基础医疗对话的多模态大语言模型基准
IMCBench是一个新的基准,用于评估多模态大语言模型在图像基础医疗对话中的表现,它将临床图像与合成患者档案配对。在安全性、准确性和不确定性方面的评估表明,即使是像Claude Opus 4.6这样强大的模型也存在安全问题,凸显了多维度评估的必要性。