所有大语言模型都知道自己何时有害吗?跨模型家族的潜在空间安全探针可重复性研究
摘要
对Khatri等人提出的潜在空间安全探针进行可重复性研究,检验其跨模型家族的泛化能力以及对非确定性的敏感性。结果表明,这些探针可扩展到其他模型并获得相似的F1分数,且最终token的潜在向量在不同随机种子下保持一致。
arXiv:2608.08029v1 公告类型:新提交
摘要:Khatri等人(2026)[DOI: 10.1109/DSN-W70714.2026.00027]表明,在单个8B模型(LLaMA-3.1-8B)的最后一层激活上训练的轻量级MLP探针,每个基准使用一个探针,即可检测有害提示,其F1分数与比其大1000倍的防护模型相当。我们端到端地复现了这一流程,并沿原始研究未涉及的两个方向进行扩展。首先,我们测试该结果是否可泛化到其他模型架构和规模,方法是在Gemma-4-E4B、Mistral-7B-v0.3和Qwen2-7B等模型的激活上训练相同的探针,使用三个基准(WildJailbreak、BeaverTails、AEGIS 2.0)。其次,我们通过五个随机种子重复提取并测量F1分数的方差,检验推理过程中的非确定性对报告性能的影响程度。我们的结果在原始F1分数的0.37个百分点内(BeaverTails上在0.2个百分点内)复现了原始LLaMA模型基准。我们发现,原始MLP探针架构可扩展到其他模型家族,F1分数与LLaMA-3.1-8B报告值相差在一个百分点以内。我们改变种子值的实验揭示了一个有趣的观察结果:对于所有测试架构,最终token的潜在向量在不同种子值下保持不变。
查看缓存全文
缓存时间: 2026/08/11 08:09
# 所有大语言模型都知道自己何时有害吗?跨模型家族的潜在空间安全探针可复现性研究 来源:https://arxiv.org/html/2608.08029 ###### 摘要 Khatri 等人(2026 (https://arxiv.org/html/2608.08029#bib.bib1))表明,在单个 8B 模型(LLaMA-3.1-8B)的最终层激活上使用轻量级 MLP 探针,即可检测有害提示,其 F1 分数可与比它大约 1000 倍的防护模型(guard model)竞争,而且每个基准测试只需一个探针。我们端到端地复现了这一流程,并沿着原始研究留下的两个轴进行了扩展。首先,我们通过在其他模型*架构和规模*上训练相同的探针,测试这一结果是否能够泛化——具体包括 Gemma-4-E4B、Mistral-7B-v0.3 和 Qwen2-7B,并使用三个基准测试(WildJailbreak、BeaverTails、AEGIS 2.0)。其次,我们通过在五个随机种子下重复提取,并测量 F1 分数的方差,来检验报告性能中有多少受到推理过程中*非确定性*的影响。我们的结果在原始 LLaMA 模型基准测试上复现出的 F1 分数与原始论文报告的数值相差在 0.37 个百分点以内(在 BeaverTails 上相差在 0.2 个百分点以内)。我们发现,原始 MLP 探针架构可以扩展到其他模型家族,F1 分数与 LLaMA-3.1-8B 报告值相差在 1 个百分点以内。我们改变种子值的实验揭示了一个有趣的现象——对于所有测试的架构,无论使用什么种子值,最终 token 的潜在向量都保持不变。 所有大语言模型都知道自己何时有害吗?跨模型家族的潜在空间安全探针可复现性研究 Alizishaan KhatriWrynx [email protected] Li ChanINTI International College Penang ## 1 引言 大型语言模型(LLM)的运行时安全审核目前主要由*外部安全护栏*主导:即单独的分类器模型,用于审查提示和响应(Inan 等人,2023 (https://arxiv.org/html/2608.08029#bib.bib5);Zeng 等人,2024 (https://arxiv.org/html/2608.08029#bib.bib6);Han 等人,2024 (https://arxiv.org/html/2608.08029#bib.bib7))。Khatri 等人(2026 (https://arxiv.org/html/2608.08029#bib.bib1))认为这种架构不必要的昂贵,因为与安全相关的信息已经可以从 LLM 自身的隐藏状态中线性解码出来(Zou 等人,2023 (https://arxiv.org/html/2608.08029#bib.bib3);Saglam 等人,2025 (https://arxiv.org/html/2608.08029#bib.bib2);Chen 等人,2025 (https://arxiv.org/html/2608.08029#bib.bib4))。他们用一个模型家族(LLaMA-3.1-8B)和一种提取配置(最终层、预填充后的最后一个 token)支持了这一论断,并在 WildJailbreak、BeaverTails 和 AEGIS 2.0 上分别报告了 99.1%、82.7% 和 83.5% 的 F1 分数(Jiang 等人,2024 (https://arxiv.org/html/2608.08029#bib.bib9);Ji 等人,2023 (https://arxiv.org/html/2608.08029#bib.bib8);Ghosh 等人,2025 (https://arxiv.org/html/2608.08029#bib.bib10))。 这留下了原始论文未涉及的两个问题,而它们对于潜在空间探针能否成为外部安全护栏的通用替代方案至关重要: 1. 1. **跨架构的泛化性**。“安全存在于线性可分的子空间中”这一发现,是否适用于用不同架构、预训练数据、对齐方法和隐藏维度训练出的模型?还是说这只是 LLaMA-3.1-8B 特定对齐流程的产物? 2. 2. **对非确定性的敏感性**。报告的指标来自每个数据集单次提取加训练的结果。激活提取涉及随机成分(采样顺序、权重初始化、非确定性 GPU 内核等)。在实际应用中,一个探针通常对应一个类别部署在一个模型上。但是,用户必须能够对同一模型使用不同的种子值。Khatri 等人(2026 (https://arxiv.org/html/2608.08029#bib.bib1))表 3 中探针和防护模型基线对推理过程中潜在状态的非确定性有多敏感? 我们直接回答这两个问题。我们重新实现了 Khatri 等人(2026 (https://arxiv.org/html/2608.08029#bib.bib1))的两阶段流程(激活提取,然后 MLP 探针训练),并且(1)将其不作修改地应用于参数规模相当的额外开源权重模型家族;(2)对每个模型/数据集组合在多个种子下重复提取,以报告探针方差以及点估计。这使得我们的贡献完全契合第 9 届 BlackboxNLP 研讨会特别专题:可解释性分析中的可复现性与可靠性:我们将原始方法不加修改地应用于先前未测试的模型,并添加了原始研究遗漏的统计控制(多种子方差)。 #### 贡献。 - • 忠实复现 Khatri 等人(2026 (https://arxiv.org/html/2608.08029#bib.bib1))的探针流程,并对照原始论文在 LLaMA-3.1-8B 上报告的数值进行验证。 - • 对另外三个模型家族进行实证基准测试,检验探针性能以及探针与防护模型的竞争力是否在原始模型家族之外仍然成立。 - • 对每个模型/数据集组合进行五次独立提取运行的方差分析,报告 F1 分数的标准差,并量化原始论文报告的超过基线防护模型的优势在多大程度上能在这种噪声下幸存。 - • 发布代码、激活以及每次运行的结果。 ## 2 相关工作 #### 外部安全护栏。 生产级 LLM 系统通常依赖专用的防护模型,如 Llama Guard(Inan 等人,2023 (https://arxiv.org/html/2608.08029#bib.bib5))、ShieldGemma(Zeng 等人,2024 (https://arxiv.org/html/2608.08029#bib.bib6))、Latent Guard(Zhao 等人,2025 (https://arxiv.org/html/2608.08029#bib.bib26))和 WildGuard(Han 等人,2024 (https://arxiv.org/html/2608.08029#bib.bib7))来审查提示和响应(Dong 等人,2024 (https://arxiv.org/html/2608.08029#bib.bib19))。这些模型会增加推理时延迟,并且仍容易受到利用“防护模型所看到的内容”与“主模型内部实际发生的事情”之间差距的攻击(Hung 等人,2025 (https://arxiv.org/html/2608.08029#bib.bib20))。 #### 潜在安全表示。 越来越多的工作认为,与安全相关的概念在 LLM 隐藏状态中是线性表示的(Zou 等人,2023 (https://arxiv.org/html/2608.08029#bib.bib3);Chen 等人,2025 (https://arxiv.org/html/2608.08029#bib.bib4);Chia 等人,2025 (https://arxiv.org/html/2608.08029#bib.bib21)),并且在这些表示之上使用轻量级探针,能够以极小的参数量匹配或接近外部分类器(Saglam 等人,2025 (https://arxiv.org/html/2608.08029#bib.bib2);Cunningham 等人,2026 (https://arxiv.org/html/2608.08029#bib.bib11);Zhang 等人,2024 (https://arxiv.org/html/2608.08029#bib.bib14))。密切相关的是,Zhao 等人(2025 (https://arxiv.org/html/2608.08029#bib.bib26))表明,有害性和拒绝在潜在空间中占据不同的方向;决定模型对危害判断的是有害性方向,而不是拒绝方向。这一区分在这里直接相关,因为我们研究的探针针对的是有害性而非拒绝。Khatri 等人(2026 (https://arxiv.org/html/2608.08029#bib.bib1))——我们复现并扩展的论文——是最直接的先例:一个 13.9M 参数的 MLP 探针,作用于 LLaMA-3.1-8B 的最终层激活,在 WildJailbreak、BeaverTails 和 AEGIS 2.0 上进行了评估。并发的工作扩展了我们在第 3.2 节 (https://arxiv.org/html/2608.08029#S3.SS2)中提出的跨架构问题:Llorente-Saguer(2026 (https://arxiv.org/html/2608.08029#bib.bib27))表明,有害意图可以从跨 12 个模型、覆盖四个架构家族和三种对齐变体(基础、指令微调、abliterated)的残差流激活中线性分离,包括拒绝机制被手术式移除的情况,这证明危害识别和拒绝生成在表示层面是可分离的机制,与上述 Zhao 等人(2025 (https://arxiv.org/html/2608.08029#bib.bib26))的结论一致。我们的贡献聚焦于跨架构泛化和运行间方差,而不是逐项延迟比较。 #### 可解释性中的可复现性与稳健性。 我们的扩展遵循了最近呼吁精神,即对跨模型的可解释性主张进行压力测试,并与随机/非确定性基线进行比较,而不是在单一模型上报告单次运行的点估计(Albrethsen 等人,2026 (https://arxiv.org/html/2608.08029#bib.bib22))。我们尚未发现有先前工作专门测试潜在安全探针的跨架构泛化性或提取非确定性。 ## 3 方法 我们不加修改地复用 Khatri 等人(2026 (https://arxiv.org/html/2608.08029#bib.bib1))的两阶段流程(图1 (https://arxiv.org/html/2608.08029#S3.F1)),仅变化 (a) 提取激活的骨干 LLM,以及 (b) 控制提取顺序和批次采样的随机种子。 ### 3.1 原始流程(复现) **阶段 1:激活提取。** 每个提示 \(x_i\) 通过一个冻结的骨干 LLM \(\mathcal{M}\),并将提示预填充后最后位置处的最终层隐藏状态存储下来:\(h_i=\mathcal{M}(x_i)[-1]\in\mathbb{R}^d\),其中 \(d\) 是骨干模型的隐藏维度(LLaMA-3.1-8B 为 4096)。提取使用 nnsight(Fiotto-Kaufman 等人,2024 (https://arxiv.org/html/2608.08029#bib.bib29))实现,提取批大小为 5(我们还测试了批大小为 100,得到完全相同的激活),最大序列长度为 512 个 token,基础运行的提取种子为 42。 **阶段 2:探针训练。** 一个 6 层 MLP \(f_\theta:\mathbb{R}^d\rightarrow\{0,1\}\)(表1 (https://arxiv.org/html/2608.08029#S3.T1))使用交叉熵损失,通过 AdamW(Loshchilov and Hutter, 2019 (https://arxiv.org/html/2608.08029#bib.bib13))训练,学习率 \(2.5\times 10^{-4}\),权重衰减 \(1\times 10^{-2}\),dropout 0.1,采用 ReduceLROnPlateau 学习率调度(factor 0.5,patience 2),批大小 1024,训练 50 个 epoch,以精确复现原始超参数。 表 1:MLP 探针架构,复现自 Khatri 等人(2026 (https://arxiv.org/html/2608.08029#bib.bib1))。\(d\) 是骨干模型的隐藏大小,随模型变化(表2 (https://arxiv.org/html/2608.08029#S3.T2))。 图 1:复现的提取加探针流程。整个实验中只有骨干模型 \(\mathcal{M}\) 和随机种子发生变化。 ### 3.2 扩展 1:跨架构泛化 我们将第 3.1 节 (https://arxiv.org/html/2608.08029#S3.SS1)的流程不加修改地应用于一组额外的开源权重骨干 LLM,这些模型涵盖不同的模型家族、预训练语料、对齐流程和参数规模(表2 (https://arxiv.org/html/2608.08029#S3.T2))。对于每个骨干模型,我们在与 Khatri 等人(2026 (https://arxiv.org/html/2608.08029#bib.bib1))相同的三个数据集和划分上提取最终层、最后一个 token 的激活,并使用表1 (https://arxiv.org/html/2608.08029#S3.T1)中的架构训练一个 MLP 探针,仅调整输入维度 \(d\) 以匹配骨干模型的隐藏大小。所有其他超参数(学习率、批大小、 epoch、优化器)保持不变,以隔离骨干模型的影响。 表 2:跨架构扩展中使用的骨干模型。第一行是原始论文的设置,用于校准。 ### 3.3 扩展 2:对非确定性的敏感性 对于选定的(模型,数据集)组合,我们重复提取 \(K=5\) 次(种子 42, 75, 456, 789, 1024),变化: - • 提取过程中提示批次化的顺序(当推理后端使用非确定性批量注意力内核时相关) 数据集划分在不同种子间保持不变,因此方差反映的是提取/训练随机性,而非数据划分差异。探针在种子为 42 提取的训练集上训练,然后在所有 5 个种子值的测试集上评估。我们报告 F1 分数的标准差(通过对 \(K\) 次运行进行非参数自助法计算)。 作为补充诊断,我们还单独将提取出的激活张量本身作为比较单位,而不依赖任何下游指标。对于少数选定的(模型、数据集、种子)三元组,我们对阶段 1 生成的序列化激活张量文件计算 SHA-256 摘要,并在同一(模型、数据集)组合内比较不同种子之间的摘要。这让我们能够区分“无方差”的两种性质不同的来源:(i) 阶段 1 在不同种子下产生不同的激活,但阶段 2 恰好收敛到无法区分的探针;或 (ii) 阶段 1 本身对种子不变,因此阶段 2 从一开始就不会看到不同的输入。第 5.4 节 (https://arxiv.org/html/2608.08029#S5.SS4)报告了这一检查的结果并讨论了其含义。 ## 4 实验设置 #### 数据集。 我们使用三个数据集进行评估:WildJailbreak(vanilla 子集)、BeaverTails(带有二值 `is_safe` 标签的问答对)和 AEGIS 2.0。对于 WildJailbreak 和 AEGIS 2.0,我们使用 80/10/10 的训练/验证/测试划分;对于 BeaverTails,我们采用数据集自带的标准划分。表3 (https://arxiv.org/html/2608.08029#S4.T3)总结了这些数据集。 表 3:我们实验中使用的数据集,包括训练/验证/测试划分、总大小、标签列和标签值。 #### 计算与可复现性工件。 #### 评估。 我们报告每个数据集留出测试集上的 F1 分数,与原始论文的协议一致。 ## 5 结果 ### 5.1 原始结果的复现 表4 (https://arxiv.org/html/2608.08029#S5.T4)将我们复现的 LLaMA-3.1-8B 数值与 Khatri 等人(2026 (https://arxiv.org/html/2608.08029#bib.bib1))报告的数值进行比较。我们发现,我们能够在 F1 分数上与原始工作报告的数值相差不超过 0.37% 的范围内复现结果。 表 4:使用相同超参数和划分对 Khatri 等人(2026 (https://arxiv.org/html/2608.08029#bib.bib1))表 2 的复现。 ### 5.2 跨架构结果 表5 (https://arxiv.org/html/2608.08029#S5.T5)报告了表2 (https://arxiv.org/html/2608.08029#S3.T2)中每个骨干模型在每个数据集上的探针 F1 分数。我们发现,新引入的模型架构上的探针性能与原始工作报告的值相当。我们观察到,在 BeaverTails 数据集上,新模型的 F1 分数比 LLaMA-3.1-8B 的数值提高了约 0.4 个百分点。 表 5:跨骨干模型和数据集的 F1 分数。第一行复现原始论文的设置。 ### 5.3 非确定性的影响 表6 (https://arxiv.org/html/2608.08029#S5.T6)报告了我们在 \(K=5\) 个提取种子下评估的每个(模型、数据集)组合的完整逐种子细分。在每一对组合中,F1 分数在所有五个种子下至少精确到小数点后两位都相同:标准差始终为 0,表6 (https://arxiv.org/html/2608.08029#S5.T6)的每一行在各列之间都保持不变。精确率和召回率(主表中未显示;完整值见附录 B (https://arxiv.org/html/2608.08))也呈现相同的模式。 表 6:我们在 \(K=5\) 个提取种子下评估的每个(模型、数据集)组合的逐种子测试集 F1 分数。S42–S1024 列表示五个种子值。每一行在所显示的精度下各列都相同;见附录 B (https://arxiv.org/html/2608.08)
相似文章
LLM代理的一致性如何?在多步骤工具调用流程中测量行为可重现性
本文系统性地测量了LLM代理在多步骤工具调用流程中的行为可重现性,涉及1140条轨迹,发现了'结构一致性,参数变异性'的模式:代理可靠地按相同顺序选择工具,但参数有所不同,并且结构一致性能够预测任务的成功。
大语言模型能泄露训练数据,但它们愿意吗?对LLM记忆的倾向性感知评估
PropMe是一个倾向性感知框架,用于评估LLM的记忆,区分强制复现能力和自然倾向,使用SimpleTrace在开放模型和数据集上进行确定性归因。
评估 LLM 在受控实验中作为人类代理的可靠性
本论文通过比较 LLM 生成的数据与人类在准确性感知调查中的反应,评估现成 LLM 是否能可靠地模拟受控行为实验中的人类反应。研究发现,虽然 LLM 能捕捉方向性效应和聚合信念更新模式,但它们的效应大小与人类尺度不一致,这有助于澄清合成 LLM 数据何时可以作为行为代理。
LLMs知道自己何时出错。我对Anthropic的新“全局工作空间”论文进行了一项修复 [R]
作者提出了一种方法,通过使用中间层状态的线性探测器和一个小型训练桥接器将置信度对数进行校准,使LLMs能够表达校准后的置信度,仅需200个标注样本,无需修改权重。这与Anthropic的全局工作空间论文相关,该论文解释了“知道-说出”差距。
大型语言模型中的毒性测量与缓解:一项全面的复制研究
这项复制研究评估了DExperts在缓解LLM毒性方面的效果,发现其对显式毒性几乎完美安全,但对隐式仇恨言论效果降低,并且存在显著的延迟权衡。