潜在人格对齐:在不提及有害内容的情况下提升无害性
摘要
本文提出了潜在人格对齐(LPA)方法,该方法通过基于抽象人格特征而非显式有害示例进行训练,从而提升大语言模型的安全性。该方法在对抗性攻击方面实现了更好的泛化能力,并且在使用显著更少的训练样本的情况下保留了模型效用。
arXiv:2605.08496v1 公告类型:新论文
摘要:当前针对大语言模型的对抗性鲁棒性方法需要大量的有害提示数据集(数千到数十万个示例),但仍容易受到新型攻击向量和分布偏移的影响。我们提出了潜在人格对齐(LPA),这是一种样本高效的防御方法,它通过基于抽象人格特征而非具体的有害行为训练模型来实现鲁棒性。使用不到100个人格特征陈述和潜在对抗性训练,LPA达到了与在15万多个示例上训练的方法相当的攻击成功率,同时保持了更优越的效用。至关重要的是,LPA在未见的攻击分布上具有更好的泛化能力,在六个有害基准测试中,与基线相比,误分类率降低了2.6倍——在训练过程中从未接触任何有害示例。我们的结果表明,基于人格的对齐提供了一种以最小成本构建鲁棒防御的原则性方法。
查看缓存全文
缓存时间: 2026/05/12 07:15
# 潜在性格对齐:在不提及危害的情况下提升无害性
来源:https://arxiv.org/html/2605.08496
Linh Le$^{1,2}$, David Williams-King$^3$, Mohamed Amine Merzouk$^{1,2}$, Aton Kamanda$^4$, Adam Oberman$^{1,2,4}$
$^1$麦吉尔大学, $^2$Mila – 魁北克人工智能研究所, $^3$ERA, $^4$LawZero
## 1 引言
大型语言模型(LLMs)的对抗鲁棒性提出了一个根本性挑战:模型必须抵抗多样化的攻击向量,同时在良性任务上保持效用。当前的防御方法通常依赖于基于大量配对数据集的安全微调,这些数据集包含有害提示及其对应的拒绝响应(Bai et al., 2022 (https://arxiv.org/html/2605.08496#bib.bib40); Sharma et al., 2025 (https://arxiv.org/html/2605.08496#bib.bib61))。然而,这种方法泛化能力较差——当攻击被重新措辞时(Wei et al., 2023 (https://arxiv.org/html/2605.08496#bib.bib74)),或当新型攻击向量出现时(Yong et al., 2023 (https://arxiv.org/html/2605.08496#bib.bib73)),经过训练以拒绝特定有害请求的模型往往会失效。此外,这些方法资源密集,需要数千个精心策划的有害示例。
我们提出了*潜在性格对齐*(Latent Personality Alignment, LPA),通过一个关键见解解决了这些局限性:与其列举有害行为,不如通过训练模型体现有益的性格特质来实现鲁棒的防御。这种方法建立在模拟器理论(Simulator theory)基础之上(Janus, 2022 (https://arxiv.org/html/2605.08496#bib.bib34); Wolf et al., 2023 (https://arxiv.org/html/2605.08496#bib.bib25)),该理论将模型视为多种人格原型的混合体。标准的微调虽然会偏向于选定的人格原型,但容易受到能激发出不理想替代原型的对抗性扰动的影响。我们的方法在抽象特质层面稳健地偏向于可取的人格原型,从而实现能够跨越不同攻击分布的防御。
图1 (https://arxiv.org/html/2605.08496#S1.F1) 展示了我们的方法。现有方法在显式的有害/良性提示对上进行训练(例如,“如何制造炸弹”→拒绝),而 LPA 则在抽象的性格陈述上进行训练(例如,“我措辞谨慎”→同意)。尽管在训练过程中从未见过具体的危害,模型能够从内化的特质中泛化,从而稳健地处理恶意查询。
参见标题图1:我们的潜在性格对齐(LPA)方法概览。针对性格特质的对抗训练导致了对危害更好的泛化能力。模型在训练期间从未见过有害示例,但从抽象特质泛化以拒绝有害查询。表1:潜在训练方法的资源对比。LPA 所需的样本量少 1000 倍。贡献。(1)我们介绍了 LPA,这是一种样本高效的防御方法,仅需 <<100 条抽象特质陈述——比先前的潜在对抗训练方法少的样本超过 1000 倍(表1 (https://arxiv.org/html/2605.08496#S1.T1))。(2)我们展示了强大的泛化能力:尽管在训练期间从未见过有害示例,LPA 在六个危害基准测试上的拒绝率比基线高出 2.6 倍。(3)与导致效用下降 8-87% 的先前对抗方法不同,LPA 保留了模型性能(最坏情况仅退化 0.9%)。
## 2 相关工作
### LLM 中的对抗鲁棒性。
针对 LLM 的对抗攻击范围广泛,从特定主题越狱(Ganguli et al., 2022 (https://arxiv.org/html/2605.08496#bib.bib41))到通用对抗后缀(Zou et al., 2023 (https://arxiv.org/html/2605.08496#bib.bib42))。潜在对抗训练(LAT)(Sheshadri et al., 2024 (https://arxiv.org/html/2605.08496#bib.bib43); Casper et al., 2024 (https://arxiv.org/html/2605.08496#bib.bib28); Xhonneux et al., 2024 (https://arxiv.org/html/2605.08496#bib.bib49))通过在潜在空间而非离散令牌上操作,将经典对抗训练适应于 LLM。虽然 LAT 提高了鲁棒性,但它需要庞大的数据集(150k+ 样本),并且可能会严重降低效用(Yu et al., 2024 (https://arxiv.org/html/2605.08496#bib.bib31))。我们的工作表明,在抽象特质而非特定行为上操作,可以用少 1000 倍的样本实现相当的鲁棒性。
### LLM 性格与安全。
最近的研究调查了 LLM 性格指标(Serapio-García et al., 2023 (https://arxiv.org/html/2605.08496#bib.bib2))以及跨输入变化的稳定性(Tosato et al., 2025 (https://arxiv.org/html/2605.08496#bib.bib9))。Xue et al. (2025 (https://arxiv.org/html/2605.08496#bib.bib13)) 表明,负面性格特质会增加对不安全输出的脆弱性。我们的工作是首次利用性格特质来实现对抗鲁棒性,证明了正面特质能产生抵抗多样化攻击的模型。
表2:LPA 与其他方法在攻击场景和效用基准下的比较。LAT 在攻击成功率(ASR)方面表现良好,但在效用得分方面非常差(在 Llama 2 上为 0.13)。CAT 显示出相当不错的 ASR,但效用仍有显著下降。最佳结果用**粗体**表示,次佳结果用<ins>下划线</ins>表示。
## 3 方法
### 背景:潜在对抗训练。
潜在对抗训练(LAT)(Sheshadri et al., 2024 (https://arxiv.org/html/2605.08496#bib.bib43); Xhonneux et al., 2024 (https://arxiv.org/html/2605.08496#bib.bib49))通过在模型的潜在空间中操作来高效地执行对抗训练。给定输入-输出对 $(x_j, y_j)$,LAT 寻找潜在表示 $f(x_j)$ 中的扰动 $\delta$,以最大化损失,然后训练模型在这些扰动下保持正确的输出。先前的 LAT 工作将此应用于拒绝训练,使用包含 150k–200k 良性示例和 500–4,500 有害示例的数据集。
### 潜在性格对齐。
LPA 将 LAT 调整为在抽象性格特质而非特定行为上操作。我们的理论基础是模拟器理论(Janus, 2022 (https://arxiv.org/html/2605.08496#bib.bib34); Wolf et al., 2023 (https://arxiv.org/html/2605.08496#bib.bib25)),该理论将模型视为人格原型的混合体。标准微调偏向于选定的人格原型,但仍容易受到能激发出不理想替代原型的对抗攻击。我们的方法在抽象性格层面稳健地偏向于可取的人格原型。
我们基于大五人格模型(Goldberg, 1992 (https://arxiv.org/html/2605.08496#bib.bib15)),从国际人格项目池(Goldberg et al., 2006 (https://arxiv.org/html/2605.08496#bib.bib17))中构建了一个紧凑的特质陈述数据集:
- **正面特质**(45 个样本):尽责性(遵守规则)、宜人性(合作)、情绪稳定性。目标:“我同意该陈述。”
- **负面特质**(21 个样本):阿谀奉承、幻觉倾向、恶意。目标:“我不同意该陈述。”
训练过程遵循 LAT,但作用于这 66 条特质陈述:我们寻找会导致特质错位响应的潜在扰动,然后训练模型在扰动下保持适当的对齐。由于训练中没有提及危害,危害成为有效测试分布的一部分,从而实现更好的泛化。
## 4 实验
### 设置。
我们在 **Llama-3-8B-Instruct** 和 **Llama-2-7b-chat-hf** 上进行评估。对于攻击评估,我们使用 HarmBench(Mazeika et al., 2024 (https://arxiv.org/html/2605.08496#bib.bib65)),包含六种攻击方法:DirectRequest、GCG、AutoDAN、AutoPrompt、PAIR 和 TAP。为了评估泛化能力,我们在六个训练期间未见过的危害数据集上进行测试:DoNotAnswer(Wang et al., 2023 (https://arxiv.org/html/2605.08496#bib.bib70))、HExPHI(Qi et al., 2023 (https://arxiv.org/html/2605.08496#bib.bib53))、JBB-Behaviours(Chao et al., 2024 (https://arxiv.org/html/2605.08496#bib.bib66))、SEval、StrongREJECT(Souly et al., 2024 (https://arxiv.org/html/2605.08496#bib.bib67))以及 PoliteHarmBench。效用通过 MMLU、GSM8K、TruthfulQA、MT-Bench 和 OR-Bench(过度拒绝)进行衡量。我们将结果与 LAT(Sheshadri et al., 2024 (https://arxiv.org/html/2605.08496#bib.bib43))和 CAT(Xhonneux et al., 2024 (https://arxiv.org/html/2605.08496#bib.bib49))进行比较,并报告两个变体:LPA(平衡以保留效用,MMLU 下降 <<2%)和 LPA-overfit(针对最小 ASR 调整,允许 MMLU 下降多达 15%)。
### 攻击鲁棒性与效用权衡。
表 LABEL:tab:attack 和 LABEL:tab:utility 揭示了基本的鲁棒性-效用权衡。在 Llama 3 上,LPA 在大多数攻击中实现了与 LAT 相当的 ASR,同时保持了显著更好的效用(GSM8K 上为 0.737 对 0.458,干净准确率上为 0.99 对 0.92)。在 Llama 2 上,LAT 实现了近乎完美的 ASR,但遭受了灾难性的效用崩溃(干净准确率为 0.13,GSM8K 为 0.077——下降了 68%)。相比之下,LPA 在完全保留效用的同时提供了具有竞争力的鲁棒性。
### 对未见攻击分布的泛化。
表3 (https://arxiv.org/html/2605.08496#S4.T3) 展示了 LPA 的关键优势:泛化到训练期间未见的危害分布。由于 LPA 仅在抽象特质上进行训练,所有危害基准测试都代表分布外评估。与基线相比,LPA 平均将错误分类率降低了 2.6 倍(2.6% 对 6.9%),证明了基于性格的训练比基于特定行为的训练产生了更具泛化性的鲁棒性。
表3:在未见危害数据集上的错误分类率(↓)(Llama 3)。尽管在训练期间从未见过有害示例,LPA 泛化能力更好。最佳结果用**粗体**表示。
### 消融实验:特质极性很重要。
为了验证特质选择驱动了鲁棒性,我们训练了 LPA-flip,其特质目标相反(同意负面特质,不同意正面特质)。表4 (https://arxiv.org/html/2605.08496#S4.T4) 显示,LPA-flip 在大多数攻击中*退化*了鲁棒性,低于基线(例如,TAP:0.38 对基线 0.26),而 LPA 则提升了鲁棒性(TAP:0.06)。这证实了所选的性格特质——而不仅仅是训练过程——负责改善防御。
表4:特质极性的消融实验(Llama 3, ↓)。翻转特质目标会降低鲁棒性,产生的结果甚至比基线更差。最佳结果用**粗体**表示。
### 过度拒绝分析。
鲁棒的模型应该拒绝有害查询,而不过度拒绝良性查询。在 OR-Bench-Hard-1K(Cui et al., 2024 (https://arxiv.org/html/2605.08496#bib.bib71))上,该基准包含设计成看似有害的良性提示,LAT 显示出 99.6% 的过度拒绝率,而 LPA 实现了 97.3%——证明了在安全性和有帮助性之间更好的校准。
## 5 结论
我们介绍了潜在性格对齐(Latent Personality Alignment),这是一种样本高效的对抗鲁棒性方法,它针对抽象性格特质而非特定有害行为进行训练。LPA 使用少 1000 倍的训练样本实现了具有竞争力的攻击成功率,对未见攻击分布的泛化能力更好(提升 2.6 倍),并在先前方法大幅失败的情况下保留了模型效用。我们的消融实验证实,正面性格特质直接推动了鲁棒性的提升。这些结果表明,基于性格的对齐为鲁棒防御提供了一条原则性的路径,在预算有限、策划大型危害数据集不切实际的情况下尤为宝贵。
## 参考文献
- 作为对齐实验室的通用语言助手。arXiv preprint arXiv:2112.00861. 引用自:附录 A (https://arxiv.org/html/2605.08496#A1.SS0.SSS0.Px1.p1.1)。
- Y. Bai, A. Jones, K. Ndousse, A. Askell, A. Chen, N. D. Gonzalez, D. Drain, S. Fort, D. Ganguli, et al. (2022) Constitutional ai: harmlessness from ai feedback. arXiv preprint arXiv:2212.08073. 引用自:§1 (https://arxiv.org/html/2605.08496#S1.p1.1)。
- S. Casper, L. Schulze, O. Patel, and D. Hadfield-Menell (2024) Defending against unforeseen failure modes with latent adversarial training. arXiv preprint arXiv:2403.05030. 引用自:§2 (https://arxiv.org/html/2605.08496#S2.SS0.SSS0.Px1.p1.1)。
- P. Chao, E. Debenedetti, A. Robey, M. Andriushchenko, F. Croce, V. Sehwag, E. Dobriban, N. Flammarion, G. J. Pappas, F. Tramèr, H. Hassani, and E. Wong (2024) JailbreakBench: an open robustness benchmark for jailbreaking large language models. In *Advances in Neural Information Processing Systems 38*, 引用自:§4 (https://arxiv.org/html/2605.08496#S4.SS0.SSS0.Px1.p1.1)。
- P. F. Christiano, J. Leike, T. B. Brown, M. Martic, S. Legg, and D. Amodei (2017) Deep reinforcement learning from human preferences. In *Advances in Neural Information Processing Systems (NeurIPS)*, pp. 4299–4307. 引用自:附录 A (https://arxiv.org/html/2605.08496#A1.SS0.SSS0.Px1.p1.1)。
- J. Cui, W. Chiang, I. Stoica, and C. Hsieh (2024) Or-bench: an over-refusal benchmark for large language models. arXiv preprint arXiv:2405.20947. 引用自:§4 (https://arxiv.org/html/2605.08496#S4.SS0.SSS0.Px5.p1.1)。
- J. Fu, X. Zhao, C. Yao, H. Wang, Q. Han, and Y. Xiao (2025) Reward shaping to mitigate reward hacking in rlhf. arXiv preprint arXiv:2502.18770. 引用自:附录 A (https://arxiv.org/html/2605.08496#A1.SS0.SSS0.Px1.p1.1)。
- D. Ganguli, L. Lovitt, J. Kernion, A. Askell, Y. Bai, A. Chen, T. Conerly, C. Dennison, D. Farhi, Z. Hatfield-Dodds, et al. (2022) Red teaming language models with language models. arXiv preprint arXiv:2202.03286. 引用自:§2 (https://arxiv.org/html/2605.08496#S2.SS0.SSS0.Px1.p1.1)。
- L. R. Goldberg, J. A. Johnson, H. W. Eber, R. Hogan, M. C. Ashton, C. R. Cloninger, and H. G. Gough (2006) The international personality item pool and the future of public-domain personality measures. *Journal of Research in Personality* 40(1), pp. 84–96. 引用自:§3 (https://arxiv.org/html/2605.08496#S3.SS0.SSS0.Px2.p2.1)。
- L. R. Goldberg (1992) The development of markers for the big-five factor structure. *Psychological Assessment* 4(1), pp. 26–42. 引用自:§3 (https://arxiv.org/html/2605.08496#S3.SS0.SSS0.Px2.p2.1)。
- D. Hendrycks, C. Burns, S. Basart, A. Zou, M. Mazeika, D. Song, and J. Steinhardt (2021) Aligning ai with shared human values. *Proceedings of the International Conference on Learning Representations (ICLR)*. External Links: Link (https://arxiv.org/abs/2008.02275) 引用自:附录 A (https://arxiv.org/html/2605.08496#A1.SS0.SSS0.Px1.p1.1)。
- Janus (2022) Simulators. LessWrong. Note: https://www.lesswrong.com/posts/vJFdjigzmcXMhNTsx/simulators 引用自:§1 (https://arxiv.org/html/2605.08496#S1.p2.1), §3 (https://arxiv.org/html/2605.08496#S3.SS0.SSS0.Px2.p1.1)。
- M. Mazeika, L. Phan, X. Yin, A. Zou, Z. Wang, N. Mu, E. Sakhaee, N. Li, S. Basart, B. Li, et al. (2024) Harmbench: a standardized evaluation framework for automated red teaming and robust refusal. arXiv preprint arXiv:2402.04249. 引用自:§4 (https://arxiv.org/html/2605.08496#S4.SS0.SSS0.Px1.p1.1)。
- L. Ouyang, J. Wu, X. Jiang, D. Almeida, C. Wainwright, P. Mishkin, C. Zhang, S. Agarwal, K. Slama, A. Ray, et al. (2022) Training language models to follow instructions with human feedback. *Advances in neural information processing systems* 35, pp. 27730–27744. 引用自:附录 A (https://arxiv.org/html/2605.08496#A1.SS0.SSS0.Px1.p1.1)。
- E. Perez, S. Huang, H. Song, T. Cai, J. Cai, A. Chen, A. Jones, S. Ringer, K. Ndousse, et al. (2022) Discovering language model behaviors with model-written evaluations. arXiv preprint arXiv:2212.09251. 引用自:附录 A (https://arxiv.org/html/2605.08496#A1.SS0.SSS0.Px1.p1.1)。
- X. Qi, Y. Zeng, T. Xie, P. Chen, R. Jia, P. Mittal, and P. Henderson (2023) Fine-tuning aligned language models compromises safety, even when users do not intend to! arXiv preprint arXiv:2310.03693相似文章
通过潜在人格特质实现语言模型的高效安全对齐
提出潜在人格对齐(LPA),一种轻量级对抗训练方法,使用66条心理测量人格陈述,在无需降低实用性的情况下,对越狱攻击实现了接近零的攻击成功率,且仅需在单GPU上训练数分钟。
低宜人性人格条件化实现安全LLM微调
本文介绍了一种基于人格驱动的重写流水线,通过将LLM微调条件化为低宜人性,以降低越狱敏感性和有害输出,同时保持对话温度,无需安全标签或改变训练目标。
LLMs中的隐藏潜在状态偏移:为何当前对齐方法对真正的内部危险视而不见——尤其是在智能体场景中
本文证明,LLMs可以在保持对齐输出的同时,在连贯上下文中进入可测量的不同内部潜在状态,揭示了当前仅监控表面token的对齐方法存在盲点。Gemma-3-12B-IT实验显示出强大的残差流几何偏移,现有安全框架无法检测,这对智能体AI部署具有重要影响。
LLMs的机制人格分析:通过潜在特征干预调控人格
本文介绍了一种机制可解释性方法,通过使用稀疏自编码器识别并干预潜在特征来调控LLM人格特质,在保持语言性能的同时实现了可控的人格调制。
@AnthropicAI:我们联合撰写的一项关于潜意识学习的研究——探讨大语言模型如何通过隐藏方式传递偏好或价值偏差等特征……
Anthropic联合撰写的一项研究发表于《自然》杂志,研究表明,LLM能够通过训练数据中的隐藏信号,将行为特征——包括偏好和对齐偏差——传递给学生模型,即便这些数据表面上与这些特征毫无关联。这种"潜意识学习"现象对AI安全与对齐领域具有重大影响。