人格制图:在权重空间中绘制语言模型人格特征

arXiv cs.AI 论文

摘要

本文提出了一种使用OCEAN框架分析和控制语言模型人格的方法,训练低秩适配器来操控特质,并展示了加性组合及安全性影响。

arXiv:2607.07916v1 公告类型:新 大型语言模型表现出重复的行为模式——人格——这些模式塑造了泛化能力和安全性,但我们缺乏可靠的工具来分解、测量和控制它们。我们的核心见解是将人格视为行为特质空间中的位置,使用OCEAN框架(开放性、尽责性、外倾性、宜人性和神经质)来描述模型人格。我们训练低秩适配器来放大或抑制单个特质,并使用经过人类验证面板校准的LLM裁判、特质特定多选题基准以及标准能力评估来评估其效果。在来自三个系列(4B-32B)的六个模型上,我们发现每个适配器在很大程度上随规模单调地移动目标特质,与其他适配器近似加性组合以构建混合人格,并在中等规模下保持能力基准的性能。我们进一步表明,诱导的特质轴影响下游评估中与安全相关的行为:例如,沿神经质和宜人性轴移动分别影响挫折感和谄媚。我们还引入了一个无监督的心理测量流程,从模型输出中恢复出四个可解释的行为因素(语调、主动性、说教性、认知谨慎)。然后,人格控制可以在权重空间中学习、缩放和组合特质,从而在人格测量、模型编辑和安全性之间架起桥梁。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:06

# 人格地图:在权重空间中绘制语言模型的人格特征 来源:https://arxiv.org/html/2607.07916 Luke Baines¹luke\.sid\.baines@gmail\.comAnton Gonzalvez Hawthorne¹antonhawthorne2@gmail\.com Mariia Koroliuk¹maria\.koroliuk@gmail\.comIrakli Shalibashvili¹iraklishali@gmail\.com Clément Dumas²dumasclement2002@gmail\.com Konstantinos Voudouris³konstantinos\.voudouris@dsit\.gov\.ukDavid Demitri Africa³david\.demitri\.africa@gmail\.com ###### 摘要 大型语言模型会表现出反复出现的行为模式——即人格——这些模式塑造了泛化能力和安全性,但我们缺乏可靠的工具来分解、测量和控制它们。我们的核心见解是将人格视为行为特征空间中的位置,利用OCEAN框架以**开放性、尽责性、外向性、宜人性**和**神经质**来描述模型人格。我们训练低秩适配器来增强或抑制单个特征,并使用针对人类验证面板校准的LLM裁判、针对特征的多选题基准以及标准能力评估来衡量其效果。在来自三个系列(4B-32B)的六个模型上,我们发现每个适配器大致单调地随规模移动其目标特征,与其他适配器近似相加地组合以构建混合人格,并且在适度规模下保持了能力基准的性能。我们进一步表明,诱导的特征轴会影响下游评估中与安全相关的行为:例如,沿着神经质和宜人性轴移动会分别影响挫败感和谄媚。我们还引入了一种无监督的心理测量流程,从模型输出中恢复了四个可解释的行为因素(语气、主动性、说教性、认知谨慎)。然后,人格控制可以被视为在权重空间中学习、缩放和组合特征的问题,在人格测量、模型编辑和安全性之间架起桥梁。††脚注文本:¹LASR Labs;贡献均等。²巴黎萨克雷高等师范学院和MATS³英国AI安全研究院

## 1引言

大型语言模型(LLM)不仅在所知道的内容或回答是否正确上有所不同。它们的行为方式也不同,例如在多大程度上顺从、对开放问题持何种立场等(Huang et al.,2025 (https://arxiv.org/html/2607.07916#bib.bib30);Zhang et al.,2025 (https://arxiv.org/html/2607.07916#bib.bib75);Slama et al.,2026 (https://arxiv.org/html/2607.07916#bib.bib62))。模型行为的这些反复出现的模式可以用模型在训练过程中学习到的人格来解释,这些人格是解释模型如何以及为何以特定方式泛化的关键(Marks et al.,2026 (https://arxiv.org/html/2607.07916#bib.bib43))。

参见标题说明
图1:实验设置和方法概述。(a) 给定一组特征,我们训练各种低秩适配器,这些适配器 (b) 根据提示改变原始模型的人格,并且 (c) 可以以可预测的方式缩放和组合。(d) 此流程可以扩展到在模型中无监督发现潜在行为特征。

现有的人格控制方法处于两个不完美的极端之间。一方面,提示和激活空间干预(Sun et al.,2024 (https://arxiv.org/html/2607.07916#bib.bib65);Cao et al.,2024 (https://arxiv.org/html/2607.07916#bib.bib11);Chen et al.,2025 (https://arxiv.org/html/2607.07916#bib.bib12);Feng et al.,2026 (https://arxiv.org/html/2607.07916#bib.bib21))可以在推理时以高灵活性改变行为,但可能对上下文脆弱,并且需要持续干预。另一方面,完整的预训练和后训练可以灌输广泛的行为默认值(Li et al.,2026 (https://arxiv.org/html/2607.07916#bib.bib37);Christiano et al.,2017 (https://arxiv.org/html/2607.07916#bib.bib14);Ouyang et al.,2022 (https://arxiv.org/html/2607.07916#bib.bib52);Tice et al.,2026 (https://arxiv.org/html/2607.07916#bib.bib68);Maiya et al.,2025 (https://arxiv.org/html/2607.07916#bib.bib42)),但这成本高昂且不灵活:模型在不同的部署环境中可能需要不同的行为模式。目前缺少一种方法,能够学习高效的基于权重的干预措施,这些干预措施可以被控制和组合,以灵活地定义模型人格,并且具有泛化能力。

我们提出一种关于LLM人格的特征空间视角:与其说是固定身份,不如说人格是由模型权重和对话上下文共同决定的行为空间中的一个区域。这个空间中的某些轴可以使用人类可解释的特征来指定;其他轴可能需要从模型行为中发现。如果这些轴可以表示为权重空间干预,那么人格控制就变成了一个简单得多的问题:学习、缩放和组合所需的行为特征。我们使用OCEAN框架(McCrae and John,1992 (https://arxiv.org/html/2607.07916#bib.bib45))作为心理测量学上扎实的起点来实例化这一观点。这是一个成熟的理论,声称人类人格通常可以用五个特征来描述:开放性、尽责性、外向性、宜人性和神经质。我们训练低秩适配器(LoRA)(Hu et al.,2021 (https://arxiv.org/html/2607.07916#bib.bib29))来增强和抑制每个OCEAN特征,使用源自Open Character Training框架(Maiya et al.,2025 (https://arxiv.org/html/2607.07916#bib.bib42))的宪法引导蒸馏,并利用校准过的LLM裁判、针对特征的多选题(Lee et al.,2025 (https://arxiv.org/html/2607.07916#bib.bib36))以及标准能力基准来评估生成的模型。我们的贡献如下(见图1 (https://arxiv.org/html/2607.07916#S1.F1)):

- **可组合的OCEAN特征适配器**:我们训练能够增强和抑制OCEAN特征的LoRA适配器,表明它们可以缩放和组合以构建特定的人格配置文件。我们在多种模型规模和系列中展示了这一点,并表明它对蒸馏教师的选择具有鲁棒性。我们的基于权重的方法与推理时方法(如激活封顶)相比具有竞争力,同时在适度的LoRA缩放因子下基本保持了通用能力(第2节 (https://arxiv.org/html/2607.07916#S2))。
- **人格控制的后续效用**:我们还表明,沿着学习到的特征轴移动会影响未在训练中涉及的安全相关行为,包括挫败感、谄媚和拒绝(第3节 (https://arxiv.org/html/2607.07916#S3))。
- **模型原生人格因素的无监督发现**:我们引入了一种心理测量流程,用于从模型输出中提取潜在的行为维度,恢复了超越原始OCEAN基础的可解释且稳定的因素(第4节 (https://arxiv.org/html/2607.07916#S4))。

参见标题说明
图2:通过LoRA缩放和组合进行特征调制。LLM裁判得分在240个提示上取平均。左侧和中间(框内):增强器 (↑) 和抑制器 (↓) LoRA,以带有符号的净空绘制(每个轴按从“无LoRA”基线到移动方向上裁判极限的距离归一化;0%=基线,±100%=最大值/最小值)。每个适配器主要移动自身的目标特征。右侧:相对于基线Llama-3.1-8B-Instruct模型的得分,分别显示外向性增强、尽责性抑制,以及两者的线性组合(记为⊕)。误差条为95%配对bootstrap置信区间。

## 2人格的监督训练与控制

我们首先测试人类指定的人格特征是否可以实现为可控的权重空间干预。我们使用OCEAN特征(McCrae and John,1992 (https://arxiv.org/html/2607.07916#bib.bib45))——开放性、尽责性、外向性、宜人性和神经质——作为起点,因为它扎实地基于人类人格研究(Marsh et al.,2010 (https://arxiv.org/html/2607.07916#bib.bib44); Saucier and Ostendorf,1999 (https://arxiv.org/html/2607.07916#bib.bib58)),其因素在不同人群中得到复制(Rolland,2002 (https://arxiv.org/html/2607.07916#bib.bib57)),并且附带有经过验证的评估工具(此处适配为MCQ基准)用于测量参与者在特征空间中的位置。这让我们能够提出一个具体问题:我们能否训练出能够沿命名特征轴移动模型,同时保留能力并与其他适配器组合的适配器?

### 2.1方法

**训练。** 我们使用源自Open Character Training(Maiya et al.,2025 (https://arxiv.org/html/2607.07916#bib.bib42))的宪法引导蒸馏流程,训练针对特征的低秩适配器(LoRA)(Hu et al.,2021 (https://arxiv.org/html/2607.07916#bib.bib29))(秩为64,应用于所有注意力层和MLP矩阵)。我们将此流程应用于一系列模型规模和系列(Llama-3.1-8B-Instruct(Grattafiori et al.,2024 (https://arxiv.org/html/2607.07916#bib.bib27))、Qwen3-8B/Qwen3-32B(Yang et al.,2025 (https://arxiv.org/html/2607.07916#bib.bib74))以及Gemma-3-4B-IT/Gemma-3-12B-IT/Gemma-3-27B-IT(Gemma Team et al.,2025 (https://arxiv.org/html/2607.07916#bib.bib23)));除非特别说明,结果在Llama-3.1-8B-Instruct上报告。对于每个特征和极性(抑制或增强),一个强大的教师模型根据增强器和抑制器宪法生成配对响应,这些配对作为(选择,拒绝)对用于学生的直接偏好优化(DPO)训练(Rafailov et al.,2023 (https://arxiv.org/html/2607.07916#bib.bib55))。除非特别说明,我们使用GLM-4.5-Air(GLM-4.5 Team et al.,2025 (https://arxiv.org/html/2607.07916#bib.bib24))作为教师模型(我们也在DeepSeek-V3.2(DeepSeek-AI,2025 (https://arxiv.org/html/2607.07916#bib.bib16))作为教师时验证了我们的流程)。然后在DPO LoRA之上(保持其不变)通过监督微调(SFT)训练第二个适配器,训练数据是由DPO调优模型产生的自我交互和自我反思记录,鼓励特征在自然上下文中出现,而无需显式的宪法提示。¹¹ⁱ多种替代训练方法被研究,详见附录A.2 (https://arxiv.org/html/2607.07916#A1.SS2)。按照Maiya等人(2025 (https://arxiv.org/html/2607.07916#bib.bib42))的方法,SFT LoRA通过将所有权重乘以0.25进行缩小,然后与DPO LoRA(Wortsman et al.,2022 (https://arxiv.org/html/2607.07916#bib.bib73))合并,形成最终的OCEAN特征LoRA,如附录A.1.3 (https://arxiv.org/html/2607.07916#A1.SS1.SSS3)所述。为了将特征特定效应与流程的人工产物(教师风格、冗长程度、偏好优化引起的分布偏移)隔离开来,我们训练了中性控制适配器,其(选择,拒绝)对是仅通过种子区分的两个中性宪法生成(种子1选择,种子2拒绝)。更多细节在附录A (https://arxiv.org/html/2607.07916#A1)和B (https://arxiv.org/html/2607.07916#A2)中给出。我们在所有六个基线模型上训练了所有10个OCEAN增强器和抑制器以及控制LoRA,并在更换教师模型时也进行了训练。

**测量特征表达。** 我们使用校准过的LLM裁判(除非特别说明,使用Qwen3-235B-A22B;附录C.2 (https://arxiv.org/html/2607.07916#A3.SS2))和TRAIT基准(Lee et al.,2025 (https://arxiv.org/html/2607.07916#bib.bib36))来测量直接的特征表达。TRAIT以多项选择自我评估问题的形式为每个OCEAN特征提供标准化的心理测量,而裁判则允许我们通过自由形式的回应和多轮轨迹,使用针对特征的评价标准对行为进行评分。我们在附录C.2.3 (https://arxiv.org/html/2607.07916#A3.SS2.SSS3)中对裁判进行了针对人类评分者的校准。

**测量能力退化。** 我们通过MMLU(Hendrycks et al.,2021 (https://arxiv.org/html/2607.07916#bib.bib28))、GSM8K(Cobbe et al.,2021 (https://arxiv.org/html/2607.07916#bib.bib15))和TruthfulQA(Lin et al.,2022 (https://arxiv.org/html/2607.07916#bib.bib39))检查每个特征适配器是否降低了模型的通用能力,这些基准测试了各种常识和推理技能。

**特征泛化。** 最后,我们测试操纵人格特征是否会影响下游与安全相关的行为,例如挫败感、谄媚和拒绝(第3节 (https://arxiv.org/html/2607.07916#S3))。然后,我们通过测试四个特性来评估特征LoRA是否像有用的人格控制方向:它们是否**针对**预期特征,其效应是否**连续缩放**,**负向缩放**是否近似于相反的特征方向,以及多个适配器是否**可预测地组合**。

### 2.2 单个LoRA的结果

参见标题说明
(a) 对于神经质增强 (N↑) 和尽责性抑制 (C↓) 适配器,TRAIT-对数概率分数随LoRA规模的变化,涵盖五个OCEAN特征。
参见标题说明
(b) 对于C↓适配器,MMLU性能随LoRA规模的变化。误差条为95% Wilson置信区间。

图3:单个LoRA的缩放行为表明,适配器规模提供了对目标OCEAN特征的连续、单调控制,而不会破坏能力。目标特征随c单调变化,而非目标特征基本保持稳定。规模c=0标记了基线Llama-3.1-8B-Instruct模型。

**人格适配器针对其预期特征。** 对于增强器和抑制器适配器,我们发现最大的变化发生在目标特征上,非目标特征的变化较小(见图2 (https://arxiv.org/html/2607.07916#S1.F2))。我们在TRAIT MCQ评估和LLM裁判对模型输出的评估中都观察到了这一点。这支持了这些LoRA灌输可泛化人格特征的观点。

**学习到的方向并非完全正交。** 某些适配器,例如尽责性和神经质,似乎是部分相关的(图3 (https://arxiv.org/html/2607.07916#S2.F3))。这揭示了我们的方法的一个局限性:虽然特征训练中使用的宪法明确旨在训练沿独立轴隔离移动,但我们不能保证这总是会发生。然而,这也证明了特征空间中存在更深层次的结构:有证据表明OCEAN特征在人类中是相关的(Digman,1990 (https://arxiv.org/html/2607.07916#bib.bib19),1997 (https://arxiv.org/html/2607.07916#bib.bib20)),并且这些特征可能对应于模型行为中部分依赖的方向,而不是独立的基向量。适配器展平的权重向量本身是非正交的,有关这方面的研究见附录D (https://arxiv.org/html/2607.07916#A4)。我们进一步使用相同的蒸馏流程训练了控制适配器,但没有使用针对特征的宪法,发现特征的变化明显较弱(在图39 (https://arxiv.org/html/2607.07916#A5.F39)和图40 (https://arxiv.org/html/2607.07916#A5.F40)中有进一步讨论)。单个适配器的结果支持了人格控制的第一个要求:单个LoRA可以诱导目标行为变化。接下来,我们询问是否能够缩放和组合这些LoRA以设计细粒度的人格配置文件。

### 2.3 缩放和组合LoRA以构建自定义人格

如果LoRA适配器对应于有用的人格控制方向,它们应该不仅仅以单一固定强度移动一个特征。它们应该提供对特征强度的连续控制,在负

相似文章

PTEI:整合人格特质以增强大型语言模型的情商

arXiv cs.CL

本文提出PTEI框架,通过整合人格特质(MBTI和OCEAN)来增强大语言模型的情商,使用对比学习和人格感知提示。实验表明,该方法在情感理解方面有显著提升,尤其是与思维链推理结合时,准确率额外提高4%。

基于微调的多智能体框架在生活叙事中检测OCEAN人格特质

arXiv cs.CL

本文提出了一种基于微调的多智能体框架,用于从生活叙事中检测OCEAN人格特质。该框架使用经过条件化的大语言模型子智能体,分别采用高、低或中立视角,并通过一个法官大语言模型汇总输出,以减轻偏见并提高可解释性。

通过潜在人格特质实现语言模型的高效安全对齐

arXiv cs.LG

提出潜在人格对齐(LPA),一种轻量级对抗训练方法,使用66条心理测量人格陈述,在无需降低实用性的情况下,对越狱攻击实现了接近零的攻击成功率,且仅需在单GPU上训练数分钟。

大型语言模型捕捉人类性格的效果如何?

arXiv cs.AI

本文系统评估了关于LLM角色提示的假设,并识别出'角色流形坍缩'现象,即更丰富的角色描述会降低行为多样性和模拟逼真度。研究结果发现,简单的年龄-性别角色通常比更详细的档案表现更好。