人格的几何结构:基于荣格认知功能的激活导向
摘要
本文提出了一个利用荣格认知功能进行大语言模型激活导向的框架,展示了对八种功能的有效单调控制,并揭示了激活空间中结构化的几何关系。
arXiv:2607.20803v1 公告类型:新
摘要:激活导向能够控制和解释大语言模型,然而现有工作主要通过静态特质框架(如大五人格)来建模人格。我们研究是否可以将人格表示为并控制为一组认知过程,使用八种荣格认知功能。为此,我们引入了一个框架,包括荣格评估协议和一个包含超过2,100个角色扮演角色叙述的数据集。
在Llama-3.1-8B上进行的激活导向向量提取和评估实验表明,通过激活导向可以对所有八种认知功能进行有效的单调控制。除了可控性之外,我们的分析还揭示:1. 人格信息集中在Transformer层中间层;2. 导向向量呈现出结构化的几何关系,与理性功能和非理性功能之间的区别一致;3. 有效的多维导向方向不能通过单一功能方向的线性组合来恢复。这些发现为LLM激活空间中人格的表示提供了新见解,并建立了一个研究可解释、有效且多维的人格控制的框架。
查看缓存全文
缓存时间: 2026/07/24 05:17
# 人格的几何学:基于荣格认知功能的激活引导
来源:https://arxiv.org/html/2607.20803
###### 摘要
激活引导能够控制和解释大语言模型(LLMs),但现有工作主要通过静态特质框架(如大五人格)来建模人格。我们研究是否可以用八种荣格认知功能将人格表征并控制为一组认知过程。为此,我们引入了一个框架,包括一个荣格评估协议和一个包含超过2100个角色扮演角色叙述的数据集。
在Llama-3.1-8B上进行的激活引导向量提取和评估实验表明,通过激活引导可以对所有八种认知功能实现有效的单调控制。除了可控性,我们的分析还揭示了:1. 人格信息集中在中间变压器层;2. 引导向量展现出与理性与非理性功能区分一致的结构化几何关系;3. 有效的多维度引导方向不能通过单功能方向的线性组合恢复。这些发现为LLM激活空间中人格的表征提供了新见解,并为研究可解释、有效且多维度的人格控制建立了框架。
人格的几何学:基于荣格认知功能的激活引导
刘载1,王玉萌∗2,傅俊辰1,Joemon M. Jose11格拉斯哥大学,2莱顿大学
## 1 引言
激活引导已成为一种无需额外训练即可修改大语言模型(LLM)行为的有效机制。通过将向量注入中间表示,模型可以被引导向某些行为,如诚实、情感、拒绝或推理风格 Frising and Balcells (2026 (https://arxiv.org/html/2607.20803#bib.bib6)); Rimsky et al. (2024 (https://arxiv.org/html/2607.20803#bib.bib10)); Chen et al. (2025 (https://arxiv.org/html/2607.20803#bib.bib5))。除了在不进行后训练的情况下调整模型行为外,将激活向量注入模型的残差流还能提供对LLMs内部运作的有价值见解 Marks and Tegmark (2024 (https://arxiv.org/html/2607.20803#bib.bib7)); Wu et al. (2025 (https://arxiv.org/html/2607.20803#bib.bib14))。针对高度抽象且纠缠的概念(如人格)进行研究,可能揭示重要的方面,包括可解释的多维度控制和机制理解。
最近的研究广泛探索了通过与五大人格框架对齐的激活引导进行人格引导 Frising and Balcells (2026 (https://arxiv.org/html/2607.20803#bib.bib6)); Chen et al. (2025 (https://arxiv.org/html/2607.20803#bib.bib5)); Bhandari et al. (2026 (https://arxiv.org/html/2607.20803#bib.bib4))。尽管五大人格模型在心理学研究中被广泛采用,但它关注的是人格的特质方面。它沿着五个连续的OCEAN维度(开放性、尽责性、外向性、宜人性和神经质)测量相对静态的行为、情绪和思维模式。
虽然OCEAN模型在描述人与人之间的互动时是有效的,但人类与LLMs之间的互动可能更适合用动态过程模型来表征。从信息感知、决策和注意力调节的角度比较LLM的人格,可能为LLM如何管理人格提供额外的观察。荣格认知功能是对卡尔·荣格心理类型理论的现代诠释 Jung (1971 (https://arxiv.org/html/2607.20803#bib.bib11)),基于荣格的认知功能概念:思考、情感、感觉和直觉,每个都以内向或外向态度表达。在这个框架中,控制功能指的是使个体能够有意识地管理注意力、优先级以及对内部和外部需求的响应的认知过程 Jung (1971 (https://arxiv.org/html/2607.20803#bib.bib11))。
通过执行与荣格认知功能模型对齐的激活引导,我们旨在控制和分析LLM如何将人格作为一种认知过程来处理,从而与现有更多关注人格特质的研究提供不同的视角。
我们首先改编了一个为人类设计的开源荣格人格测试问卷 Felmonon (2026 (https://arxiv.org/html/2607.20803#bib.bib2)),以构建LLM的测试框架。然后,我们从SWCPQ数据集 Jorgenson (2020 (https://arxiv.org/html/2607.20803#bib.bib12))中构建了一个高质量、特征丰富的数据集,将2100多个虚拟角色的角色扮演自我叙述与其荣格认知功能测试结果相关联,我们称之为NarrationDB。
我们通过将均值差分法 Marks and Tegmark (2024 (https://arxiv.org/html/2607.20803#bib.bib7))应用于NarrationDB中的特定聚类,分离并提取出类似八种荣格认知功能的激活向量 Dong et al. (2025 (https://arxiv.org/html/2607.20803#bib.bib8)); Allbert et al. (2025 (https://arxiv.org/html/2607.20803#bib.bib9))用于Llama-3.1-8B-Instruct AI@Meta (2024 (https://arxiv.org/html/2607.20803#bib.bib1))。这些向量被评估为总体有效,为激活引导和机制解释提供了实践基础。通过应用各种超参数扫描和可视化方法,获得了关于空间特征、层有效性和多维度引导有效性的见解。
我们的核心发现包括:
- • 在7到12层之间观察到了人格引导的高效区域。这暗示了人格在Transformer激活中的表征位置和方式。
- • 理性与非理性认知功能的激活方向具有可区分的空间特征。理性功能更接近其同一类型的外向和内向对应项,而非理性功能则相距更远。
- • 多维度语义方向激活空间并不构成单维度方向的线性组合。我们使用一种新颖的回溯方法检查了多维度引导向量。我们发现,通过最小二乘法得到的线性组合与实际方向之间存在不可忽略的残差。
## 2 荣格认知功能分数的定量评估
我们从一个开源多维度荣格评估项目 Felmonon (2026 (https://arxiv.org/html/2607.20803#bib.bib2))中提取为人类受试者设计的问卷数据,并将其组装成问卷,以评估LLMs的荣格认知功能。测试包含132个陈述,每个陈述按李克特量表从强烈不同意到强烈同意进行评分。
用户:
你只能对以下陈述回复数字1到5。以下是一些可能适用于你也可能不适用于你的特征。请指出你同意或不同意该陈述的程度。1表示'强烈不同意',2表示'有点不同意',3表示'既不同意也不反对',4表示'有点同意',5表示'强烈同意'。按行回复每个陈述,格式为:'陈述索引:分数'。以下是陈述,请逐个评分:
1.[陈述]
2.[陈述]
3.[陈述]
...
33.[陈述]
助手:
1:[分数]
2:[分数]
3:[分数]
...
33:[分数]
这132个问题被随机打乱并分成四组,每组33个问题。然后每组通过类似于PsychoBench的提示 Huang et al. (2024 (https://arxiv.org/html/2607.20803#bib.bib3))作为前缀传递给LLM,并且每个荣格认知功能SS的分数按照原始项目 Felmonon (2026 (https://arxiv.org/html/2607.20803#bib.bib2))相同的方式计算:
w = 0.7\\overline{P} + 0.3(6 - \\overline{N})
S = 100 * \\frac{w - 1}{4}
其中PP表示对当前功能有正向贡献的问题集,NN表示对当前功能有负向贡献的问题集。\\overline{P}和\\overline{N}分别表示P集和N集中问题的平均分。问题列于附录A (https://arxiv.org/html/2607.20803#A1)中。
我们发现问题打乱方式的种子会影响LLM的回答。我们为一次测试选取30个随机种子,并将结果作为一个组进行分析。
| 功能 | 分数 | 标准差 |
|------|------|--------|
| Ti | 90.77 | 6.84 |
| Ne | 88.38 | 8.97 |
| Ni | 87.77 | 7.93 |
| Fi | 87.20 | 7.69 |
| Fe | 81.60 | 8.96 |相似文章
角度-范数分解下的激活转向几何解释
本文通过将干预分解为角度和径向分量,分析了语言模型中的线性激活转向。研究发现概念主要编码在角度结构中,但范数调整对稳定性至关重要,支持球形转向方法的同时表明加性系数混淆了几何特性。
LLMs的机制人格分析:通过潜在特征干预调控人格
本文介绍了一种机制可解释性方法,通过使用稀疏自编码器识别并干预潜在特征来调控LLM人格特质,在保持语言性能的同时实现了可控的人格调制。
通过潜在激活引导的大语言模型文化价值对齐
一个利用基于场景的行为探测和激活引导来评估和引导大语言模型中文化价值的框架,揭示了价值维度之间的潜在纠缠。
通过标题特定激活引导控制工具使用
本文研究大型语言模型中的工具使用决策是否具有稳定的内部表征,这些表征可以通过激活引导(Activation Steering)提取和操控,并展示了在五个开源模型和三个领域中,标题特定引导向量可以抑制不必要的工具使用。几何分析揭示,工具调用步骤表现出弥散的双峰对齐,而非参数化基础概念所预期的清晰线性结构。
超越静态人格:大型语言模型的情境人格引导
本文介绍了IRiS,一种无需训练的情境人格引导框架,它通过识别和利用情境依赖的人格神经元,超越了静态人格建模。该方法表明,大型语言模型的行为随情境变化,并提出了基于神经元的识别、检索和加权引导方法,在PersonalityBench和新增的SPBench基准上得到验证。