采样揭示风格:大语言模型激活中无监督、免训练的提示条件风格轴发现
摘要
本文提出一种无监督、免训练的方法,通过采样和PCA(主成分分析)在大语言模型隐藏激活中发现提示条件风格轴,并通过人类研究进行验证。
arXiv:2609.19150v1 公告类型:新
摘要:大语言模型在其隐藏激活中编码了丰富的风格结构,但发现哪些风格维度对给定提示显著通常需要监督对比数据。我们提出一种免训练、提示条件的替代方案:我们反复采样单个提示在较高温度下的补全,对汇总的隐藏激活应用主成分分析(PCA),并从极性生成中自动标记结果轴。我们在两阶段研究中,根据245个人类引发的风格注释验证发现的轴。在我们的最强模型(Qwen-3.5-4B-Instruct)上,前两个轴与自发请求的人类维度匹配,精确度为72.8%,宏观召回率为43.6%,且75.6%的有效性评分判断轴的极性生成与其标签准确匹配,相邻标注者一致性为90.9%。可发现性强烈依赖于模型:Qwen模型和Llama-3.2-3B都暴露了人类显著的轴,而DeepSeek-7B-Chat下降到35.3%的精确度,其主要成分由结构而非风格方差主导。因此,对模型自身解码方差的简单PCA是探测大语言模型表示中风格结构的有效、低成本方法,这也揭示了该结构组织方式的显著跨模型差异。
查看缓存全文
缓存时间: 2026/09/18 08:47
# 采样揭示风格:在大语言模型激活中无监督、免训练地发现提示条件风格轴
来源:https://arxiv.org/html/2609.19150
Ajit Mallavarapu / 康奈尔大学 / 纽约州伊萨卡市 am3574@cornell\.edu & Ziwei Gu / 哈佛大学 / 马萨诸塞州剑桥市 ziweigu@g\.harvard\.edu
###### 摘要
大型语言模型在其隐藏激活中编码了丰富的风格结构,但为给定提示发现哪些风格维度是显著的,通常需要有监督的对比数据。我们提出一种免训练、提示条件的替代方案:我们以较高温度对单个提示进行重复采样生成补全,对聚合的隐藏激活应用主成分分析,并从极值生成中自动标注所得轴。我们在一项两阶段研究中,使用245个人工标注的风格注释对所发现的轴进行验证。在我们最强的模型(Qwen-3.5-4B-Instruct)上,前两个轴与自发请求的人类维度匹配,精确率为72.8%,宏观召回率为43.6%,且75.6%的有效性评级认为轴的极值生成准确反映了其标签,标注者间一致性(相邻)为90.9%。可发现性强烈依赖于模型:Qwen模型和Llama-3.2-3B都暴露了人类显著的轴,而DeepSeek-7B-Chat的精确率降至35.3%,其主导成分由结构性而非风格性方差主导。因此,对模型自身解码方差进行简单的PCA,是探查大语言模型表征中风格结构的一种有效、低成本的方法,同时也揭示了该结构组织方式在不同模型间的显著差异。
## 1 引言
大型语言模型在其内部表征中编码了大量人类知识。随着这些模型规模的扩大,理解它们自然形成的概念结构对于可解释性和安全性(Zou 等,2023)变得至关重要。然而,在不依赖人工标注或预定义分类法的情况下发现这些概念仍然是一个艰巨的挑战。最先进模型的内部状态极其复杂,使得从稠密的高维空间中分离出离散的、人类可解释的概念变得困难(Cunningham 等,2023;Templeton 等,2026)。
在这项工作中,我们探讨是否能够直接从模型的激活中发现对给定提示最显著的风格维度,且在任何阶段都无需监督。我们的流程以较高温度对单个提示进行重复采样生成补全,对聚合的隐藏激活应用主成分分析,并用一个大语言模型评判器对保留的成分进行标注。结果是一种免训练、提示条件的方法,能够揭示出主导该指令下模型自身解码方差的几个风格轴。
为严格评估所发现轴的语义连贯性和可解释性,我们进行了一项两阶段的人工评估。在第一阶段,要求标注者为给定提示自发构想理想的风格控制维度,我们的无监督流程在我们最强的模型上以高度一致性恢复了这些请求的维度。在第二阶段,人工评判者评估了在所发现轴的几何极值处生成的文本,发现极值生成紧密体现了自动生成的标签,75.6%的评级将其标记为准确或高度准确,标注者间一致性(相邻)为90.9%。综合这些结果表明,所发现的轴不仅仅捕捉统计规律,而且对应于对人类标注者具有语义意义且可理解的表征。
关键的是,将我们的框架应用于不同架构揭示了一个令人惊讶的表征现象,我们称之为**结构纠缠**。具体而言,我们在评估的DeepSeek模型中观察到了潜在的严重纠缠。在该模型中,风格方差在表征空间的主导成分中,与结构和句法方差表现出强烈且不可分割的耦合。这种纠缠挑战了风格方差与任务方差线性可分的假设,凸显了不同训练机制或架构组织其内部表征方式的差异。
我们的主要贡献有三点:
1. 一种免训练、提示条件的方法,通过PCA和自动标注从LLM激活中发现风格轴。
2. 一项两阶段的人工评估,表明所发现的轴与人类自发意图一致,并被认为具有语义有效性。
3. 对模型特定敏感性的实证表征,包括DeepSeek-7B-Chat中结构性方差压倒风格性方差的失败案例。
## 2 方法论
本节详细介绍了我们用于发现和验证大型语言模型内潜在风格轴的无监督流程。我们的方法**潜在引擎**(如图1所示),超越了监督对比对(Rimsky 等,2024;Konen 等,2024),通过利用内部模型几何来浮现人类显著的概念。
图1:用于无监督概念发现的**潜在引擎**架构。该流程通过随机流形生成将风格方差隔离到变化云中(N=30),从倒数第二隐藏层提取表征,通过提取前两个主成分(PC1, PC2)进行PCA分解以数学方式隔离主要方差轴,并使用轻量级语言评判器自主标注这些正交成分。
### 2.1 随机流形生成(变化云)
为了在没有监督对比对或显式风格提示的情况下发现潜在维度,我们隔离模型在随机解码过程中激活的自然几何变化。对于给定的基础提示x,系统生成一个“变化云”C={p1, p2, ..., pN},其中N=30。
- **自回归随机性**:与依赖显式风格突变器的方法不同,我们的框架通过对基础模型使用单一静态输入提示采样N个独立轨迹来生成变化。
- **采样参数**:为了在不降低token级连贯性的前提下最大化风格探索,我们采用较高的温度设置(T=0.9, p=0.95)。这确保了潜在轴从模型自身的随机解码分布中自然浮现,捕捉模型针对该特定指令的原生风格流形。
### 2.2 激活收集与PCA引擎
我们提取目标模型处理变化云C时的内部表征。
- **目标层**:从倒数第二隐藏层动态收集激活,以在不同架构之间保持一致的相对表征深度,从而避免早期层中普遍存在的结构噪声和最后一层的最终词汇投影偏差。
- **激活收集窗口**:对于变化云C中的每个变体pi,我们将静态基础提示x与随机生成的响应token拼接。然后我们执行前向传播,专门提取生成序列窗口内的隐藏状态(从第一个生成的响应token到结束序列标识符之前的最后一个token)。这保证了我们的提取框架隔离的是下游token选择和风格方差,而非确定性的提示表征。
- **序列池化**:我们对变体i生成的响应token隐藏状态的长度Li应用序列平均池化。这将动态的token序列矩阵压缩为一个序列平均的激活向量hi∈Rd,其中d是模型的隐藏维度。将这些向量堆叠所有生成后,得到目标变化矩阵A∈RN×d。
- **潜在提取**:我们对目标变化矩阵A进行主成分分析,以识别在风格流形中方差最大的正交轴。
### 2.3 潜在成分隔离
在变化流形进行PCA分解后,流程隔离前两个主成分(PC1, PC2)。根据定义,标准PCA产生严格正交的奇异向量,并按其解释方差排序。通过保留这些主要成分,潜在引擎成功地隔离了在随机解码过程中自然出现的最占主导地位的线性独立方差轴。这些主要向量捕捉了模型原生生成空间的核心几何方向,为后续的语义评估和精细风格操作提供了高度针对性的潜在向量。
### 2.4 自动标注与极性对齐
为使发现的轴可解释,流程通过在新的前向传播中,以固定干预强度(α=±0.6)将提取的主成分应用为激活引导向量,合成“极值生成”。这些合成的极值然后在自主基础步骤中进行评估:
- **语言评判器**:一个量化的Meta-Llama-3-8B-Instruct模型检查每个PCA轴极值处的生成文本,并生成一个简洁的标签(例如,“正式性”、“讽刺”)。关键的是,这个标注过程完全在盲评下进行;评判器只接收原始文本字符串,没有任何能识别目标模型系列或架构的元数据。
- **动态极性对齐**:由于PCA轴具有任意的符号方向,我们利用同一个LLM评判器建立直观的极性。评判器评估极值生成,以判断哪个文本更强烈地体现了新发现的标签。然后,轴被自动定向,使得正方向(+X)始终对应于所标注属性的增加。
### 2.5 目标架构
为评估这种潜在组织的普适性,我们将流程移植到四个不同的模型家族:Qwen-3.5(Hui 等,2024)、Qwen-2.5(Team,2026)、Llama-3.2(Grattafiori 等,2024)和DeepSeek(Liu 等,2024)。这种选择使我们能够衡量**潜在纠缠**——即在不同对齐机制下,风格方差与严格的结构和格式先验原生可分离的程度。
### 2.6 基于基础的几何语义评估
最后,我们通过一项两阶段的人工评估协议验证发现的轴:
1. **第一阶段(自发召回)**:标注者列出他们希望为给定提示拥有的“魔法滑块”,测试系统发现的轴是否与人类自发意图匹配。为计算针对这些无约束自由文本响应的精确率和召回率,我们使用all-mpnet-base-v2(Song 等,2020)嵌入标签,并应用语义匹配阈值τ=0.65,以可靠地捕捉风格同义词而不引入假阳性。为了数学上处理这种语言差异,我们将基线语义对齐阈值锚定在τ=0.65。虽然朴素的评估框架可能要求模型自动生成的标签与人类目标概念之间近乎完美的嵌入相似度(τ≥0.85),但对潜在流形的经验观察揭示了持续存在的**人机词汇鸿沟**。模型经常分离出几何上连贯但与典型人类响应略有词汇漂移的风格控制向量。例如,一个人工标注者分类为“讽刺”的无监督轴,经常被自主流程标注为“挖苦”或“愤世嫉俗”(cos(θ)≈0.68)。类似地,捕捉“实用主义”的向量常以相邻标签“直接性”出现。要求精确的token匹配会严重惩罚系统识别出有效的、连续的语义流形,而这些流形只是使用了相邻的词汇块。定性人工审核证实,τ=0.65达到了最佳的数学拐点:它足够宽松以捕捉合法的同义变体,同时又严格限定以防止不相交概念的交叉污染(例如,防止“幽默”错误地合并到“攻击性”中)。在此基线配置下,精确率是根据D=40个自动生成的维度(20个提示×2个成分)进行评估,而宏观召回率是根据总计M=245个唯一人工诱导的地面真值表达式计算的(每个任务框架的所有标注者平均汇总总特征数为12.25,而单个标注者平均每个提示有3.9个不同的风格请求)。为确保我们下游评估不是任意“魔法数字”的产物,我们报告了全面的敏感性扫描(τ∈[0.40, 1.00],附录E中的表4),表明我们选择的参数稳定地位于性能高原内。
2. **第二阶段(极值有效性)**:标注者在一个1-5的李克特量表上评估系统自动生成的标签与实际极值文本生成(-X vs +X)的准确性。我们使用平均精确一致率和平均相邻一致率(如果标注者评级在李克特量表上彼此在±1分内,则达成一致)来评估标注者共识。这有效地绕过了传统可靠性指标中常见的序数偏斜悖论(高一致率悖论)。
## 3 结果
评估阶段 | 指标 | 得分 | 解释
--- | --- | --- | ---
第一阶段:自发召回(无约束) | 人工语义一致性(IAA) | 47.2% | 人类标注者之间的基线语义共识。
| 系统精确率(Qwen-3.5) | 72.8% | 当系统提取一个概念时,72.8%的情况下它精确映射到人类期望的特征。
| 系统宏观召回率 | 43.6% | 无监督流程零样本恢复了近一半所有唯一请求的人类概念。
第二阶段:基础有效性(有约束) | 全局中位数得分 | 4.0 / 5.0 | 典型的系统发现轴被评为“大部分准确”。(IQR: 1.0)
| 前2箱准确率 | 75.6% | >75%的相似文章
通过风格引导提示解释风格表示
本文提出了一个通过使用风格引导提示(即自然语言指令,引导大语言模型生成具有特定风格属性的文本)来解读风格表示的框架。该方法在描述和模仿写作风格方面均优于基线大语言模型提示技术。
轻量级风格一致性分析:用于多媒体内容审核的大语言模型生成文本鲁棒性检测
提出了 LiSCP,一种轻量级的风格一致性分析方法,旨在鲁棒性地检测大语言模型(LLM)生成的文本内容,重点关注在对抗性操纵下特征的稳定性。在域内和跨域检测中取得了优异的性能,并具有显著的鲁棒性。
通过激活匹配微调检测大语言模型中的隐藏行为
提出了一种名为激活匹配微调的无监督方法,通过比较与参考模型的激活来检测大语言模型中的隐藏行为,无需先验知识即可可靠识别触发器。
测量、定位和消除LLM中的对齐特征
本文研究了LLM后训练如何引入类似AI的风格规律,并提出了PASTA,一种无需训练的方法来定位和消除这些对齐特征,从而在11个模型和6个检测器上降低AI检测率同时保持连贯性。
现代大语言模型与人类脑电图中共有的效价轴:饱和规律
本文发现了现代大语言模型与人类脑电图信号之间共有的效价轴(V-axis),表明LLM内部表示中的一个单一方向与对情感刺激的神经反应一致。它还识别了饱和规律,解释了为何基于LLM的监督无法改善脑电图解码,以及如何利用残差多样性提升性能。