现代大语言模型与人类脑电图中共有的效价轴:饱和规律

arXiv cs.LG 论文

摘要

本文发现了现代大语言模型与人类脑电图信号之间共有的效价轴(V-axis),表明LLM内部表示中的一个单一方向与对情感刺激的神经反应一致。它还识别了饱和规律,解释了为何基于LLM的监督无法改善脑电图解码,以及如何利用残差多样性提升性能。

arXiv:2606.00129v1 公告类型:新提交 摘要:大型语言模型(LLMs)已成为强大的表示学习器,其内部特征日益与人类认知对齐。我们研究现代LLMs能否作为理解人类大脑神经表征的透镜,重点关注脑电图中的情感效价。 我们首先仅使用9个引发情感的句子,从现代LLMs构建了一个一维效价方向,即V-axis。我们通过零样本迁移至情感基准测试以及跨14个LLMs的模型一致性验证了该方向。然后,我们展示了这一LLM导出的方向映射到了人类神经活动。在一个包含123名被试观看情感视频的公共脑电图数据集中,脑电图特征上的单一线性投影追踪了每个刺激的V-axis位置。此外,36个未经V-axis暴露训练的脑电图情感分类器在其内部表示中自发地重新发现了同一方向,表明相同的效价结构同时出现在语言模型和人类电生理学中。 然而,这种收敛并未提供有效的训练信号。我们测试了25种对齐策略,包括知识蒸馏、表示相似性、对比学习和地形损失;没有一种改善了解码,16种显著降低了准确率。我们将这一结果形式化为饱和规律:一旦任务标签单独驱使脑解码网络趋向目标方向,额外的监督主要扭曲已经饱和的盆地,而承载信息的类内残差几乎得不到有用的梯度。 该规律也指明了改进应来自何处:监督无法触及的残差子空间。受此启发,我们基于残差多样性进行集成,而不是监督盆地,在FACED上相比之前最优方法将平衡准确率提高了10.5%,并且在SEED-V上复制了相同效果。
查看原文
查看缓存全文

缓存时间: 2026/06/02 15:39

# 现代LLM与人类EEG共享的效价轴:饱和规律
来源:https://arxiv.org/html/2606.00129  
Yousef A\. Radwan  
阿卜杜拉国王科技大学(KAUST)  
yousef\.radwan@kaust\.edu\.sa  
&Xuhui Liu  
阿卜杜拉国王科技大学(KAUST)  
xuhui\.liu@kaust\.edu\.sa  
&Kilichbek Haydarov  
阿卜杜拉国王科技大学(KAUST)  
kilichbek\.haydarov@kaust\.edu\.sa  
&Yuqian Fu  
阿卜杜拉国王科技大学(KAUST)  
yuqian\.fu@kaust\.edu\.sa  
&Mohamed Elhoseiny  
阿卜杜拉国王科技大学(KAUST)  
mohamed\.elhoseiny@kaust\.edu\.sa  

###### 摘要  
大型语言模型(LLM)已成为强大的通用表征学习器,越来越多的证据表明,其内部特征与人类认知在高层次概念上存在对齐。在本文中,我们研究现代LLM如何作为理解人脑信号的透镜,重点关注EEG中情感效价的神经表征。我们首先仅使用九个情感唤起句子,从现代LLM中构建出一维效价方向,命名为V轴,并通过零样本迁移至标准情感基准以及跨十四个规模差异巨大的LLM的一致性验证其有效性。然后,我们证明该LLM导出方向可直接映射到人脑。在一个包含123名受试者观看情感视频的公共EEG队列中,EEG特征上的单一线性投影即可追踪每个刺激的V轴位置。更引人注目的是,36个从未接触过V轴的EEG情感分类器在其内部特征中自发地重新发现了它。相同的效价方向同时存在于语言模型和人类电生理信号中。然而,LLM-大脑的收敛并未转化为直接的训练信号。我们测试了25种标准对齐方法,涵盖知识蒸馏、表征相似性分析、对比损失和拓扑损失;无一有效,其中16种显著损害了准确性。因此,我们将此发现提炼为**饱和规律**,这是一个在LLM-大脑界面上精确出现且此前未被认识的原则:一旦任务标签本身已将脑解码网络驱动至目标方向,监督仅能变形一个已饱和的盆地,而承载负荷的类内残差则无法获得梯度。饱和规律具有两面性:它既解释了LLM导出的监督为何无法改进EEG解码,又同样指出了实际增益所在——即监督无法触及的残差子空间。基于这一洞见,我们采用残差多样性集成而非监督盆地的方法,在公共EEG情感识别基准FACED上将平衡准确率相比先前最佳提升了10.5%,且相同效果在SEED-V数据集上得到复现。

## 1 引言  
将九个简短的情感唤起句子输入语言模型,逐类平均其后期隐藏状态,取所得九个向量的第一主成分,并使其方向使得Joy质心投影为正。由此得到的单一方向——我们称之为**效价轴**(V轴)——在零样本条件下预测电影评论情感达到AUC 0.832,预测123名受试者观看情感视频时的EEG响应达到r=0.87,并且被我们测试的每个足够强的EEG情感分类器在无监督条件下重新发现。近期工作表明,大型语言模型的内部特征与人类认知在高层次概念上对齐(Kim等,2018;Arditi等,2024);我们询问这种对齐是否能转变为通向人类电生理学的可用桥梁,既作为脑解码网络编码内容的探针,也作为可改进这些网络的训练信号。

**九个句子的轴。** 九个故事分别对应FACED(Chen等,2023)的每个类别;语言模型选择Qwen3-4B,因其在我们对14个LLM的扫描中居于对齐流形的中心,且对行为效价参考具有最高的每刺激对齐度(该方法本身与模型无关,见附录S3)。SST-2基准支撑了AUC 0.832的结论:V轴投影本身与5.5万样本的有监督逻辑回归(Socher等,2013)相差不到0.005。并且该方向并非任何单一模型所特有:在14个参数从5.6亿到320亿的语言模型中,V轴收敛于本质相同的方向(在Qwen3内,15个大小对的非对角r=+0.995)。

**相同的轴存在于大脑中。** 上述r=0.87的具体含义如下:基于FACED队列EEG的160个通道-频带特征进行岭回归,预测28个刺激中每个刺激的V轴位置;该回归器使用留一刺激交叉验证,无需个体被试拟合,无需辅助监督。Qwen3-4B V轴本身在该岭回归上达到r=0.80(p<10⁻⁵);基于相同28个刺激描述的CLIP-文本V轴变体将其提升至r=0.87(p<10⁻⁹)。第三个主张——EEG网络在从未见过V轴的情况下重新发现它——通过对36个仅使用9个情感标签训练的FACED-9检查点的量化得到证实:每检查点在类均值子空间中的V轴编码强度预测平衡准确率,r=+0.885(p=7.8×10⁻¹³,图1)。相同的效价方向通过独立程序从语言模型内部和人类电生理学内部恢复出来。

参照图注:图1:从九个LLM情感故事中提取的单一维效价方向,在语言、大脑和EEG分类器模型中得到恢复。(a) V轴(Qwen3-4B九个故事类质心在倒数第二层的PC1)在标准文本情感基准上的零样本探针AUC/|r|;轴构建过程中未见任何标签。(b) FACED中LLM V轴投影与队列EEG响应的刺激级散点图(n=28刺激,123受试者);内嵌图显示随机方向排列零假设检验。(c) 36个EEG分类器检查点(CBraMod和EMOD系列)按其类PC1 V轴|r|(训练中未使用V轴损失)对应FACED 9类平衡准确率;线性拟合r=+0.885。同一维方向解释了文本情感,预测了诱发EEG,并跟踪分类器准确率,而无需在三种设置间共享数据。

**然而监督失败了。** 利用这种对齐的自然方法是添加一个辅助损失,将EEG网络的倒数第二层特征拉向V轴。我们测试了25种这样的方法,涵盖知识蒸馏(Hinton等,2015)、表征相似性分析(Kriegeskorte等,2008)、对比损失(Khosla等,2020;van den Oord等,2018)、参数高效微调适配器如LoRA(Hu等,2022)以及通道目标拓扑损失(Padakanti等,2025)。无一有效。其中16种产生了统计显著的准确率下降(ΔBACC ≤ -0.013,p<0.05,五个种子配对);零种产生增益。五个系列表现出**单调破坏**:我们越用力推动损失,准确率越差。这种转变是尖锐的:在弱基线(BACC ≤ 0.62)上无显著效果的干预,一旦基线增强(BACC ≥ 0.66)就变成显著负面。我们将这种规律称为**饱和**,它与过拟合不同——过拟合是记忆训练集,而饱和是当任务标签本身已将网络驱动至目标方向时发生的情况。此时辅助损失将已饱和的类均值分量进一步沿目标轴移动(对齐度增加Δ|r|从+0.01到+0.36),但类内残差——区分同一情感不同试次的部分——保持在数值零(约10⁻⁷)。监督扭曲了网络已经使用的盆地,却从未触及承载负荷的方向。

**增益所在之处。** 同样的诊断指出了实际增益所在:在监督无法触及的类内残差子空间中。类均值盆地在各种子间共享(每个训练良好的检查点以|r|∈[0.60,0.77]恢复V轴);残差是种子特异性的。因此,跨种子集成可以平均掉残差中的种子特异性噪声而不干扰盆地。每检查点残差编码强度预测留一法集成的贡献,r=+0.74(p=0.014,n=10),且10检查点集成在FACED-9上达到**0.6948**平衡准确率(验证集选择的单检查点为**0.6755**),相对于EMOD(Chen等,2025)之前的0.6287相对提升10.5%。相同的残差多样性策略在SEED-V(Liu等,2022b)上复现(附录S8)。一个对照实验使画面更加清晰:用随机正交向量替换知识蒸馏步骤中使用的语言模型导出类原型,BACC变化≤0.003,因此SOTA增益来自损失的**形状**——对特征施加的9类结构——而非原型的**内容**。V轴作为网络已饱和于**什么**概念的探针,而非监督信号的来源。

### 贡献  
(1) **九个句子的V轴探针**:从9个语言模型情感故事中提取的一维效价方向,在14个LLM中收敛,零样本预测文本情感,预测队列EEG响应,并被36个EEG分类器在无监督条件下重新发现(§5–§7)。  
(2) **饱和规律**:在FACED-9上使用的25种表征对齐方法中,16种产生显著下降,0种产生增益,5个系列出现单调破坏,在[0.62,0.66] BACC波段有尖锐转变;损失将类均值分量移动Δ|r|从+0.01到+0.36,但类内残差仅约10⁻⁷(§3)。  
(3) **残差多样性集成**:将机制转化为积极处方:每检查点残差编码预测留一法贡献(r=+0.74),10检查点集成在FACED-9上达到**0.6948**(§4,§8)。三者均在SEED-V(Liu等,2022b)上复现(附录S8)。局限性见§9。

## 2 相关工作  

### 概念方向监督  
我们测试的干预措施来自七年来的表征对齐工作。知识蒸馏(Hinton等,2015;Tian等,2020;Park等,2019)训练学生的倒数第二层特征与固定教师目标对齐。表征相似性分析(Kriegeskorte等,2008;Sundaram等,2024)通过成对相似性矩阵对齐表征几何结构。有监督对比损失(Khosla等,2020;van den Oord等,2018;Radford等,2021)将同类特征拉近,异类特征推远。参数高效适应(Hu等,2022;Liu等,2022a)插入低秩或缩放模块,其更新局限于所选几何结构。这些方法的共同假设是辅助信号提供了任务所不具备的信息。本文研究的是辅助信号不提供额外信息的场景。

### 语言模型中的概念方向  
Arditi等人(2024)表明,指令微调LM中的拒绝行为由残差流激活中的一个单一方向介导:消融该方向消除拒绝,添加该方向诱导拒绝。该系列的早期工作包括(Li等,2023;Zou等,2023;Kim等,2018)。来自Anthropic可解释性的并行工作(Sofroniew等,2026)通过稀疏自编码器在量产规模LM中识别出情感概念特征,并表明消融这些特征会改变下游行为,补充了我们在此报告的人群水平大脑对齐。我们使用相同的PCA-类质心构造从九个LLM情感故事中提取一维效价方向,并将其作为网络已饱和于哪个概念的探针,而非用于引导的目标。我们报告的迁移结果(SST-2零样本、队列EEG、EEG分类器收敛)是关于方向存在的论断,而非关于生物情感处理中特征重要性的论断。

### 大脑与LLM的对齐  
Toneva和Wehbe(2019)首次表明中层Transformer激活可预测对叙事文本的fMRI响应;Schrimpf等人(2021)、Goldstein等人(2022)以及Caucheteux和King(2022)将该图景扩展到MEG、ECoG和大型模型家族。Huh等人将新兴图景形式化为**柏拉图式表征假说**(Huh等,2024)。我们通过探针部分与这一文献相交:LLM导出的方向预测队列EEG,EEG分类器反过来发现LLM侧的方向。我们的承载性主张是饱和规律,而非对齐本身。

### 额叶-α不对称  
Davidson的额叶-α不对称(Davidson,1992;Coan和Allen,2004;Davidson,2004)仍然是趋近/退缩情感的主要电生理学解释,主要基于静态刺激开发。我们的人群队列

相似文章

模型在哪里找到快乐?开源LLM中的情感向量

arXiv cs.CL

本文复现了开源权重大语言模型Apertus-8B和Gemma-4-E4B中'情感向量'的发现,表明价态几何结构在不同模型间可恢复,但层间出现时机存在差异。研究还发现唤醒编码对用于提取的故事语料库敏感。

REGARD:大型语言模型中的区域情感差异

arXiv cs.CL

本文介绍REGARD,一项使用Valence-Arousal-Dominance画像法测量LLM对后苏联实体情感框架差异的研究,揭示模型按情感强度和通用回答率聚类,而非按来源或规模聚类。

负面先于正面:大型语言模型中的不对称效价处理

arXiv cs.CL

本文通过机理可解释性研究大型语言模型如何处理情感效价。通过在三个开源LLMs上使用激活修补和引导,作者发现负面效价定位于早期层,而正面效价在中后期层达到峰值,并通过主题控制翻转测试验证了这一点。

表达社会情感:大语言模型与人类文化情感规范的错位

arXiv cs.CL

本研究论文考察了大语言模型表达社会情感的方式与人类文化规范的匹配度,发现两者存在系统性错位。与人类回应相比,大语言模型在不同文化身份(欧美裔美国人与拉美裔美国人)下表现出的参与型与抽离型情感表达模式不一致。