九个情感质心:一种无标签的效价轴,可跨四种模态迁移
摘要
本文介绍了一种无标签方法,从九个情感示例中找到一个效价轴,该轴可跨文本、视觉、音频和大脑模态迁移,在最少标签下实现有竞争力的情感分类。
arXiv:2608.18090v1 公告类型:新
抽象:现代语言模型内部存在一个单一方向,用于追踪句子感觉的积极或消极程度。我们展示了如何仅从9个情感类别名称加上每个情感50个短叙事段落——比通常的监督方法少约1,500个标签——来找到这个效价轴(V轴),并且相同的方向出现在从未联合训练的视觉、音频和人类大脑编码器中。方法:在冻结的编码器中嵌入九个以情感锚定的故事集,取九个平均嵌入的主方向。将新输入投影到该方向上,在SST-2上捕获93%的监督性能(Llama-3-8B-Instruct,AUC 0.772 对比 0.828),与11,811张EmoSet图像的人类效价评分相关性为r=0.636,在ESC-50音频上AUC达到0.906(p<2.2e-15),在123名受试者的EEG上AUC为0.720+/-0.055(p<3.65e-8)。该方向在机制上是活跃的:消融它会使三个LLM的情感准确率下降5.5-37.2个百分点,而匹配的随机方向最多下降0.88个百分点(z>12)。一个在文本标签上训练的2参数分类器可以迁移到图像(AUC 0.961)、音频(0.764)和大脑记录(0.828),而无需目标模态标签;一个通用的16维子空间保持在机会水平(0.525)。该方法局限于连续属性——对分类概念的七个测试返回接近机会水平——并且引导是特定于家族的(Llama/Mistral是,Qwen/Gemma否)。
查看缓存全文
缓存时间: 2026/08/20 09:53
# 九类情感中心点:无需标签、可跨四种模态迁移的效价轴 来源:https://arxiv.org/html/2608.18090 ###### 摘要 现代语言模型内部存在一个单一方向,用于追踪句子情感倾向的正负程度。我们展示了如何仅用99个情感类别名称,加上每个类别约50\\sim\!50段短叙事段落——标签数量仅为传统监督方法的约1/1500——来发现这条*效价轴*(V-axis)。同样的方向也出现在从未联合训练过的视觉、音频和人脑编码器中。该方法包含三个步骤:编写九个以情感锚定的故事,将每个故事嵌入冻结的编码器,并取九个平均嵌入的主成分方向。该方向即为V轴。将新输入投影到该轴上得到的全监督分类器在四种模态中匹配:在SST-2文本情感任务上达到93%的监督性能(Llama-3-8B-Instruct,AUC 0.772对比0.828);与11,811张EmoSet图像的人类效价评分相关性达皮尔逊r=+0.636(随机方向零假设|r|≤0.112);在ESC-50的50个音频类别上达AUC 0.906(配对p=2.2×10−15);在123名受试者观看情感视频的EEG记录上达AUC 0.720±0.055(合并p=3.65×10−8)。该方向不仅具有预测性,且在机制上起作用:从语言模型隐藏状态中外科手术式移除该方向(Arditi等人2024年的标准*方向消融*技术)会使三个模型的情感分类性能下降5.5–37.2个百分点,而移除同等大小的随机方向最多仅损失0.88个百分点(信号强度比随机零假设高≥12个标准差)。由于同一方法在各模态中都能产生方向轴,仅需两个参数、在文本标签上训练的单一情感分类器,无需见过目标模态标签即可读取图像(AUC 0.961)、音频(0.764)和脑记录(0.828)的情感;而通用16维跨编码器“共享子空间”在相同任务上仅达随机水平(0.525)。该方法边界清晰——在七类独立概念测试(物体类别、词对、AxBench Concept-500)中返回随机或近随机结果——其因果可用性亦有限:推理蒸馏模型将轴移至最后一层,仅Llama和Mistral系列模型能通过重新添加V轴进行*引导*;Qwen和Gemma可探测但无法引导。结论表明:效价是少数简单到用九个样本即可恢复的属性之一,且跨编码器共享性强,可通过单一维度桥接文本、图像、声音与脑活动。 ## 1引言 现代语言模型在处理句子时,会在数千个神经元中构建一种内部活动模式,我们称之为*隐藏状态*(或*残差流*,因每个Transformer层会累加运行总和)。近期可解释性研究发现该活动中存在惊人简单的结构。许多我们天真认为分散在网络中的高层属性——“这个句子关于法国吗?”、“模型即将拒绝请求吗?”、“此概念指代人物吗?”——实际上可通过隐藏状态空间中的*单一线性方向*读取甚至操纵(Park等人2024;Arditi等人2024)。我们将此列表增加一个属性:*效价*,即输入信息的正负情感电荷。我们随后展示了两点(据我们所知,此前效价轴研究未同时呈现):该方向可通过约9个类别名称和约450个无标签句子而非数千极性标签找到;且*相同*效价方向(经单模态微调后)出现在视觉、音频和人脑EEG编码器中——这些编码器无任何共同预训练。 ### 标准路径与我们的方法 在基础模型中构建连续属性轴的教科书方法是监督式:获取数千个标签样本(正面句子、负面句子),通过模型处理,并在隐藏状态上拟合线性分类器。该分类器的权重向量即为“轴”。我们的方法另辟蹊径,*无需极性标签*,仅需18次监督事件:99个情感类别名称(愤怒、快乐、恐惧……)和99个写作提示。由此我们为每个情感撰写约50段引发情绪的短段落,通过冻结编码器嵌入,在类别内平均得到隐藏状态空间中的9个*情感中心点*,并取所得9×d矩阵的主成分(PC1)。这单一方向(即V轴/*效价轴*)是下游唯一使用的量。与监督式SST-2探针(Socher等人2013)相比,标签成本比约为1,546倍。 ### 创新点与既有工作对比 该方法是*K=9*类别中心点的PC1,而非两个对比标签间的判别方向:Park–Choe–Veitch(Park等人2024)方向存在于成对判别几何中,而V轴在相同概念上与这些方向正交(平均|cos|=0.038)。Arditi等人(2024)的方向消融干预在此应用于*方法推导*的方向,而非拟合拒绝/情感标签的判别方向,因此因果假设检验的是方法本身而非监督读取。据我们所知,四编码器跨模态迁移矩阵在LRH–AxBench–引导研究中尚无先例(该研究仅限文本)。本文组织为探测→机制→因果三部曲:探测(§3)、机制(§7)、因果(§4)。 ### 为何用九类而非二类 将单一“情感方向”拟合于一对对比标签(正面vs负面)会强制符号并混淆效价(愉悦/不悦)与唤醒度(平静/强烈)。将中心点分布于九类Russell–Ekman情感类别(Russell 1980;Ekman 1992),让数据决定中心点在何方向分布最广;因效价主导情感文本方差,故其胜出。 ### 四个支撑数据,每模态一个 我们在四种训练数据与目标完全不同的编码器中测量V轴。文本:将Llama-3-8B-Instruct残差块20的隐藏状态投影至V轴,以AUC 0.772分类SST-2句子,达监督线性探针(在6,920个SST-2标签上训练)AUC(0.828)的93%。Qwen3-8B经层搜索(选择块31而非网络中部)后达AUC 0.787——此深度偏移特见于推理蒸馏模型,见§7。视觉:在CLIP图像编码器(Radford等人2021)上,基于约450张情感相关图像构建的V轴,与11,811张EmoSet图像(Yang等人2023)的众包效价评分相关性达皮尔逊r=+0.636(随机方向零假设|r|≤0.112)。音频:在CLAP音频编码器(Elizalde等人2023)上,V轴在ESC-50(Piczak 2015)50个环境声类别上达平均AUC 0.906(配对置换p=2.2×10−15)——这是单模态最强结果,可能因CLAP的文本-音频对比目标使情感对齐文本概念可在音频中直接探测。EEG——受试者观看情感视频时的脑电活动记录(Chen等人2023)——基于CBraMod EEG基础模型(Chen等人2024)构建的V轴,在123名受试者中达AUC 0.720±0.055(合并p=3.65×10−8,受试者分层5折分割)。 ### 从探针到因果杠杆 预测方向可能仅与属性*相关*,未必*产生*模型情感行为。为区分两者,我们使用*方向消融*(Arditi等人2024):在前向传播的每个层与词元位置,用h−(⟨h,v⟩)v替换隐藏状态h,其中v为单位V轴向量。即从运行表征中正交投影移除V轴——迫使模型在无法使用其的情况下思考——并读取SST-2准确率。跨三个独立LLM,V轴消融使准确率下降5.5百分点(Llama-3-8B-Inst)、15.8百分点(Qwen3-1.7B)和37.2百分点(Qwen3-8B块23),而每个模型三个匹配幅度随机方向在相同协议下最多损失0.88百分点。信号在所有模型中比随机零假设高≥12个标准差,在Qwen3-8B中达196σ。随机方向触及随机特征;V轴触及情感。 ### 一个分类器,四种模态 V轴在每个编码器中独立存在,但基于某一V轴训练的情感*分类器*迁移至另一模态时无需重新训练。我们在SST-2文本分数上拟合2参数逻辑回归,随后评估其在其他模态V轴投影上的表现——在头部拟合阶段无目标模态标签。所得4×4矩阵中所有12/12非对角格均超AUC 0.70;文本训练的头部在EmoSet达0.961,ESC-50达0.764,EEG达0.828。自然基线——同编码器间无情感参考计算的通用前16维共享子空间——处于随机水平(0.525)。单一任务相关维度比十六个通用维度高0.18–0.44 AUC。 ### 为何非AxBench变体 AxBench(Wu等人2025)表明监督线性探针优于稀疏自编码器引导LLM,使用每概念100–1,000个标签的纯文本类别概念。我们同时推进三个维度:标签预算降至18次事件(≥50倍减少);概念为连续而非类别——关键的是,将我们的方法应用于AxBench自身的500个类别概念返回随机或近随机(KS p=0.41,附录F);模态范围扩展至视觉、音频和EEG,其中通用K=16共享子空间在情感任务上处于随机水平(0.525)。 ### 贡献 (i) 方法(§2):九类情感中心点、SVD、取PC1,完全详述可复现。(ii) 四模态探测(§3):同一方法在文本匹配监督分类器±7pp AUC,视觉r=+0.636,音频AUC 0.906,EEG AUC 0.720。(iii) 因果证据(§4):推理时投影使情感下降5.5–37.2pp,而匹配随机方向≤0.88pp(z≥12σ)。(iv) 通用跨模态分类器(§5):一个文本监督头部迁移至四编码器,12/12跨格AUC≥0.70。(v) 边界声明(§6):七类类别概念失败、推理蒸馏深度偏移、家族特异性引导模式(Llama/Mistral可行;Qwen/Gemma不可)。 ### 非适用范围 该方法是*经验规律*而非解析定理,局限于*连续*概念:七类独立类别概念测试(Park–Choe–Veitch词对、长尾检索、多概念探测、AxBench Concept-500、视觉CIFAR-100、五深度切片所有类别概念、深度偏移特异性)返回随机或近随机。EEG V轴本身基于FACED效价标签的监督线性判别构建;EEG结果的“无标签”部分在头部而非轴。文本–图像–音频V轴为无监督。跨模态分类器声明中的“通用”限于我们测试的四编码器(CLIP-text、CLIP-image、CLAP-audio、CBraMod-EEG),不涵盖未测试的编码器。方向消融对符号不敏感,故因果面板未进行符号翻转搜索;我们在§4描述识别协议,将“因果”视为推理时投影证据,而非反事实干预证据。 ### 与近期工作关联 AxBench(Wu等人2025)报告简单监督线性探针基线引导LLM效果优于稀疏自编码器。我们的方法在三个量化维度上不同:*标签预算*(此处n=18监督事件,对比AxBench每概念∼100–1,000示例,≥50倍减少);*概念类型*(针对连续效价;在AxBench的500个类别概念上该方法与匹配范数零假设持平,KS p=0.41,附录F);*模态范围*(AxBench仅限文本;此处增加三个独立编码器无需重训头部)。线性表征假设(Park等人2024)识别类别属性的概念判别方向;V轴为连续属性且近似正交于Park–Choe–Veitch因果内积方向(平均|cos|=0.038)。柏拉图式表征假设(Huh等人2024)预测跨编码器在ImageNet类别相似性上的收敛;我们的4×4矩阵将其扩展至跨无预训练共享模态(含EEG)的单一任务相关一维方向。 ## 2方法 ### 直觉 撰写九个短篇故事,每个对应愤怒、厌恶、恐惧、悲伤、娱乐、快乐、灵感、温柔和中性基准——每类约五十篇。将其输入冻结语言模型,观察最终词元的隐藏状态。在每类内平均,得到九个向量,每类一个。
相似文章
模型在哪里找到快乐?开源LLM中的情感向量
本文复现了开源权重大语言模型Apertus-8B和Gemma-4-E4B中'情感向量'的发现,表明价态几何结构在不同模型间可恢复,但层间出现时机存在差异。研究还发现唤醒编码对用于提取的故事语料库敏感。
超越情感分类:文本情感强度评估的生成式框架
本文提出了一种用于情感强度评估的生成式框架,将离散分类转变为0-100的连续评分。该框架在金融等领域展现了优越的性能和泛化能力。
现代大语言模型与人类脑电图中共有的效价轴:饱和规律
本文发现了现代大语言模型与人类脑电图信号之间共有的效价轴(V-axis),表明LLM内部表示中的一个单一方向与对情感刺激的神经反应一致。它还识别了饱和规律,解释了为何基于LLM的监督无法改善脑电图解码,以及如何利用残差多样性提升性能。
REGARD:大型语言模型中的区域情感差异
本文介绍REGARD,一项使用Valence-Arousal-Dominance画像法测量LLM对后苏联实体情感框架差异的研究,揭示模型按情感强度和通用回答率聚类,而非按来源或规模聚类。
负面先于正面:大型语言模型中的不对称效价处理
本文通过机理可解释性研究大型语言模型如何处理情感效价。通过在三个开源LLMs上使用激活修补和引导,作者发现负面效价定位于早期层,而正面效价在中后期层达到峰值,并通过主题控制翻转测试验证了这一点。