稀疏自编码器将大脑-LLM对齐映射到皮层语义拓扑
摘要
本文使用稀疏自编码器将大语言模型分解为可解释的特征,并表明语义特征能够解释大脑与皮层语义拓扑的对齐,且该结论在英语、中文和法语中均具有泛化性。
arXiv:2605.23035v1 公告类型:新
摘要:大语言模型(LLM)的中间层最能预测人类大脑对语言的反应,这是计算神经语言学中最可靠的发现之一,但其机制原因仍未得到解释。我们通过将机械可解释性中的稀疏自编码器(SAE)与神经编码模型相结合来弥补这一差距,将 GPT-2 XL 和 Llama-3.1-8B 分解为每层 16K-32K 个可解释特征。一项经人工验证的分类体系($\kappa \geq 0.74$)表明,仅语义特征就能恢复 94% 的峰值编码性能($r=0.285$),显著超过了方差匹配基线($p<0.001$,$d=1.31$)。除了这种整体优势外,我们还测试了一种新颖的皮层拓扑预测:来自三个独立神经科学项目的先验的五个语义子类别应映射到不同的大脑区域。一项正式收敛检验证实了这种对齐(Spearman $\rho=0.72$,$p<0.001$;超几何 $p=0.007$),表明 SAE 发现的特征以先前方法无法达到的粒度重现了已知的皮层语义组织。SAE 特征进一步预测了超越词汇控制的人类阅读时间($\Delta\mathrm{logLik}=38.4$,$p<0.001$),并且一项探索性预测误差分析提供了初步证据,表明大脑还编码了意外的语义内容。结果在英语、中文和法语中均具有泛化性。
查看缓存全文
缓存时间: 2026/05/25 08:57
# 稀疏自编码器将大脑-大语言模型的对齐映射到皮层语义拓扑上 来源:https://arxiv.org/html/2605.23035 Dongxin Guo 香港大学 香港,中国 bettyguo@connect\.hku\.hk &Jikun Wu 星耀人工智能有限公司 香港,中国 hk950014@connect\.hku\.hk &Siu Ming Yiu 香港大学 香港,中国 smyiu@cs\.hku\.hk ###### 摘要 大语言模型(LLMs)的中间层能最好地预测人脑对语言的反应——这是计算神经语言学中最稳健的发现之一,但其机制原因仍未得到解释。我们通过将机制可解释性中的稀疏自编码器(SAEs)与神经编码模型相结合,将GPT-2 XL和Llama-3.1-8B分解为每层16K–32K个可解释特征,从而填补了这一空白。经人工验证的分类体系(κ≥0.74)显示,仅语义特征就恢复了94%的峰值编码性能(r=0.285),显著超过了方差匹配的基线(p<0.001, d=1.31)。除了这种总体主导性,我们还测试了一个新颖的*皮层拓扑*预测:从三个独立神经科学项目中*先验*推导出的五个语义子类别应映射到不同的大脑区域。一个正式的收敛性检验证实了这种对齐(Spearman ρ=0.72, p<0.001;超几何检验 p=0.007),表明SAE发现的特征以先前方法无法达到的粒度再现了已知的皮层语义组织。SAE特征还能在词汇控制之外预测人类阅读时间(ΔlogLik=38.4, p<0.001),一项探索性的预测误差分析提供了初步证据,表明大脑还编码了意外的语义内容。结果在英语、中文和法语中具有普遍性。 稀疏自编码器将大脑-大语言模型的对齐映射到皮层语义拓扑上 Dongxin Guo香港大学香港,中国 bettyguo@connect\.hku\.hk Jikun Wu星耀人工智能有限公司香港,中国 hk950014@connect\.hku\.hk Siu Ming Yiu香港大学香港,中国 smyiu@cs\.hku\.hk ## 1引言 语言表示的哪些计算特性使其能够预测人脑活动?这个问题根植于数十年的神经语言学理论(Hale, 2001;Levy, 2008;Huth等, 2016;Mitchell等, 2008),随着大语言模型(LLMs)以显著的准确性预测神经反应(Schrimpf等, 2021;Goldstein等, 2022;Pereira等, 2018),这一问题变得愈发紧迫。Tuckute等(2024b)证明,经LLM优化的刺激能因果性地驱动大脑的语言网络,而Fedorenko等(2024)认为该网络构成一个自然种类,其特性与LLM发现的表示相一致。“直接拟合”视角(Hasson等, 2020)表明,这种对齐的出现是因为大脑和模型都针对相似的计算目标进行了优化。 然而,一个根本性的谜题依然存在。大脑预测能力并非随深度均匀分布:*中间*层始终优于早期和晚期层(Caucheteux and King, 2022;Toneva and Wehbe, 2019;Tuckute等, 2024b)。这种倒U形是计算神经语言学中最稳健的发现之一(Mao等, 2025)。但*为什么*中间层与大脑的对齐效果最好?人们提出了三种非互斥的解释: (1) 预测处理:在层次预测编码(Rao and Ballard, 1999;Friston, 2005;Clark, 2013)框架下,神经反应反映预测误差;中间层可能产生最类似大脑的预测(Friston, 2010;Heilbron等, 2022)。 (2) 特征发现:LLMs作为预测的副产品发现了丰富的语言特征(Antonello and Huth, 2023);中间层在晚期层特化之前包含最丰富的语义。 (3) 几何假象:中间层可能仅仅具有更高维度的表示,更易于线性解码(Kornblith等, 2019)。 区分大脑*表示什么*与*如何计算*,需要将表示分解为可解释的特征。稀疏自编码器(SAEs)恰好提供了这种能力(Huben等, 2024;Templeton等, 2024)。我们将机制可解释性与神经编码联系起来,提供了中间层优势的特征级分解。此处使用“机制”一词的含义是*机制可解释性*(将表示分解为可解释的特征),而非声称完整的因果机制解释。 我们的贡献: 1. 1.主要实证(新颖):我们*先验*地从Huth等、Binder等和Deniz等三个独立神经科学项目中推导出五个语义子类别,然后测试SAE特征是否再现了它们预测的皮层拓扑。一个正式的收敛性检验(Spearman秩相关 ρ=0.72, p<0.001;超几何重叠 p=0.007)确认了预测与观察到的子类别×区域模式之间存在显著的对齐,表明SAE导出的特征以先前方法无法达到的粒度捕捉了神经上有意义的语义区分。 2. 2.方法论(使能):我们在GPT-2 XL和Llama-3.1-8B的每第四层上训练SAE,每层提取16K–32K个特征,并带有经过验证的五类分类体系(实质性类别κ≥0.74)。我们实证证明了SAE在皮层拓扑映射方面优于更简单的词级语义规范注释(§5.2)。 3. 3.支持性实证(确认性+探索性):三项收敛的分析(编码模型、方差划分和带有方差匹配对照的激活修补)在特征级分辨率上确认语义内容主导了大脑-LLM对齐,扩展了先前的总体发现(Kauf等, 2024;Antonello and Huth, 2023)。行为验证显示SAE语义特征预测人类阅读时间(§5.3)。一项探索性的预测误差分析提供了初步证据,表明大脑可能还编码了意外的语义内容。 核心主张:SAE提取的语义特征同时解释了大脑-LLM对齐中众所周知的中间层优势*以及*一种与已建立的语义组织神经科学描述相收敛的皮层拓扑:一个单一的特征级解释同时涵盖了两个先前不相关的经验规律。Kauf等(2024)和Antonello与Huth(2023)的先前工作通过类别级探针和总体度量确立了语义内容(特别是与句法结构相对的词汇-语义维度)主导大脑对齐。我们的SAE分解在以下四个方面超越了这些前辈:(i)*特征级粒度*(每层16K–32K个单独特征 vs. ~3–5个宽泛类别),从而能够进行子类别×脑区交互分析(§4.4);(ii)*先验子类别和针对独立神经科学项目的正式收敛性检验*(§4.5);(iii)*行为验证*,显示这些特征预测人类阅读时间(§5.3);以及(iv)对语义预测误差的探索性检验(§5.4)。我们更细粒度的分解进一步揭示,可归因于语义内容的大脑预测方差是被*上下文相关的*SAE特征而非仅词汇特征所捕捉(表2),从而细化了Kauf等(2024)对词汇-语义的强调。这些贡献共同将问题从*语义是否驱动对齐*转变为*哪些具体的语义特征*在*大脑的哪些位置*驱动对齐。 ## 2背景与相关工作 #### 中间层优势。 Schrimpf等(2021)系统地记录了中间层最能预测大脑反应。Caucheteux和King(2022)在100多个受试者中确认了这一点;Goldstein等(2022)使用ECoG发现了共享原则。最早的层对齐工作使用ELMo和BERT(Jain and Huth, 2018;Toneva and Wehbe, 2019)。Mao等(2025)显示早期层对应快速处理信号,而后期层与N400幅度对齐,这与Michaelov等(2024)证明LLM的惊讶值预测单试次N400幅度的工作相联系。Kietzmann等(2019)在视觉中演示了类似的层次对应。 #### 什么驱动对齐? 一个核心争论是关于LLM表示的哪些特性负责其大脑预测能力。一条研究线路强调*词汇-语义内容*:Kauf等(2024)表明,当与句法结构对比时,词汇-语义信息主导了LM-大脑对齐,这建立在早期对大脑反应中语法和语义进行区分的工作之上(Caucheteux等, 2021)。第二条线路强调*特征发现和上下文化*:Antonello和Huth(2023)认为大脑预测特征作为下一个词预测的副产品而出现;Oota等(2023)显示对齐依赖于跨模态的多个语言维度;Vafaei等(2026)证明细粒度语义标注改善了大脑编码。第三条线路考察*训练和规模*:Hosseini等(2024)发现仅用约1亿词训练出的模型就显示出大脑对齐,Pasquiou等(2022)显示训练动态塑造了大脑拟合度,Doerig等(2025)展示了多语言嵌入中的几何对齐。超越原始激活,Mathis等(2024)显示XAI归因优于原始激活,Kumar等(2024)将注意力头解构为功能特化的组件。在方法论上,表征相似性分析传统(Kriegeskorte, 2008;Nili等, 2014)提供了互补视角;THINGS计划(Hebart等, 2023)和Algonauts挑战赛(Cichy等, 2021)推进了物体语义的共享评估,尽管我们聚焦于自然语言刺激。我们专注于编码模型(而非RSA),因为其在体素级预测分辨率以及按特征类型分解方差的能力方面更优。Liu等(2025)为神经网络表示提供了互补的神经科学启发式评估标准。 #### 皮层语义组织。 Huth等(2016)揭示了系统的皮层语义地图;Binder等(2009)通过元分析建立了一个核心语义网络;Deniz等(2019)展示了模态不变的地图。Patterson和Lambon Ralph(2016)提出了枢纽-辐射架构。Binder等(2016)开发了一个65维的经验属性空间,直接激发了我们的子类别分析。语义特征产生规范(McRae等, 2005)提供了收敛的行为证据。 #### 机制可解释性。 残差流框架(Elhage等, 2021)将Transformer视为迭代精炼表示的过程。SAEs将激活分解为单义特征(Huben等, 2024);Templeton等(2024)将其扩展到生产模型;Li等(2025)发现了空间模块。近期工作提出了重要关切:更大字典尺寸下的特征分割(Makelov等, 2025)、特征吸收(Chanin等, 2024),以及关于SAE特征是否代表“真正”计算特征的疑问(Huben等, 2024)。少量并行工作已开始将SAE风格的稀疏分解应用于相邻领域的神经数据分析(视觉大脑编码:Wasserman等, 2025;音频模型可解释性:Aparin等, 2026;稀疏字典大脑编码:Zeng and Gallant, 2026),这些与本文工作并行开展。据我们所知,尚无先前工作将SAE应用于分解针对*语言*刺激的LLM-大脑对齐(使用fMRI),也没有任何工作将SAE特征与正式的先验皮层拓扑预测联系起来;这正是我们填补的空白。 #### 预测编码和惊讶值。 惊讶值理论(Hale, 2001;Levy, 2008)预测处理难度与负对数概率成正比;Shain等(2024)和Wilcox等(2023)提供了跨语言证据,而Shain等(2024
相似文章
利用语言模型的稀疏特征解读大脑对语言的反应
本文介绍了Augmented Sparse Encoding Models,利用语言模型的稀疏特征解读大脑对语言的反应,并在高场7T fMRI数据上进行了验证。该模型恢复了已知的神经调谐特性,并发现了一个新的体素群体,该群体对与人相关的内容具有调谐特性。
大脑-LLM对齐受训练数据影响,而非语言类型学
本文利用fMRI数据和多种LLM,研究了英语、中文和法语中的大脑-LLM对齐,发现训练语言主导性和类型距离(而非英语固有的优势)驱动了对齐模式。
通过稀疏自编码器实现脑电图基础模型的机制可解释性
本文对三个脑电图基础模型(SleepFM、REVE、LaBraM)应用TopK稀疏自编码器,提取可解释的特征字典,并引入了概念引导框架,揭示了表征失败和临床纠缠问题。
解决AI中叠加问题以实现可解释性与患者神经元图像的跨模态对齐
本文引入稀疏自编码器来解决神经网络中的叠加问题,提高潜在空间的可解释性和几何保真度,并提出GW-map实现图像表示与单细胞RNA测序数据之间的跨模态对齐。
Brain-CLIPLM:基于脑电压缩语义表征的语言重建解码
研究人员提出Brain-CLIPLM,一个两阶段脑电到文本解码框架,利用对比学习提取语义锚点,并结合基于检索的大语言模型(LLM)及思维链(CoT)推理进行句子重建。该方法在测试中达到67.55%的Top-5句子检索准确率和85.00%的Top-25准确率,显著优于直接解码基线模型,跨被试评估证实了其良好的泛化能力。研究结果表明,脑电到文本解码应聚焦于恢复压缩后的语义内容,而非完整句子重建。