基于扰动的减法映射区域可解释性(PRISM):语言模型与卒中后失语症中的命名错误分离

arXiv cs.LG 论文

摘要

本文介绍了PRISM,一种用于大型语言模型空间分辨可解释性的基于扰动的方法,将神经影像减法分析适配到Transformer,并平行应用于卒中后失语症患者,以恢复共享的语音优势分离。

arXiv:2608.12717v1 公告类型:新 摘要:大型语言的机制可解释性缺乏空间分辨的、可证伪的工具来测试内部组件是否专门用于不同的认知操作。我们将人类神经影像学的标准框架——减法分析,从生物大脑适配到扰动Transformer,并将相同的逻辑平行应用于两种基质。基于脑-语言模型统一模型(BLUM),该模型表明层扰动的LLaVA-1.6-Vicuna-13B错误画像与失语症患者的病灶模式相匹配,我们开发了PRISM(基于扰动的减法映射区域可解释性)。PRISM映射七个临床费城命名测试类别,成对减去错误类别,并将每个扰动种子视为组分析中的一个受试者,沿层轴进行无阈值簇增强。我们对213名慢性卒中后失语症患者进行了结构匹配的相关性差异病灶-症状映射分析,并在留出分割上复制了两侧结果。设计在受试者维度(种子、患者)、空间维度(层、图谱分区皮层)和阈值化方面匹配,但对比算子不同:LLM使用受试者内错误比例差异,皮层使用受试者间相关性差异。两种基质都恢复了稳健的语音优势分离,一个深层簇和一个额叶-外侧裂周皮层簇,均得到复制;语义优势方向在两者上都是一致有符号但不显著的趋势。因此,PRISM为Transformer语言模型中的功能特化主张提供了可证伪的、空间分辨的测试。确认性的ROI级干预(PRISM第三阶段)许可最强的因果机制主张,留待后续工作。
查看原文
查看缓存全文

缓存时间: 2026/08/14 09:31

# 无标题文档 来源:https://arxiv.org/html/2608.12717 基于扰动的减法映射区域可解释性(PRISM):语言模型与卒中后失语症中的命名错误分离

Xiang Guan1†, Roger D. Newman-Norlund2,3†\*, Yong Yang1, Saeed Ahmadi2, Regan Willis1, Nadra Salman4, Kalil Warren4, Srihari Nelakuditi1, Chris Rorden5, Leonardo Bonilha6, Julius Fridriksson2,3

1 南卡罗来纳大学计算机科学与工程系
2 南卡罗来纳大学沟通科学与障碍系
3 ALLT.AI, LLC, 哥伦比亚, 南卡罗来纳州
4 南卡罗来纳大学语言学项目
5 南卡罗来纳大学心理学系
6 南卡罗来纳大学医学院神经病学系

†项光(Xiang Guan)和Roger D. Newman-Norlund对这项工作贡献相同,为共同第一作者。
\*通讯作者:Roger D. Newman-Norlund([email protected])

## 摘要

大型语言模型的机制可解释性缺乏具有空间分辨率、可证伪性的工具来测试内部组件是否专门用于不同的认知操作。我们将人类神经影像学中的标准框架——减法分析,从生物大脑改造并应用于扰动变换器,并将同样的逻辑并行应用于这两种基质。基于脑-语言模型统一模型(BLUM),该模型表明层扰动后的LLaVA-1.6-Vicuna-13B错误谱与失语症患者的病灶模式相匹配,我们开发了PRISM(Perturbation-based Regional Interpretability through Subtraction Mapping,基于扰动的减法映射区域可解释性)。PRISM将费城命名测试的七个临床类别映射出来,成对相减误差类别,并将每个扰动种子视为组分析中的一个受试者,沿层轴进行无阈值聚类增强。我们使用相关差病灶-症状映射对213例慢性卒中后失语症患者进行了结构匹配的分析,并在留出分割上重复了两侧的结果。两种设计在受试者维度(种子、患者)、空间维度(层、图谱分区皮层)和阈值化上匹配,但对比算子不同:LLM使用受试者内误差比例差,皮层使用受试者间相关差。两种基质都恢复了一个稳健的语音偏好分离——一个深层聚类和一个额叶-外侧裂周皮层聚类,两者均可重复;语义偏好方向在两者上都是一致的符号但非显著趋势。因此,PRISM为变换器语言模型中的功能特化主张提供了一种可证伪的、空间分辨的检验。确认性的ROI级干预(PRISM第三阶段)许可最强因果机制主张,留待后续工作。

**关键词:** 机制可解释性,大型语言模型,扰动-响应映射,变换器扰动,减法分析,病灶-症状映射,无阈值聚类增强,层分辨可解释性,患者特异性数字孪生

## 引言

### 可解释性差距

大型语言模型(LLM)的机制可解释性主要由作用于内部表示或权重的方法主导:探针分类器(Belinkov 2022; Hewitt and Manning 2019)、因果追踪与权重编辑(Meng et al. 2022; Geiger et al. 2021; Wu et al. 2023)、自动电路发现(Conmy et al. 2023)、以及稀疏自编码器特征分解(Cunningham et al. 2023; Templeton et al. 2024)。每种方法都提供了关于哪些组件编码或计算什么的证据,但每种方法都是对照基准或内部重构质量来评估其主张,而不是对照一个外部验证的、行为学定义的映射图——即模型组件在因果上对什么行为是必需的。结果是可解释性主张的碎片化景观,没有一个共享的推断框架来测试组件是否专门用于不同的认知操作。

相邻的人类认知神经科学领域花了数十年发展出正是这样的框架。减法分析应用于功能神经影像图(Petersen et al. 1988; Friston et al. 1995)和病灶-症状图(Bates et al. 2003; Mirman et al. 2015),并在非参数多重比较校正下(Smith and Nichols 2009; Maris and Oostenveld 2007),已将人脑分割成对一种操作相对于另一种操作具有选择性参与的区域。重复和定向干预闭合了推断循环。当感兴趣的位置在共同领域内具有空间组织,且被对比的操作近似可分离时,该框架是最有用的。在这里,我们研究当这些工具被引入LLM可解释性时会发生什么,并在LLM和一组接受相同行为任务的慢性失语症患者上并行运行它们。

### 扰动诱导误差图与PRISM

越来越多的研究开始通过将LLM激活视为与神经记录结构类似的数据来弥合LLM和大脑分析的鸿沟(Schrimpf et al. 2021; Caucheteux and King 2022; Goldstein et al. 2022, 2025; Antonello et al. 2024; Tuckute et al. 2024; Kumar et al. 2024; Mischler et al. 2025; Gao et al. 2025)。脑-语言模型统一模型(BLUM;Fridriksson et al. 2026)将这种类比扩展到行为输出。通过将费城命名测试(PNT)和西方失语症成套测验-修订版(WAB-R)施测于一个受扰动的130亿参数视觉-语言变换器(LLaVA-1.6-Vicuna-13B; Liu et al. 2023; Chiang et al. 2023)以及患有慢性卒中后失语症(N = 410)的人类,并将产生的LLM错误谱通过人类训练的“症状-病灶”模型进行投影,BLUM表明LLM衍生的预测病灶与错误匹配的人类中的实际病灶在高于机遇水平上匹配,在图片命名中为67%(p < 10⁻⁵³),在句子完成条件下为68%(p < 10⁻⁶⁸)。结构上的含义是直接的:对LLM的系统扰动产生了与人类一个多世纪以来病灶-症状映射所分析的形式相同的错误数据:一个有秩序的空间领域(变换器的层;Tenney et al. 2019; Geva et al. 2021; Rogers et al. 2020),行为后果被分类为临床验证的分类法(Schwartz et al. 2006; Dell et al. 1997),以及可重复的层间变化。

人工设置与皮层有两个特征区别。首先,残差连接将每一层的输出与所有先前层的激活耦合起来(Elhage et al. 2021),因此针对层的扰动可能不会像局灶病灶隔离一个皮层区域那样干净地隔离该层的计算。其次,分析的每个组成部分都可以随意重复,使用独立的随机扰动种子进行重复,并且相关病灶的施加或省略由实验者选择。这种与病灶-症状数据的结构相似性以及生物系统中缺乏可控性的结合,促使将病灶-症状类比的析因分析流程应用于LLM扰动图。为简洁起见,我们将所得到的框架称为PRISM(基于扰动的减法映射区域可解释性)。

其技术谱系将来自fMRI激活映射的减法逻辑(Petersen et al. 1988; Friston et al. 1995)以及最初为fMRI开发的基于聚类的空间推断(Smith and Nichols 2009; Maris and Oostenveld 2007)引入到一种在结构上与病灶-症状映射类似的扰动设计(Bates et al. 2003; Mirman et al. 2015);这一类比由BLUM的证明(Fridriksson et al. 2026)所授权,即LLM扰动谱可映射到真实的人类病灶模式。对比逻辑、跨重复的推断机制和聚类校正步骤继承自激活映射传统;扰动作为病灶的框架、对显著区域的必要性层聚类解读、以及确认性干预的收尾步骤则继承自病灶-症状传统。在本论文中,我们在这两种基质上并行运行减法分析,以便跨基质对应关系在本研究内得到证明,而非仅由类比断言。

PRISM与LLM机制可解释性的主导传统是互补而非竞争的。激活修补和因果中介分析(Vig et al. 2020; Meng et al. 2022; Geiger et al. 2021; Wu et al. 2023; Heimersheim and Nanda 2024; Zhang and Nanda 2024)、电路级分析和发现(Wang et al. 2023; Conmy et al. 2023; Merullo et al. 2024)、以及稀疏自编码器特征分解(Cunningham et al. 2023; Templeton et al. 2024)都作用于内部表示或权重,并产生细粒度的组件级主张。相比之下,PRISM是表型优先且有意的粗粒度:它从一个临床定义的行为失败——一个失语症错误类别的金标准——出发,并询问哪些层范围在因果上涉及其产生,作用于层聚类的水平而非单个头或特征。这两种方法回答互补的问题:内部表示方法识别哪些组件携带或计算哪些信息;PRISM识别哪些层范围在因果上对于防止哪些行为失败是必需的。粗粒度在这种机制下是一个特征,而不是妥协。它提供了行为可证伪性、统计功效,以及在人类认知神经科学中使此类推断值得信赖的多重比较和确认性干预机制。

### PRISM流程

对于六个临床PNT错误类别(语义、语音、混合、新语、无反应、无关),PRISM在所有40个变换器层上构建一个扰动诱导的层图,并在人类患者队列上构建一个并行的皮层图。然后,该框架在错误类别之间计算成对减法,应用无阈值聚类增强(TFCE)进行空间推断,并在一个独立的分割上重复所得图(LLM使用留出扰动种子;皮层使用留出患者)。由于层相邻并不保证功能相邻,我们还额外在LLM侧于层序置换下验证TFCE:当真聚类应该在层序列被随机化时消失。我们进一步通过错误类别标签的随机置换来测试减法逻辑背后的可分离性假设,在这种情况下,机遇水平的减法图将表明该模型中的操作不可分离。该流程的每个组成部分在人类认知神经科学中都有悠久历史;新的是它在本论文中在用于人类皮层的相同机制下应用于LLM衍生的行为错误图。

减法被设计来回答的问题直接转化为受扰动的LLM:哪个层聚类在被扰动时优先增加一种误差类型而不是另一种?因为相关病灶可以被随意创建,这种探索性分析识别出的候选聚类通过目标区域(ROI)扰动得到确认:只扰动所涉及的层,扰动匹配的非显著对照聚类作为无效对照,并验证由此产生的错误谱对涉及的聚类选择性地匹配图预测。因此,PRISM包含三个连续的阶段:使用TFCE和多种子重复的探索性减法分析;TFCE假设的层序和标签置换验证;以及针对无效对照的确认性ROI扰动。

在本研究中,我们将PRISM应用于BLUM中评估的相同视觉-语言变换器(LLaVA-1.6-Vicuna-13B;40个变换器层,130亿参数)以及费城命名测试(Roach et al. 1996),后者是测量命名不能(anomia)——失语症的标志性语言障碍——的金标准任务(Goodglass and Kaplan 1983; Laine and Martin 2023)。选择PNT是因为其175个项目的深度、六类别错误分类法以及深入的神经语言学与神经心理学发展,这些共同提供了估算每个错误类别的稳定图并计算类别间成对减法所需的行为信噪比。在平行方向上,相同的确认性减法分析在标准临床条件下于BLUM患者队列中运行(276人接受了PNT;213人具有完整的JHU病灶负荷谱进入分析),从而在受试者维度、空间维度和TFCE式阈值化方面匹配LLM和人类流程,即使在技术层面对比算子有所不同。限定于单一任务和单一架构是一个刻意的范围决策;扩展到WAB-R以及纯文本或编码器-解码器架构是已定义的下一步。

减法图以及在LLM侧的每个命名错误类别的ROI确认谱是该框架的输出。PRISM在此开发的形式提供了一种行为学基础检验,用于判断哪些层范围对哪些错误类别是必需的。该流程可跨架构、任务和行为分类法移植;推断标准原封不动地继承自人类认知神经科学;确认性ROI步骤以人类患者病灶-症状映射在结构上无法做到的方式闭合了推断-与-相关性的循环。该框架支持两个最终目标,它们一起定义了更广泛的研究计划(Fridriksson et al. 2026)。第一个是通过提供一种内部表示方法单独无法交付的可解释性证据来改进大型语言模型的可解释性,这种证据以外部、临床验证的语言失败分类法来表述,临床医生和AI社区均可使用。第二个是为神经系统疾病构建患者特异性LLM数字孪生。通过识别其错误谱最接近地复现个体患者状况的扰动条件,并在PRISM建立的推断标准下操纵这些扰动,可以构建计算替身来模拟患者特异性缺陷、模拟疾病轨迹、预测治疗反应,并可直接应用于招募和纵向随访成为限速环节的临床试验设计和加速。

## 方法

### 行为读出:费城命名测试

我们使用费城命名测试(PNT;Roach et al. 1996),这是一个175个项目的图片命名任务,引出单词响应。每个响应在标准PNT临床分类法(Schwartz et al. 2006; Dell et al. 1997)下被评为一个正确类别加上六个错误类别,共七个类别(表1)。同样的分类法应用于LLM响应和人类患者响应,因此减法分析的输入在各基质之间具有可比性。在LLM侧,分析限于未受扰动的模型已经正确命名的项目。将完整的175项PNT在无扰动情况下施测于LLaVA-1.6-Vicuna-13B,其在基线时正确命名的158个项目定义了分析集;所有扰动条件都在这158个项目上评分。理由是一个在基线时模型就失败的项目无法为扰动的效果提供信息。

相似文章

从失语症图片命名错误特征中恢复大型语言模型的病灶参数

arXiv cs.CL

本文探讨能否从LLaVA-Vicuna 13B的失语症图片命名错误特征中恢复病灶参数。作者发现扰动强度可恢复,而层索引仅能近似恢复,反事实保真度为81.4%,且对卒中幸存者的泛化具有综合征区分性,这表明Transformer各层之间存在功能冗余。