从失语症图片命名错误特征中恢复大型语言模型的病灶参数
摘要
本文探讨能否从LLaVA-Vicuna 13B的失语症图片命名错误特征中恢复病灶参数。作者发现扰动强度可恢复,而层索引仅能近似恢复,反事实保真度为81.4%,且对卒中幸存者的泛化具有综合征区分性,这表明Transformer各层之间存在功能冗余。
arXiv:2608.06429v1 公告类型:新
摘要:大型语言模型(LLM)的可解释性方法描述了内部状态,但并未直接检验该状态是否在因果上足以产生观察到的行为。在先前的工作中,我们对LLM进行病灶处理以产生图片命名(评估失语症的核心任务)中的错误特征,并发现特定病灶产生的错误与个别卒中幸存者的错误相似。在此,我们提出相反的问题:给定一个错误特征,能否恢复产生它的病灶参数?这一逆问题揭示了Transformer计算的哪些特性?LLaVA-Vicuna 13B中的病灶通过层索引、修改百分比和噪声sigma进行参数化,共4,840种配置,错误特征则通过七类临床分类法(正确、语义、无关、形式、混合、新词、无反应)进行刻画。我们训练了一个多任务神经网络将错误特征映射回扰动参数。该问题得到了部分解决:在10个独立训练的逆模型中,修改百分比和噪声sigma可恢复,而层索引仅能在邻域内恢复。在反事实验证中,使用恢复参数扰动的新模型实例在81.4%的情况下重现了目标行为。低层恢复能力与高反事实保真度之间的这种分离与Transformer层间的功能冗余一致,而这一特性是标准可解释性方法无法捕捉的。作为分布外测试,我们将训练后的模型应用于278名卒中幸存者的图片命名错误特征;恢复的参数具有综合征区分性,尤其在扰动强度方面最为显著,表明模型已泛化到训练分布之外。反事实验证为LLM可解释性主张提供了超越逆映射的通用框架。
查看缓存全文
缓存时间: 2026/08/10 08:01
# 从失语症图片命名错误特征中恢复大语言模型的损伤参数 来源:https://arxiv.org/abs/2608.06429 作者:Yong Yang (https://arxiv.org/search/cs?searchtype=author&query=Yang,+Y), Roger Newman-Norlund (https://arxiv.org/search/cs?searchtype=author&query=Newman-Norlund,+R), Xiang Guan (https://arxiv.org/search/cs?searchtype=author&query=Guan,+X), Saeed Ahmadi (https://arxiv.org/search/cs?searchtype=author&query=Ahmadi,+S), Regan Willis (https://arxiv.org/search/cs?searchtype=author&query=Willis,+R), Nadra Salman (https://arxiv.org/search/cs?searchtype=author&query=Salman,+N), Kalil Warren (https://arxiv.org/search/cs?searchtype=author&query=Warren,+K), Sophie Arheix-Parras (https://arxiv.org/search/cs?searchtype=author&query=Arheix-Parras,+S), Srihari Nelakuditi (https://arxiv.org/search/cs?searchtype=author&query=Nelakuditi,+S), Leonardo Bonilha (https://arxiv.org/search/cs?searchtype=author&query=Bonilha,+L), Christopher Rorden (https://arxiv.org/search/cs?searchtype=author&query=Rorden,+C), Rutvik H. Desai (https://arxiv.org/search/cs?searchtype=author&query=Desai,+R+H), Julius Fridriksson (https://arxiv.org/search/cs?searchtype=author&query=Fridriksson,+J) 查看 PDF (https://arxiv.org/pdf/2608.06429) > 摘要:大语言模型(LLM)的可解释性方法描述了内部状态,但并未直接检验该状态是否在因果上足以产生观察到的行为。在先前的工作中,我们对 LLM 进行损伤处理,以生成图片命名(评估失语症的核心任务)中的错误特征,并发现特定损伤产生的错误与个别中风幸存者的错误相似。在此,我们提出逆向问题:给定一个错误特征,能否恢复出产生该特征的损伤参数?这一逆问题揭示了 Transformer 计算的哪些特性?在 LLaVA-Vicuna 13B 中,损伤通过层索引、修改百分比和噪声 sigma 进行参数化,共涉及 4,840 种配置;错误特征则采用七类临床分类法(正确、语义、无关、形式、混合、新词、无反应)来刻画。我们训练了一个多任务神经网络,将错误特征映射回扰动参数。该问题得到了部分解决:在 10 个独立训练的逆向模型中,修改百分比和噪声 sigma 可以恢复,而层索引仅能在邻域内恢复。在反事实验证中,使用恢复出的参数扰动一个全新的模型实例,在 81.4% 的情况下重现了目标行为。这种低层恢复能力与高反事实保真度之间的分离,与 Transformer 层间的功能冗余一致,而这一特性是标准可解释性方法无法捕捉的。作为分布外测试,我们将训练好的模型应用于 278 名中风幸存者的图片命名错误特征;恢复出的参数具有综合征判别性,尤其在扰动强度方面最为显著,表明其泛化能力超出了训练分布。反事实验证为超越逆向映射的 LLM 可解释性主张提供了一个通用框架。 ## 提交历史 来自:Yong Yang [查看电子邮件](https://arxiv.org/show-email/382f819a/2608.06429) **\[v1\]** 2026年8月5日(周三)20:58:49 UTC(2,874 KB)
相似文章
基于扰动的减法映射区域可解释性(PRISM):语言模型与卒中后失语症中的命名错误分离
本文介绍了PRISM,一种用于大型语言模型空间分辨可解释性的基于扰动的方法,将神经影像减法分析适配到Transformer,并平行应用于卒中后失语症患者,以恢复共享的语音优势分离。
大型视觉-语言模型在注意力机制中迷失
这篇研究论文利用信息论分析了大型视觉-语言模型(LVLM)的内部机制,揭示了注意力机制可能存在冗余,而前馈网络才是推动语义创新的关键。作者证明,将学习到的注意力权重替换为随机值仍可获得相当的性能,这表明当前模型“在注意力中迷失”。
大型语言模型中的类人回指消解
本文研究了五个开放权重的大型语言模型在回指消解中是否表现出对心理语言学因素的人类类似敏感性,使用惊奇度和理解准确率作为行为指标。结果显示选择性认知对齐:一些模型在回指消解中匹配了人类的话语敏感性,但对语义干扰效应的敏感性较弱或缺失。
拆解病态捷径:用于忠实LVLM解码的因果框架
本文揭示了大视觉语言模型中的幻觉是由一种动态结构错位引起的,其中某些注意力头充当风险中介,与视觉证据解耦,转而锁定语言先验。作者提出了Fox,一种无需训练的因果干预框架,能够诊断并物理切断这些病态捷径,在忠实解码中实现了最先进的性能。
大型语言模型教导视觉学生:细粒度概念知识的跨模态迁移
本文介绍了LaViD框架,该框架通过生成多项选择题作为概念签名,将语义知识从纯语言大语言模型转移到视觉学生模型,实现了优越的细粒度分类性能和鲁棒性。