大语言模型中生命性概念的定位:追踪生命性概念的回路

arXiv cs.CL 论文

摘要

本文研究大语言模型是否具有处理生命性概念的局部因果机制,通过在最小对上进行电路发现;他们发现了一个分布式的且仅部分泛化的生命性电路。

arXiv:2607.20995v1 公告类型:新 摘要:区分书面语言中的有生命和无生命概念不仅仅需要浅层文本处理,还涉及识别复杂的选择性约束和上下文线索,例如动词与论元的交互。然而,当前的大语言模型(LLMs)似乎能够做到这一点。我们研究了LLMs这种对生命性敏感的行为是否可以追溯到一组局部因果相关的组件和连接。为此,我们构建了一个受控的最小对数据集,并在四个开放权重模型上进行电路发现。通过深入的实验和消融研究,我们证明了这些模型中确实存在负责处理生命性的因果机制,从而发现了生命性电路。同时,与其他已知电路相比,该电路似乎更不局部化,并且仅在部分模型和生命性任务上泛化,证实了生命性概念具有分布式、上下文依赖以及一定程度分级的特性。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:18

# 大型语言模型中有生性概念的位置:追溯有生性概念回路 来源:https://arxiv.org/html/2607.20995 Samuele Punzo¹,Giovanni Cinà²,³,\*,Sandro Pezzelle³,\* ¹阿姆斯特丹大学信息学研究生院 ²阿姆斯特丹大学医学中心医学信息学系 ³阿姆斯特丹大学语言逻辑与计算研究所(ILLC) \*共同监督 通讯作者:samuele\.punzo@student\.uva\.nl (https://arxiv.org/html/2607.20995v1/mailto:email@domain) ###### 摘要 在书面语言中区分有生与无生概念,需要识别复杂的选限约束和语境线索,例如动词-论元交互,这超越了浅层文本处理的范畴。然而,当前的大型语言模型似乎具备这种能力。我们探究了LLM这种对有生性敏感的行为是否可以追溯到一组局部的因果相关组件和连接。为此,我们构建了一个受控的最小对数据集,并在四个开放权重模型上进行了回路发现。通过深入的实验和消融研究,我们表明这些模型中确实存在处理有生性的因果机制,从而发现了一个有生性回路。同时,该回路相比其他已知回路显得更加非局域化,且仅在模型和有生性任务上部分泛化,这证实了有生性概念具有分布式、语境依赖和一定程度渐变性的本质。大型语言模型中有生性概念的位置:追溯有生性概念回路 Samuele Punzo¹,Giovanni Cinà²,³,\*,Sandro Pezzelle³,\* ¹阿姆斯特丹大学信息学研究生院 ²阿姆斯特丹大学医学中心医学信息学系 ³阿姆斯特丹大学语言逻辑与计算研究所(ILLC) \*共同监督 通讯作者:samuele\.punzo@student\.uva\.nl (https://arxiv.org/html/2607.20995v1/mailto:email@domain) 见附图说明 图1:回路发现与评估流程。AVG_LD是用于定义任务的平均logit差异指标。 ## 1 引言 大型语言模型(LLM)在广泛的各类语言现象上展现出令人印象深刻的能力,这引发了一个问题:它们是否也捕获了超越语言表面的复杂概念区分。与语法任务不同,有生性——即实体是否存活、具有感知能力或能够进行有意行动(Coopmans,1983 (https://arxiv.org/html/2607.20995#bib.bib19))——通常不通过任何可见特征来指示。然而,有生性影响句法结构,因为有生实体常被优先置于主语和施事位置(Caplan 等,1994 (https://arxiv.org/html/2607.20995#bib.bib44));影响题元角色分配,例如在“The dog chased the ball”中,有生名词是更合理的施事者(MacWhinney 等,1984 (https://arxiv.org/html/2607.20995#bib.bib24));影响选择偏好,例如在“The surgeon examined the patient”中(Paczynski and Kuperberg,2012 (https://arxiv.org/html/2607.20995#bib.bib45));以及影响共指,例如在“The dog chased the ball because it was red”中,“it”自然指向无生名词(Bader 等,2023 (https://arxiv.org/html/2607.20995#bib.bib46))。因此,测试有生性理解的理想场景是句子补全。预测一个未完成的句子是否应该用有生或无生概念继续,需要模型理解复杂的选限约束和语境线索,如动词-论元交互。例如,前缀“The bridge was inspected by the”很可能后接有生名词,如“engineer”;而“The bridge was flooded by the”则偏向无生承接,即名词“storm”。先前的研究使用类似的实验范式研究LLM中的有生性理解,主要集中在行为评估(Coll Ardanuy 等,2020 (https://arxiv.org/html/2607.20995#bib.bib32))以及基于惊奇度或表示的分析(Hanna 等,2023a (https://arxiv.org/html/2607.20995#bib.bib30);Kauf 等,2023 (https://arxiv.org/html/2607.20995#bib.bib33))。虽然这些工作富有洞见,但并未考察模型处理有生性理解背后潜在的因果机制。这留下了一个悬而未决的问题:是否存在一组专用的模型组件——一个有生性回路——在因果上负责这一能力?我们通过探究三个主要问题来弥补这一空白:首先,有生性敏感的补全行为是否由一个局部的回路支持,即相对较小的一组模型组件和边?其次,该回路在因果上是否充分且必要?第三,该回路能否在模型之间以及在有生性任务的相关变体上泛化?为研究这些问题,我们构建了一个受控的最小对数据集,旨在隔离有生性敏感的承接偏好(即评估模型更倾向于用有生还是无生概念继续句子,见上例)。遵循机制可解释性的现代方法,我们通过带积分梯度的边归因修补(EAP-IG;Hanna 等,2024 (https://arxiv.org/html/2607.20995#bib.bib9))在四个开放权重的语言模型上进行回路发现:GPT-2 Small、Llama 3.2 3B、Gemma 3 4B 和 Qwen 3 4B(Team 等,2025 (https://arxiv.org/html/2607.20995#bib.bib5);Yang 等,2025 (https://arxiv.org/html/2607.20995#bib.bib6);Grattafiori 等,2024 (https://arxiv.org/html/2607.20995#bib.bib7);Radford 等,2019 (https://arxiv.org/html/2607.20995#bib.bib8))。图1 (https://arxiv.org/html/2607.20995#S0.F1) 总结了从数据集构建、基于指标的过滤到回路发现与迁移评估的完整流程。对于每个模型,我们都识别出了一个对有生性充分且必要的回路,以恢复任务上的行为。然而,我们的分析表明,这些回路不应被解释为通用的有生性回路。事实上,它们向相关有生性设置的迁移在不同数据集和模型上表现不均,表明它们部分受限于特定任务和数据。这些结果指向一个更细致的图景:有生性敏感的行为在机制上是结构化的,并且可以在语言模型内部局部化,但作为复杂的语义现象,有生性可能无法通过一个在多种设置下统一泛化的单一回路来捕获。数据集和代码可通过此链接 (https://github.com/SamuelePunzo/animacy-circuit) 获取。 ## 2 相关工作 ### 2.1 语言学与认知中的有生性 有生性是人类认知和语言中的一个核心语义概念,区分了那些有生命、有施动性、能够有意行动的实体和那些不具备这些特征的实体。从语言学和认知神经科学的角度都对其进行了研究。语言学研究表明,有生性塑造了语法结构和句子理解(Coopmans,1983 (https://arxiv.org/html/2607.20995#bib.bib19);MacWhinney 等,1984 (https://arxiv.org/html/2607.20995#bib.bib24);Kathryn Bock and Warren,1985 (https://arxiv.org/html/2607.20995#bib.bib25);Gregorio 等,2025 (https://arxiv.org/html/2607.20995#bib.bib2));而认知和神经科学工作提示,在感知、记忆和语义知识中,有生和无生实体被区别对待(Caramazza and Shelton,1998 (https://arxiv.org/html/2607.20995#bib.bib27);New 等,2007 (https://arxiv.org/html/2607.20995#bib.bib28);Nairne 等,2013 (https://arxiv.org/html/2607.20995#bib.bib29))。有生性层级(Coopmans,1983 (https://arxiv.org/html/2607.20995#bib.bib19))捕捉了人类、动物和无生实体在不同语法系统中有差异地表现的趋势,影响着论元实现、格标记和语序等现象。最近的跨语言工作进一步表明,有生性在跨语言的语法结构中发挥着系统性的作用(Gregorio 等,2025 (https://arxiv.org/html/2607.20995#bib.bib2);Li 等,2026 (https://arxiv.org/html/2607.20995#bib.bib43))。行为学工作也显示,有生性引导着题元角色分配和句子处理:有生实体更可能被解释为施事者,并且在主语或首提及位置更易被处理(MacWhinney 等,1984 (https://arxiv.org/html/2607.20995#bib.bib24);Kathryn Bock and Warren,1985 (https://arxiv.org/html/2607.20995#bib.bib25);Traxler 等,2002 (https://arxiv.org/html/2607.20995#bib.bib26))。 ### 2.2 大型语言模型中的有生性 与许多其他现象不同,有生性敏感的行为无法仅凭局部的语法和词汇线索来解决。这要求模型有效地使用上下文语义信息。早期关于词嵌入的研究发现,有生性是一个难以从纯粹分布表示中可靠恢复的语义属性(Lucy and Gauthier,2017 (https://arxiv.org/html/2607.20995#bib.bib31))。Hanna 等人(2023a (https://arxiv.org/html/2607.20995#bib.bib30))最近的 work 表明,Transformer语言模型对有生性相关的选择约束是敏感的,无论是典型情况,还是在通常情况下无生实体被赋予有生性质的上下文中。对其他上下文语言模型的分析同样表明,有生性相关信息可能被编码在内部表示中(Coll Ardanuy 等,2020 (https://arxiv.org/html/2607.20995#bib.bib32)),并可能影响模型在句法或语义预测任务上的行为(Kauf 等,2023 (https://arxiv.org/html/2607.20995#bib.bib33))。然而,目前为止尚无工作研究LLM内部是否存在专门的有生性编码机制。我们的工作首次探索了这一点。 ### 2.3 回路发现 机制可解释性的近期工作发展了一系列技术,用于研究语言模型如何在内部实现特定行为。这些方法不是仅通过输入-输出行为处理模型,而是分析其组件和组件间连接的作用(Olah 等,2020 (https://arxiv.org/html/2607.20995#bib.bib36);Elhage 等,2021 (https://arxiv.org/html/2607.20995#bib.bib37))。这些技术已应用于多种与自然语言处理相关的现象,包括间接宾语识别(IoI)(Wang 等,2022 (https://arxiv.org/html/2607.20995#bib.bib15))、事实关联存储与编辑(Meng 等,2023 (https://arxiv.org/html/2607.20995#bib.bib42))、前馈关键值记忆机制(Geva 等,2021 (https://arxiv.org/html/2607.20995#bib.bib20))以及数值比较(Hanna 等,2023b (https://arxiv.org/html/2607.20995#bib.bib14))。该框架中的一种方法是回路发现。回路是模型组件和连接的一个子图,负责目标行为(Olah 等,2020 (https://arxiv.org/html/2607.20995#bib.bib36);Elhage 等,2021 (https://arxiv.org/html/2607.20995#bib.bib37))。在Transformer语言模型中,回路发现旨在识别那些在因果上对给定输出有贡献的注意力头、MLP层或有向边。这通常通过对激活值或边的干预来实现。激活修补将一个干净输入的激活值替换为来自损坏对应物的激活值,并测量对输出的影响(Wang 等,2022 (https://arxiv.org/html/2607.20995#bib.bib15);Conmy 等,2023 (https://arxiv.org/html/2607.20995#bib.bib23)),但这可能计算开销很大。更可扩展的替代方案用梯度近似修补:归因修补使用一阶泰勒近似(Nanda,2023 (https://arxiv.org/html/2607.20995#bib.bib13)),而边归因修补(EAP)将此思想应用于组件之间的有向连接(Syed 等,2024 (https://arxiv.org/html/2607.20995#bib.bib11))。最近的方法通过EAP-IG中的积分梯度(Hanna 等,2024 (https://arxiv.org/html/2607.20995#bib.bib9))或避免饱和效应的自适应积分路径(Zhang 等,2025 (https://arxiv.org/html/2607.20995#bib.bib22))提高了这些分数的忠实度。最近的工作还强调,一个被发现的回路的可靠性取决于它如何被评估。基于修补方法恢复的回路可能强烈依赖于用于定义行为的数据集、任务指标以及干净的-损坏的对比(Mueller,2024 (https://arxiv.org/html/2607.20995#bib.bib18);Zhang and Nanda,2024 (https://arxiv.org/html/2607.20995#bib.bib4);Hanna 等,2026 (https://arxiv.org/html/2607.20995#bib.bib16))。因此,单一设置下的高忠实度并不一定意味着一个鲁棒或任务通用的机制。基于此,我们将回路发现作为第一步:在用EAP-IG¹识别候选有生性回路后,我们通过充分性、必要性、随机边对照、跨发现样本的稳定性以及向相关任务变体的迁移来评估它们。 ## 3 方法 ### 3.1 数据 为了研究模型是否通过专用机制表示有生与无生概念,我们需要一个数据集,在确保语义合理性的同时,提供两者间的受控对比。现有数据集不能完全满足这些要求。例如,BLiMP subject_passive(Warstadt 等,2020 (https://arxiv.org/html/2607.20995#bib.bib1))包含诸如“Amanda was respected by some waitresses”与“Amanda was respected by some picture”这样的句子对,其中有生对比只出现在最后一个 token 上。这与激活/归因修补不兼容:如果我们处理完整的句子,对比性名词已经存在于输入中,因此没有一个我们可以比较概率的目标。因此,我们不得不用共享的前缀“Amanda was respected by some”,但这个前缀在两个BLiMP条目中是相同的,意味着干净和损坏的输入没有有生对比可供修补。类似地,Gregorio 等人(2025 (https://arxiv.org/html/2607.20995#bib.bib2))提供了语义上有意义的句子,跨越了多个有生性程度(按层级排序:人类 → 想象生物 → 动物 → 植物/细菌 → 无生),但不提供适合回路发现的最小对结构。因此,我们构建了一个新数据集,旨在同时提供强烈的有生-无生对比和语义上合理的前缀。我们使用模板: > “The \[patient\] was \[verb p.p.\] by the” 其中患者(patient)和过去分词动词(verb)按照以下程序填充。为了创建语义有效的句子,我们要求一个LLM(GPT 5.4 OpenAI (2026 (https://arxiv.org/html/2607.20995#bib.bib47)))为多个语义类别生成患者和动词的联合集合(以下称为语义框架)。然后我们手动检查每个框架以验证其正确性和一致性;随后,我们一个框架一个框架地填充句子模板(详见附录A (https://arxiv.org/html/2607.20995#A1))。对于每个框架,我们用每个患者和来自animate_verbs × inanimate_verbs的每一对来实例化模板。这产生两个匹配的前缀,其中p是患者名词,v_an,v_in分别是有生和无生动词: clean: “The {p} was {v_an} by the” corrupt: “The {p} was {v_in} by the” \begin{array}[]{lll}\textsc{clean}:&\`\`\textit{The }\{p\}\textit{ was}\;\{v_{an}\}\textit{ by the}\text{''}\\ \textsc{corrupt}:&\`\`\textit{The }\{p\}\textit{ was}\;\{v_{in}\}\textit{ by the}\text{''}\end{array}

相似文章

架构而非规模:大语言模型中的电路局部化

arXiv cs.CL

本文挑战了“随着模型规模扩大,机制可解释性变得愈发困难”的假设,表明架构(特别是分组查询注意力与多头注意力之间的差异)对电路局部化和稳定性的影响比参数量更为关键。

Anthropic 研究 - 语言模型中的全局工作空间

Reddit r/singularity

Anthropic的新论文提供了证据,表明像Claude这样的现代语言模型已经发展出一种可报告、可控制且用于灵活推理的‘全局工作空间’(J空间),这与自动处理不同。

大语言模型中涌现模块化认知架构

arXiv cs.AI

本文研究模块化认知架构是否在大语言模型中涌现,发现大语言模型发展出专门化的神经网络,反映了人脑在认知领域的组织结构,表明模块化是智能系统的一个基本属性。

信念还是电路?上下文图学习的因果证据

arXiv cs.AI

本文使用主成分分析(PCA)和激活补丁等机制可解释性方法,在一个图随机游走任务上探究了大型语言模型是通过潜在结构推断还是局部模式匹配来进行上下文学习。