点火指数:测量语言模型中的全局工作空间动态

arXiv cs.AI 论文

摘要

本文介绍了点火指数(Ignition Index),一种用于测量语言模型中全局工作空间动态的度量指标,已在多种架构和任务上得到验证,显示出对类似点火的表征转换的选择性检测。

arXiv:2608.05160v1 公告类型:新 摘要:我们引入了点火指数(Ignition Index,I),这是一个经过验证的标量度量,将全局工作空间理论(GWT)的全或无点火预测操作化应用于Transformer语言模型。该度量对逐层线性探针准确率(作为输入信号强度的函数)拟合四参数Sigmoid函数,提取陡峭参数β-hat:高值表示突变的、类似点火的转变;低值表示渐进式累积。在涵盖五个架构家族的11个模型中,打乱标签的对照实验表明,该度量对真实语言结构的选择性比虚假探针能力高9.6倍(p < 0.001,Mann-Whitney U检验)。我们发现:(1)前馈Transformer在聚合β-hat上比SSM高89%(p < 1e-13,Cohen's d = 0.52),其中Mamba表现出近乎线性的曲线,与缺乏全局广播一致。(2)Huginn-3.5B在其迭代轴上的点火强度比深度轴高2.12倍,表明循环架构在循环维度上表现出类似工作空间的转变。(3)Pythia-410M在训练步骤256(+67%)处表现出PELT检测到的相变,先于归纳头的形成。(4)关于点火与模型规模及信号强度相关的假设未得到证实,这表明Transformer架构可能已饱和了可用的点火机制。点火指数首次在GWT的动力学预测与机制可解释性之间建立了经过验证的定量桥梁,其测量选择性达9.6倍,并具有扩展文献中此前未表征的架构级区分度。代码:https://github.com/saman-rahbar/ignition-index
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:45

# 点火指数:测量语言模型中的全局工作空间动态  
来源:https://arxiv.org/html/2608.05160  
###### 摘要  
我们引入了点火指数(Ignition Index)\(\mathcal{I}\),这是一个经过验证的标量指标,将全局工作空间理论(\(gwt\))的全有全无点火预测操作化到 transformer 语言模型中,并通过严格的控制实验证明了其测量选择性。该指标将四参数 sigmoid 函数拟合到逐层线性探针准确率(作为输入信号强度的函数),提取陡峭度参数 \(\hat{\beta}\):高值表示突变的、类似点火的表征转变;低值表示渐进的积累过程。在跨越五个架构家族和七项语言探针任务的 11 个模型中,打乱标签对照验证了点火指数能够选择性地捕捉真实的语言结构,而非虚假的探针能力:真实转变产生 \(\overline{\hat{\beta}}=113.1\),而打乱标签对照产生 \(\overline{\hat{\beta}}=11.8\),两者相差 9.6 倍(\(p<0.001\),Mann-Whitney \(U\) 检验),证明了测量选择性。应用这一经过验证的框架检验与 GWT 预测相关的预注册假设,我们发现:(1)架构可区分性:基于注意力的 transformer 显示出比状态空间模型更高的点火指数——前馈架构 \(\overline{\hat{\beta}}=130.0\) 超过 SSM 的 \(\overline{\hat{\beta}}=68.7\) 达 89%(\(p<10^{-13}\),Cohen's \(d=0.52\)),其中 Mamba 呈现接近线性的逐层分布,与缺失工作空间广播一致。(2)循环架构中的轴依赖点火:Huginn-3.5B 的深度循环架构表现出迭代轴点火(\(\hat{\beta}_{\text{iteration}}=234.8\)),超过其深度轴分布(\(\hat{\beta}_{\text{depth}}=111.0\))2.12 倍,表明循环架构在循环维度而非深度轴上表现出类似工作空间的转变。(3)训练时相变:Pythia-410M 在训练步骤 256 处出现 PELT 检测到的变点(前:\(\hat{\beta}=39.57\);后:\(\hat{\beta}=66.02\),+67%),早于归纳头形成,与初始表征巩固阶段一致。(4)校准预期:将点火强度与模型规模和信号强度联系起来的假设未得到证实,表明 GWT 对齐的动态并不单调地追随这些因素,且当前的 transformer 架构可能已饱和了可用的点火机制。点火指数首次提供了 GWT 动态预测与机制可解释性之间经过验证的定量桥梁,产生了一个具有 9.6 倍选择性的原则性架构级判别器,并揭示了缩放文献中尚未表征的训练阶段转变。  
## 1 引言  
是什么将全局整合信息的架构与局部、顺序处理信息的架构区分开来?全局工作空间理论(\(gwt\))(Baars,1988(https://arxiv.org/html/2608.05160#bib.bib2);Dehaene 等人,1998(https://arxiv.org/html/2608.05160#bib.bib5);Dehaene 和 Changeux,2011(https://arxiv.org/html/2608.05160#bib.bib7))给出了一个精确的动态回答:具有全局广播机制的系统会产生*全有全无点火*——一种阈值非线性转变,其中刺激表征跨越临界阈值,并变得对所有下游处理器全局可用。这种点火已在皮层记录中被定量测量为神经响应幅度随刺激强度变化的陡峭 sigmoid 函数(Del Cul 等人,2007(https://arxiv.org/html/2608.05160#bib.bib9)),其陡峭度 \(\beta\) 区分了意识通达加工与阈下前馈加工。Transformer 语言模型表现出与 GWT 工作空间惊人的架构相似性:残差流(Elhage 等人,2021(https://arxiv.org/html/2608.05160#bib.bib22))充当共享通信通道;注意力头实现内容依赖的全局路由(Olsson 等人,2022(https://arxiv.org/html/2608.05160#bib.bib24);Wang 等人,2023(https://arxiv.org/html/2608.05160#bib.bib25));线性探针揭示了跨层堆栈的渐进信息积累(Tenney 等人,2019(https://arxiv.org/html/2608.05160#bib.bib39))。然而,一个基本的动态问题仍然*未被测量*:transformer 的逐层信息积累是否表现出类似点火的阈值非线性,以及这种非线性是否随架构系统性地变化?这个问题之所以重要,有两个原因。首先,从架构上看,基于注意力的 transformer(前馈和循环深度)与状态空间模型(Mamba)的差异恰恰在于 GWT 所识别的全局广播关键特征:内容依赖的全对全路由。如果点火动态追踪这一特征,那么点火指数就为类似工作空间和非类似工作空间架构之间提供了一个原则性的判别器——这对架构搜索和表征转变的可解释性具有重要意义。其次,从经验上看,transformer 训练表现出尖锐的相变(Olsson 等人,2022(https://arxiv.org/html/2608.05160#bib.bib24);Nanda 等人,2023(https://arxiv.org/html/2608.05160#bib.bib28)),而这些相变与表征动态的关系尚不清楚。一个对类似点火转变敏感的指标可以揭示这些转变何时以及如何在层堆栈中巩固。  
#### 在本文中,我们通过以下方式引入点火指数(Ignition Index)\(\mathcal{I}\):(1)通过受控 token 损坏和嵌入噪声改变输入信号强度 \(s\in[0,1]\);(2)通过 TransformerLens(Nanda 和 Bloom,2022(https://arxiv.org/html/2608.05160#bib.bib37))提取逐层残差流状态;(3)在每一层训练线性探针以解码任务相关信息;(4)将四参数 sigmoid 函数拟合到层准确率曲线 \(\mathrm{Acc}(\ell,s)\) 并提取 \(\hat{\beta}\) 作为转变陡峭度。我们在跨越五个家族的 12 个模型上评估了 \(\mathcal{I}\)——GPT-2(Radford 等人,2019(https://arxiv.org/html/2608.05160#bib.bib16))、Pythia(Biderman 等人,2023(https://arxiv.org/html/2608.05160#bib.bib17))、Gemma 2(Gemma Team 等人,2024(https://arxiv.org/html/2608.05160#bib.bib18))、Huginn-3.5B(Geiping 等人,2025(https://arxiv.org/html/2608.05160#bib.bib19))和 Mamba(Gu 和 Dao,2023(https://arxiv.org/html/2608.05160#bib.bib20))——并发现 \(\mathcal{I}\) 能可靠地区分基于注意力的架构与状态空间架构(\(p<10^{-13}\)),循环深度处理不会将点火放大到标准前馈注意力之上,并且点火结构中的训练时相变先于已被充分表征的归纳头形成步骤。  
#### 我们的贡献如下:  
1. 打乱标签验证:9.6 倍的选择性差距(\(p<0.001\),Mann-Whitney \(U\) 检验),表明点火指数捕捉的是真正的语言结构,而非虚假的探针能力(§7(https://arxiv.org/html/2608.05160#S7))。  
2. 点火指数 \(\hat{\beta}\):一个具有理论依据、可证伪的指标,用于衡量任何具有层结构的模型中类似 GWT 的表征转变(§4(https://arxiv.org/html/2608.05160#S4))。¹¹¹代码与数据:https://github.com/saman-rahbar/ignition-index  
3. 架构可区分性:前馈架构(\(\overline{\hat{\beta}}=130.0\))与 SSM 家族(\(\overline{\hat{\beta}}=68.7\))之间 89% 的差距,且 Mamba 呈现近线性分布,与缺失全局广播一致。对 Huginn-3.5B 的迭代轴探针显示循环维度上的点火强度高出 2.12 倍,证明了轴依赖的架构模式(§8(https://arxiv.org/html/2608.05160#S8))。  
4. 在 Pythia-410M 的训练步骤 256 处发现新的训练时相变,早于归纳头形成(§8.5(https://arxiv.org/html/2608.05160#S8.SS5))。  
5. Sigmoid 天花板稳健性:排除天花板命中后,FF–SSM 差距扩大至 2.12 倍,确认架构差距并非 sigmoid 拟合伪影(§7(https://arxiv.org/html/2608.05160#S7))。  
6. 一个完整、开源的实验协议——激活提取、探针训练、sigmoid 拟合、bootstrap 置信区间、统计检验——涵盖五个架构家族(§6(https://arxiv.org/html/2608.05160#S6))。  
## 2 相关工作  
#### 探针 Transformer 表示。  
线性分类器探针(Alain 和 Bengio,2017(https://arxiv.org/html/2608.05160#bib.bib38))刻画了 transformer 每一层编码了哪些信息。Tenney 等人(Tenney 等人,2019(https://arxiv.org/html/2608.05160#bib.bib39))表明语言特征在 BERT 中的不同深度达到峰值。Belinkov(Belinkov,2022(https://arxiv.org/html/2608.05160#bib.bib43))区分了*编码了什么*(探针)与*因果上使用了什么*——我们通过失忆探针(amnesic probing)(Elazar 等人,2021(https://arxiv.org/html/2608.05160#bib.bib42))来弥合这一差距。Voita 和 Titov(Voita 和 Titov,2020(https://arxiv.org/html/2608.05160#bib.bib41))引入了避免过拟合的 MDL 探针。  
#### Transformer 中的相变。  
Olsson 等人(Olsson 等人,2022(https://arxiv.org/html/2608.05160#bib.bib24))记录了归纳头形成中的尖锐训练时相变。Nanda 等人(Nanda 等人,2023(https://arxiv.org/html/2608.05160#bib.bib28))完整地逆向工程了顿悟(grokking)转变。Schaeffer 等人(Schaeffer 等人,2023(https://arxiv.org/html/2608.05160#bib.bib44))表明许多明显的涌现能力是度量伪影——我们通过连续探针指标来应对这一威胁。Brinkmann 等人(Brinkmann 等人,2025(https://arxiv.org/html/2608.05160#bib.bib45))记录了前向传播内部的抽象相变。  
#### 人工系统中的 GWT。  
Bengio(Bengio,2017(https://arxiv.org/html/2608.05160#bib.bib48))提出了意识先验(Consciousness Prior)作为源自 GWT 的归纳偏置。Goyal 和 Bengio(Goyal 和 Bengio,2022(https://arxiv.org/html/2608.05160#bib.bib49))实现了一个显式的全局潜在工作空间(Global Latent Workspace)。Butlin 等人(Butlin 等人,2023(https://arxiv.org/html/2608.05160#bib.bib50))根据意识指标属性评估了 AI 系统。VanRullen 和 Kanai(VanRullen 和 Kanai,2021(https://arxiv.org/html/2608.05160#bib.bib51))以及 Butlin 等人(Butlin 等人,2023(https://arxiv.org/html/2608.05160#bib.bib50))提供了 \(gwt\) 与深度学习架构之间的结构映射。这些工作都没有测量标准 transformer 前向传播中的点火动态。  
#### 机制可解释性与稀疏自编码器。  
Elhage 等人(Elhage 等人,2021(https://arxiv.org/html/2608.05160#bib.bib22))建立了残差流框架。Meng 等人(Meng 等人,2022(https://arxiv.org/html/2608.05160#bib.bib26))引入了因果追踪。Conmy 等人(Conmy 等人,2023(https://arxiv.org/html/2608.05160#bib.bib27))形式化了自动电路发现。Geiger 等人(Geiger 等人,2025(https://arxiv.org/html/2608.05160#bib.bib31))发展了因果抽象。Marks 等人(Marks 等人,2024(https://arxiv.org/html/2608.05160#bib.bib29))引入了稀疏特征电路。Lindsey 等人(Lindsey 等人,2025(https://arxiv.org/html/2608.05160#bib.bib30))将归因图追踪应用于 Claude 3.5 Haiku。B

相似文章

Anthropic 研究 - 语言模型中的全局工作空间

Reddit r/singularity

Anthropic的新论文提供了证据,表明像Claude这样的现代语言模型已经发展出一种可报告、可控制且用于灵活推理的‘全局工作空间’(J空间),这与自动处理不同。

可言语化的表征构成语言模型中的全局工作空间

arXiv cs.AI

本文提供证据表明,语言模型维护着一套特权的内部表征(J-space),这些表征是可言语报告的,并且像全局工作空间一样运作,同时引入了雅可比透镜(Jacobian lens)可解释性技术。研究结果为模型认知提供了一个窗口,并对对齐与安全性具有启示意义。

可语言化的表征在语言模型中构成全局工作空间

Reddit r/artificial

本文提供的证据表明,语言模型维持一组特权的内部表征(称为'可语言化的表征'),这些表征构成一个全局工作空间,类似于人类的意识访问,并介绍了用于识别和干预这些表征的新可解释性技术。