大型语言模型的Fisher–Rao信息几何是共享、可学习且可控的

arXiv cs.LG 论文

摘要

本文利用Fisher–Rao几何证明,大型语言模型共享可通过学习与控制获得的行为结构,从而支持迁移学习和最小干扰干预。

arXiv:2609.11063v1 Announce Type: new 摘要:大型语言模型学习到相似的行为模式,但其共享的结构本质以及如何在不干扰其他行为的前提下修改特定行为仍不明确。基于下一词元概率的Fisher-Rao几何理论将这两个问题联系起来:行为在输出保持对称性下唯一确定该几何结构,而激活几何则依赖于坐标选取。在Transformer、状态空间和循环神经网络模型中,输出几何的相似性显著高于激活几何,且共享几何支持语义类别的跨领域迁移。模型对人类选词的预测准确性、规模与训练程度均影响这种一致性,并在仅模型校准后进一步提升。词元概率与读出几何共同预测了特征谱及其有效维度。受控语言分配实验显示,该几何特性在不同架构间遵循语言分布规律。预训练语料统计量无需重新校准即可预测未接触事实的获取效率,而随机实验表明更深度的证据会显著延迟所有测试架构与证据构建方式下的事实获取。最后,该几何理论规定了最小干扰的局部干预方案,预测了干预的相对成本,并支持可复用的控制:在源提示词上学到的模型更新可迁移至未见过的提示词,并在保持参考提示词行为方面优于欧几里得控制。相同的几何校正方法还能提升模型导向、编辑、归因、词典学习与微调的性能。
查看原文
查看缓存全文

缓存时间: 2026/09/11 08:27

# 大型语言模型的信息几何是共享、可学习且可控的
来源:https://arxiv.org/html/2609.11063 \\SetLinkTargetFilter main\-\#1 Dario Picozzi附属机构:伦敦大学学院 (UCL) 物理学与天文学系,附属机构:英国伦敦高尔街 WC1E 6BT,附属机构:伦敦纳米技术中心,英国伦敦戈登街 19 号 WC1H 0AH,电子邮件:[picozzi\.dario@gmail\.com](mailto:)

###### 摘要
大型语言模型会学习相似的行为,但它们共享何种结构,以及如何在不干扰其他行为的情况下改变某一行为,目前仍不清楚。下一token概率的Fisher–Rao几何将这两个问题联系起来:行为在输出保持对称的意义上决定了该几何,而激活几何则依赖于坐标。在Transformer、状态空间和循环模型中,输出几何的一致性远强于激活几何,且共享的几何支持语义类别的迁移。与人类词汇选择的一致性随预测准确性、模型规模和训练程度的提高而增加,并在仅模型校准后进一步提升。token概率和读出几何共同预测了谱及其有效维度。受控的语言赋值表明,几何遵循跨架构的语言定律。预训练语料库统计无需重新校准即可预测未见事实的获取,而随机化实验表明,在所有测试的架构和证据构造中,更深层的证据会显著延迟获取。最后,几何规定了最小扰动的局部干预措施,预测其相对成本,并支持可重用的控制:在供体提示上学习的更新可迁移到未见提示上,同时比欧几里得控制更好地保留参考提示上的行为。相同的几何校正可改进引导、编辑、归因、字典学习和微调。

语言模型的预测行为并不为其内部激活赋予任何坐标系的特权:相同的输入-输出函数可以在任何通过可逆线性变换相关联的坐标系中实现。激活之间的欧几里得距离在这些重参数化下不是不变的,然而欧几里得内积构成了衡量激活距离、特征重要性、引导和微调正则化的常见度量基础。另一方面,模型的下一token概率分布可以保留关于其内部状态和输入的大量信息:在温和条件下,仅解码器Transformer隐藏状态映射几乎必然是单射的1 (https://arxiv.org/html/2609.11063#bib.bib1),并且仅从下一token分布就可以重建大部分输入提示2 (https://arxiv.org/html/2609.11063#bib.bib2), 3 (https://arxiv.org/html/2609.11063#bib.bib3)。

黎曼度量为空间上的无穷小变化分配局部长度和角度。Chentsov定理表明,保持统计信息不变的变换下的不变性给出了Fisher–Rao度量作为概率分布空间上的唯一规范度量,精确到一个整体比例因子1 (https://arxiv.org/html/2609.11063#as1_bib.bib1), 5 (https://arxiv.org/html/2609.11063#bib.bib5), 6 (https://arxiv.org/html/2609.11063#bib.bib6)。因此,行为空间即使在表示空间不具备特权几何时,也拥有一个特权几何。通过网络反向拉回输出Fisher度量,可以通过激活变化产生的局部输出变化来衡量它。相应的阻尼自然梯度步长在最小化正则化局部输出成本15 (https://arxiv.org/html/2609.11063#as1_bib.bib15), 8 (https://arxiv.org/html/2609.11063#bib.bib8)的同时实现指定的objective变化。相同的几何支持跨模型比较:对于常见上下文,每个模型都给出其下一token分布之间成对Fisher–Rao距离的矩阵。比较这些矩阵无需共享词汇表、架构或激活坐标。这重新诠释了柏拉图表征假设9 (https://arxiv.org/html/2609.11063#bib.bib9)背后的趋同现象,将其置于输出几何中,在所述条件下,趋同源于预测拟合而非选择的激活相似性度量10 (https://arxiv.org/html/2609.11063#bib.bib10), 11 (https://arxiv.org/html/2609.11063#bib.bib11)。激活几何没有可比拟的地位:相同的行为允许具有不同欧几里得激活几何的可逆隐藏状态重参数化,使得激活空间的趋同成为训练的一个经验属性。

基于Fisher信息几何的封闭形式自然梯度步长最近已在激活引导6 (https://arxiv.org/html/2609.11063#as1_bib.bib6), 7 (https://arxiv.org/html/2609.11063#as1_bib.bib7)中得到验证,FishBack扩展到了80亿参数模型。非线性激活空间引导也已被探索14 (https://arxiv.org/html/2609.11063#bib.bib14);表示级引导基线是既定实践13 (https://arxiv.org/html/2609.11063#as1_bib.bib13), 16 (https://arxiv.org/html/2609.11063#bib.bib16), 17 (https://arxiv.org/html/2609.11063#bib.bib17), 18 (https://arxiv.org/html/2609.11063#bib.bib18);下一token预测器的可识别特性已在理论上被表征19 (https://arxiv.org/html/2609.11063#bib.bib19)。关于近似一致性的分析区分了预测接近度与表示相似性,包括基于KL的保证的局限性以及基于logit距离的充分条件20 (https://arxiv.org/html/2609.11063#bib.bib20), 21 (https://arxiv.org/html/2609.11063#bib.bib21)。具有非线性解码器的表示的近似可识别性也已被研究22 (https://arxiv.org/html/2609.11063#bib.bib22)。

相关工作已将下一token统计与表示结构联系起来23 (https://arxiv.org/html/2609.11063#bib.bib23), 24 (https://arxiv.org/html/2609.11063#bib.bib24),识别了塑造几何结构的统计对称性25 (https://arxiv.org/html/2609.11063#bib.bib25),并研究了训练期间的瞬态语义组织26 (https://arxiv.org/html/2609.11063#bib.bib26)。语料库相关性也与层次化语言获取和数据受限损失缩放相关27 (https://arxiv.org/html/2609.11063#bib.bib27), 28 (https://arxiv.org/html/2609.11063#bib.bib28)。其他研究记录了内部表示中的跨模型趋同和跨架构引导迁移29 (https://arxiv.org/html/2609.11063#bib.bib29), 30 (https://arxiv.org/html/2609.11063#bib.bib30)。

在此,我们将这些线索连接到一个由模型输出几何定义的框架中:预测行为确定几何,语言统计预测其结构和获取,并且其测量的各向异性预测跨架构和操作的干预成本。预测行为在保持输出的对称意义下确定了规范输出几何,并明确了恢复误差的界限,而激活几何在可逆重参数化下仍依赖于坐标。在涵盖Transformer、状态空间和循环架构的十个独立训练模型中,已识别的关系几何具有0.88的平均秩一致性,而中间层激活几何的一致性仅为0.62;它们的共享成分支持语义类别迁移。人类补全几何随预测拟合度增加而更接近,并且在一个模型族上拟合的关系可以预测在其他模型族中的一致性。受控的语言赋值因果性地决定了跨架构学习到的几何。token概率和学习的读出结构解释了其谱的互补方面,有效维度无需拟合参数即可预测。在固定的相对阻尼和求解器容差下,阻尼自然梯度求解的最坏情况共轭梯度迭代界限与模型宽度无关。

语料库统计还预测行为何时被获取:在一个随机化的合成语言测试中,将其他相同的事实分配给更深层的统计证据,会将早期获取延迟四倍以上。几何还规定了最小扰动的干预措施。测量的各向异性比率量化了不同激活方向影响输出的不均匀程度,无需拟合参数即可预测它们相对于欧几里得控制的优势。在参考提示上平均度量产生可重用的更新,这些更新可迁移到未见提示,同时减少参考序列的变化。应用相同的校正可改进引导、知识编辑、特征归因、字典学习和微调,脱靶变化减少多达两个数量级。

### 结果
#### 预测行为固定了一个规范的、可识别的输出几何
ab
图1:行为标识了已解析的读出,几何预测局部输出变化。a,行为识别:在重新优化干扰参数后,保持的预测损失随着扰动读出子空间与已解析子空间之间的平方子空间距离线性增长(Pythia 70M–1.4B)。标记是40个模型-条件-角度的平均值,条形跨越两个独立校准的保持集折(小于标记);路径连接每个模型和条件内的角度。绿色,读出偏差;灰色,匹配的随机对照;圆圈,70M;方块,160M;三角形,410M;菱形,1.4B。局部拟合的R²≥0.9999在所有八条路径上成立,匹配的随机对照方向系统地具有更小的损失-距离斜率(斜率比1.14–1.27)。参考子空间是从更强的模型估计的(补充说明)。b,小激活扰动下预测与测量的输出变化。每个点是一个模型-深度-提示组合,给出跨越11个模型、6个家族和四分之一、二分之一和四分之三深度注入的99次测量。预测½δh⊤Gδh使用干预前的度量,没有拟合比例尺。点显示最粗的解析局部步长;颜色标识模型,灰色线标记相等。测量与预测的KL比率中位数为1.000,范围为0.948–1.224(方法;补充说明)。

语言模型的输出是其词汇表上的概率分布。Fisher–Rao度量衡量这种分布之间的局部分离度,并且由于其在充分统计量变换下的不变性,在精确到比例尺的意义上是唯一的1 (https://arxiv.org/html/2609.11063#as1_bib.bib1), 5 (https://arxiv.org/html/2609.11063#bib.bib5), 6 (https://arxiv.org/html/2609.11063#bib.bib6)。令h为在选定干预层处的激活,hL(h)为它产生的最终隐藏状态。将输出定律写作ph=softmax(WUhL(h)+bU),其中unembedding行为wa,Jh=∂hL/∂h,则输出Fisher Hh=Covph(w)定义了(可能退化的)拉回Fisher度量Gh=Jh⊤HhJh在干预层处。对于小干预,KL(ph∥ph+δh)=½δh⊤Ghδh+O(∥δh∥³)。(1)位置下标在下文中省略。该二次型衡量局部输出变化,并在跨越11个模型、6个家族和125M–1.5B参数的99个模型-深度-目标单元格中局部匹配实际散度(中位数比率1.000;图1b),因此几何长度预测行为变化。对于目标梯度q=∇hφ,阻尼自然梯度步长δh∝(G+αR)⁻¹q 15 (https://arxiv.org/html/2609.11063#as1_bib.bib15), 8 (https://arxiv.org/html/2609.11063#bib.bib8)是坐标协变的:在一个种子族激活重参数化上传输它会重现本地方向至<10⁻¹²,而将R重置为单位矩阵会使其变化约一个数量级(扩展数据图1a;补充说明)。与训练的联系是精确的:过量的种群交叉熵等于到模型诱导的Gibbs定律的Kullback–Leibler散度,该定律的条件曲率就是这个输出Fisher度量。因此,下一token训练诱导了几何(补充说明)。该几何也可以仅从行为中识别:预测行为在匹配的秩上选出由语言定义的读出子空间,而不是选择隐藏坐标。令T表示这个已解析的子空间,S为一个候选子空间,d(S,T)为它们的弦距离(衡量子空间分离的标准度量),K(S)为干扰参数被优化后的描述预测风险。在所述的有限支持和逆图条件下,行为识别遵循全局二次边际K(S)≥c d²(S,T)。(2)这里c>0是由参考定律和上下文权重确定的每单位平方子空间位移的预测成本的认证下界(补充说明)。零描述风险因此在匹配的秩上精确识别已解析的子空间。更一般地,有限秩近似和过量预测误差以平方根速率约束恢复,因此同一语言的两个精确匹配秩的模型必须收敛于相同的子空间(补充说明)。保持的描述损失随子空间距离在四个模型大小上呈二次增长(每条路径R²≥0.9999),并且实际读出偏差的增长比匹配随机对照更陡峭(图1a)。在受控干预中,语言定律决定了学习到的几何。在两种容量下的Transformer、门控循环和对角循环模型在已知条件定律、相同token频率和条件熵的八对合成语言上进行训练。在匹配预测准确性下,改变分配的定律恢复了施加的平方几何分离的99%以上,而在定律内改变架构使几何几乎保持不变。分配的定律在所有八对中也是更接近的几何匹配(补充说明)。相比之下,隐藏层的可逆重参数化,在下游补偿,使每个条件定律保持不变:行为标识了已解析的输出几何,而激活几何保留了精确的GL(d)规范自由度,即应用任何可逆线性激活坐标变化的自由度(补充说明)。因此,已解析的输出几何在行为保持的重参数化下是不变的。

#### 独立训练的模型共享该几何
在共同的结果空间上,补充说明中的趋同结果用预测误差约束关系几何差异。此处经验测试了跨tokenizer的本源词汇一致性。对于一组常见的上下文,每个模型定义了其下一token分布之间Fisher–Rao距离的矩阵,并通过矩阵上三角的Spearman相关性比较模型。这询问它们是否将相同的上下文对从近到远排序。

相似文章

语言模型语义空间中的关系几何

arXiv cs.CL

本文探讨了语义关系如何编码在语言模型语义空间的几何结构中,发现非对称关系占据不同区域,且对于因果模型,词汇信息更为重要,而对于掩码和扩散模型,上下文信息更为重要。

大语言模型几何表示鲁棒性评测

arXiv cs.CL

# 大语言模型几何表示鲁棒性评测 来源:[https://arxiv.org/html/2604.16421](https://arxiv.org/html/2604.16421) Vedant Jawandhia 计算机科学与信息系统系,BITS Pilani \{f20220627, dhruv\.kumar, yash\.sinha\}@pilani\.bits\-pilani\.ac\.in Yash Sinha 计算机科学与信息系统系,BITS Pilani \{f20220627, dhruv\.kumar, yash\.sinha\}@pilani\.bits\-pilani\.ac\.in Ankan Pal 数学系,BITS Pilani