预训练语言模型嵌入的黎曼几何
摘要
本文介绍了黎曼均值池化(RMP),该方法通过拉回度量利用黎曼几何聚合预训练语言模型的词元嵌入,在句子分类任务上表现出优于欧氏池化的性能。
查看缓存全文
缓存时间: 2026/07/09 07:49
# 预训练语言模型嵌入的黎曼几何
来源:https://arxiv.org/html/2607.07047
Szczepan Konior¹ Alexandre Quemy² Przemysław Klocek¹ Grégoire Cattan¹ Bartłomiej Sobieski³,⁴
¹ IBM 自动化和人工智能,波兰克拉科夫
² Hother,波兰克拉科夫
³ 华沙大学
⁴ 可信人工智能中心,华沙理工大学
\{name\.surname\}@ibm\.com alexandre@hother\.io sobieski\.bartlomiej\.jan@gmail\.com
###### 摘要
理解预训练语言模型嵌入的几何结构对可解释性和安全性至关重要。我们探究句子级分类信号是否存在于上下文令牌嵌入的黎曼几何中,并通过从学习到的编码器的解析雅可比矩阵中提取每个令牌的拉回度量,然后在对称正定(SPD)流形上使用 Fréchet 均值进行聚合来探测它;我们将这个过程称为*黎曼均值池化*(RMP)。在三个具有非平凡语言结构的数据集(CoLA、CREAK、RTE)上,RMP 优于欧几里得均值池化,而在 FEVER-Symmetric(一个为去除注释驱动的词汇伪影而构建的基准测试)上,该方法正确地将性能保持在随机水平。消融实验表明,一个随机初始化的编码器结合 Fréchet 聚合已经在三个承载信号的数据集中的两个上击败了欧几里得池化,将增益的来源定位到几何聚合而非学习到的流形结构;训练过的编码器仅在 CREAK(三个承载信号的数据集中知识密集度最高的那个)上贡献了额外的信号。
黎曼几何用于预训练语言模型嵌入
Szczepan Konior¹ Alexandre Quemy² Przemysław Klocek¹ Grégoire Cattan¹ Bartłomiej Sobieski³,⁴
¹ IBM 自动化和人工智能,波兰克拉科夫
² Hother,波兰克拉科夫
³ 华沙大学
⁴ 可信人工智能中心,华沙理工大学
\{name\.surname\}@ibm\.com alexandre@hother\.io sobieski\.bartlomiej\.jan@gmail\.com
## 1 引言
预训练语言模型在自然语言理解方面取得了显著成功,但其内部表示的几何结构仍然是一个未解决的挑战。大多数分析将令牌嵌入视为平坦欧几里得空间中的点,但有三条证据表明需要偏离这一假设:语言中的层次结构允许在负曲率空间中进行更低失真的嵌入(Nickel and Kiela,2017 (https://arxiv.org/html/2607.07047#bib.bib38);2018 (https://arxiv.org/html/2607.07047#bib.bib39);Sala et al.,2018 (https://arxiv.org/html/2607.07047#bib.bib48);Park et al.,2025 (https://arxiv.org/html/2607.07047#bib.bib41)),并反映在嵌入空间上的非标准内积中(Park et al.,2024 (https://arxiv.org/html/2607.07047#bib.bib42);Marks and Tegmark,2024 (https://arxiv.org/html/2607.07047#bib.bib34));BERT、ELMo 和 GPT-2 中的上下文化表示是强各向异性的,占据狭窄的锥体,在欧几里得变换下并不保持不变(Ethayarajh,2019 (https://arxiv.org/html/2607.07047#bib.bib19);Kataiwa et al.,2025 (https://arxiv.org/html/2607.07047#bib.bib28));并且令牌嵌入空间可能无法全局形成光滑流形,即使局部流形状结构仍然支持邻域级别的几何分析(Robinson et al.,2025 (https://arxiv.org/html/2607.07047#bib.bib46))。
这项工作研究句子级分类信号是否存在于令牌嵌入的黎曼几何中。我们解决三个问题:(1) 嵌入是否表现出可通过拉回度量访问的局部几何结构?(2) 这种几何结构是否携带了超出平坦欧几里得聚合所能提取的信号?(3) 几何聚合管道的哪个组成部分负责观察到的任何增益:是编码器、度量还是聚合?
我们评估我们的方法*黎曼均值池化*(RMP)在四个不同的 NLP 任务上:事实验证(FEVER-Symmetric)、文本蕴含(RTE)、语法可接受性(CoLA)和常识推理(CREAK)。FEVER-Symmetric 被特意包含作为负对照:它被构建为去除词汇和注释伪影(Schuster et al.,2019 (https://arxiv.org/html/2607.07047#bib.bib49)),我们期望任何仅依赖于声称表面几何的方法都只能达到随机水平。
任何可微编码器都通过其雅可比矩阵产生一个拉回度量,但度量的几何可解释性取决于训练目标。我们使用 Intrinsic Green's Learning (IGL)(Quemy,2026 (https://arxiv.org/html/2607.07047#bib.bib44))¹¹ 参考实现:https://github.com/hotherio/intrinsic-green-learning。:一种闭合形式的核读出取代了学习到的解码器,将编码器约束在数据流形光滑结构对齐的坐标上,而不是任意的非线性特征。我们的消融实验(第 5 节 (https://arxiv.org/html/2607.07047#S5))通过将 IGL 与随机和未训练的编码器进行比较来测试这一选择。
#### 贡献
- •我们实例化了一个管道,该管道从学习到的编码器的雅可比矩阵中提取每个令牌的拉回度量,通过 Fréchet 均值在 SPD 流形上聚合它们,并在总体黎曼均值处的切空间中进行分类。
- •在三个承载信号的数据集(RTE、CoLA、CREAK)上,在受控比较中,对相同嵌入进行黎曼聚合一致地优于欧几里得均值池化;在作为负对照的 FEVER-Symmetric 上,该方法正确地保持在随机水平。
- •一个随机初始化的编码器结合 Fréchet 聚合已经击败了欧几里得池化,将几何信号的来源定位到聚合而非学习到的流形结构。训练过的编码器仅在 CREAK(三个承载信号的数据集中知识密集度最高的那个)上贡献了额外的信号。
## 2 相关工作
#### 神经科学中的黎曼方法
黎曼几何是脑机接口(BCI)和信号处理中无处不在的机器学习技术。Congedo 等人 (2017) 的工作 (https://arxiv.org/html/2607.07047#bib.bib14)。Barachant 等人 (2012) (https://arxiv.org/html/2607.07047#bib.bib6) 引入了使用对称正定(SPD)矩阵作为脑电图时间序列的描述符,证明了几何方法能够比欧几里得方法更好地捕捉信号的内在结构。黎曼最小距离到均值(MDM)和切空间(TS)分类器已成为神经科学应用的标准工具,即使是最新的深度学习算法也无法超越(Chevallier 等人,2024 (https://arxiv.org/html/2607.07047#bib.bib12)),同时它们仍然简单、确定性、对噪声鲁棒、计算高效,并且易于迁移学习(Andreev 等人,2025 (https://arxiv.org/html/2607.07047#bib.bib2))。在 BCI 环境之外,SPD 流形深度学习已经成熟:可微分的 Fréchet 均值层(Lou 等人,2020 (https://arxiv.org/html/2607.07047#bib.bib31))、针对 SPD 网络的黎曼批量归一化(Brooks 等人,2019 (https://arxiv.org/html/2607.07047#bib.bib9))以及逻辑回归的黎曼扩展(Chen 等人,2024 (https://arxiv.org/html/2607.07047#bib.bib10))现在为端到端的 SPD 管道提供了标准组件,最近的综述涵盖了该领域(Ju 等人,2024 (https://arxiv.org/html/2607.07047#bib.bib27))。
#### NLP 中的几何方法
在现代 NLP 架构中,令牌被表示为高维潜在空间中的向量。当令牌通过网络层传播时,它们的表示在残差流(模型的动态内部状态)内部演化。这种演化并非纯粹的线性或句法性的,而是可以被描述为一个结构化的轨迹,其几何形状根据语义上下文而变化(Manson,2025 (https://arxiv.org/html/2607.07047#bib.bib32))。这种结构的具体实例已被经验证明:LLM 表示中的线性方向编码了空间、时间和其他概念属性(Gurnee and Tegmark,2024 (https://arxiv.org/html/2607.07047#bib.bib23)),并且架构变体明确地为注意力配备了非欧几里得几何,要么通过混合曲率变换器(Cho 等人,2023 (https://arxiv.org/html/2607.07047#bib.bib13)),要么通过基于平行传输的流形注意力(Ji,2025 (https://arxiv.org/html/2607.07047#bib.bib26))。最近的研究还提出,潜在空间本身可以被建模为一个弯曲的时空,其曲率反映了语言结构(Di Sipio 等人,2025 (https://arxiv.org/html/2607.07047#bib.bib17))。
当前的方法从 k-最近邻(kNN)块估计局部切空间,并从相邻切方向之间的变化中推导曲率信息(例如,Gao and Liang (2011) (https://arxiv.org/html/2607.07047#bib.bib22);Li (2017) (https://arxiv.org/html/2607.07047#bib.bib30))。然而,这些方法常常遭受数值不稳定性和对采样密度的敏感性,度量估计随着局部样本大小的减小而退化(Brand,2003 (https://arxiv.org/html/2607.07047#bib.bib7);Singer,2006 (https://arxiv.org/html/2607.07047#bib.bib50))。另一种不同的方法首先将数据投影到较低维空间(例如通过 UMAP(McInnes 等人,2018 (https://arxiv.org/html/2607.07047#bib.bib35)))并在投影中计算度量,但 UMAP 保留的是局部拓扑而非度量结构:UMAP 之后的距离不适合作为原始流形上距离的近似,因此后续的几何运算是在数据的非等距图像上进行的。最近的研究还质疑了令牌嵌入是否形成单个连通流形(Robinson 等人,2025 (https://arxiv.org/html/2607.07047#bib.bib46));我们在这里提出的问题是,无论全局流形结构是否成立,聚合的令牌几何是否仍然在句子级别携带类别信号。
#### 内在维度和流形学习
Sobieski 等人 (2026) (https://arxiv.org/html/2607.07047#bib.bib51) 表明,局部内在维度(LID)通过识别模型诱导流形上的不稳定性来揭示扩散模型中的幻觉。他们的工作将幻觉视为几何不稳定性,提出 Intrinsic Quenching 来纠正这些异常。类似地,Damirchi 等人 (2026) (https://arxiv.org/html/2607.07047#bib.bib15) 引入了“真理作为轨迹”,通过逐层几何度量而非静态激活来分析 LLM 推理。通过检查表示如何在层间演化,他们揭示了区分有效推理与虚假行为的几何不变量。除了这些逐层轨迹分析之外,一系列近期工作使用内在维度作为探针来研究 LLM 如何在层间处理信息:表示在早期层扩展,在后期层压缩(Valeriani 等人,2023 (https://arxiv.org/html/2607.07047#bib.bib54)),其中包括中间层的高维抽象阶段(Cheng 等人,2025 (https://arxiv.org/html/2607.07047#bib.bib11))。ID 还被用于比较学习范式,如监督微调和上下文学习(Janapati and Ji,2025 (https://arxiv.org/html/2607.07047#bib.bib25))。我们的工作是对这些视角的补充。
#### 句子表示学习
标准的句子表示方法,如令牌嵌入的均值池化和 BERT [CLS] 令牌,隐式地假设了平坦的欧几里得几何。我们用 SPD 流形 Fréchet 聚合取代算术平均。最近的研究还突出了池化句子表示的纠缠性(Tehenan 等人,2025 (https://arxiv.org/html/2607.07047#bib.bib52)),这激发了几何替代方案。
## 3 材料与方法
### 3.1 数据集
我们评估四个二分类基准。FEVER-Symmetric (Schuster 等人,2019 (https://arxiv.org/html/2607.07047#bib.bib49)) 包含 316 个事实验证声称,由 Schuster 等人针对原始 FEVER (Thorne 等人,2018 (https://arxiv.org/html/2607.07047#bib.bib53)) 的注释伪影进行了去偏,方法是将每个声称与其否定形式配对,并共享证据;我们将其作为*负对照*包含进来,因为仅依赖于声称表面特征的方法在构造上无法超越随机水平。RTE (Wang 等人,2018 (https://arxiv.org/html/2607.07047#bib.bib55)):4,990 个文本蕴含的前提-假设对。CoLA (Warstadt 等人,2018 (https://arxiv.org/html/2607.07047#bib.bib56)):3,000 个标记为语法可接受性的句子。CREAK (Onoe 等人,2021 (https://arxiv.org/html/2607.07047#bib.bib40)):3,000 个需要世界知识来验证的常识性陈述。
### 3.2 基线方法:线性探针
我们使用线性探针 (Linear Probe) (Alain and Bengio,2017 (https://arxiv.org/html/2607.07047#bib.bib1)) 作为主要基线,在整个过程中将此基线称为线性探针,并且当将其与黎曼替代方案进行对比时,保留术语*欧几里得均值池化*用于指代底层的聚合操作。基线完全在预训练模型的内部状态上运行,将几何聚合的贡献与任何额外的可训练参数或外部信息源隔离开来。
#### 令牌嵌入和池化。
我们从 BERT-base-uncased (Devlin 等人,2019 (https://arxiv.org/html/2607.07047#bib.bib16)) 的第九个隐藏层提取令牌级别的嵌入,每个令牌产生 768 维的表示。层选择基于先前的工作,表明上层编码更抽象的语义特征,而下层捕获句法信息 (Rogers 等人,2020 (https://arxiv.org/html/2607.07047#bib.bib47))。对于单句数据集 (FEVER、CoLA、CREAK),我们直接对输入进行编码;对于文本蕴含任务 (RTE),我们使用分隔符令牌 ([CLS] [premise] [SEP] [hypothesis] [SEP]) 连接前提和假设。令牌嵌入通过算术均值池化进行聚合:
vsentence = 1/n Σᵢ₌₁ⁿ vi ∈ ℝ⁷⁶⁸, (1)
其中 {v₁, …, vₙ} 是一个具有 n 个令牌的句子的令牌嵌入。
#### 分类。
池化后的句子表示经过归一化,并使用 scikit-learn (Pedregosa 等人,2011 (https://arxiv.org/html/2607.07047#bib.bib43)) 的默认超参数(无正则化,LBFGS 求解器,最大迭代 1000)进行逻辑回归分类。相同的分类头也用于 Fréchet 聚合下游的黎曼管道(第 3.5 节 (https://arxiv.org/html/2607.07047#S3.SS5)),因此性能差异可以清晰地归因于聚合步骤。
### 3.3 内在格林学习 (Intrinsic Green's Learning)
#### 逆 PDE 目标。
IGL (Quemy,2026 (https://arxiv.org/html/2607.07047#bib.bib44)) 是一个通过逆 PDE 公式学习低维流形表示的框架。一个小型 MLP 编码器 Ψθ: ℝᴰ → ℝᵈᵐᵃˣ 将每个输入 v ∈ ℝᴰ 映射到一个潜在编码 ξ = Ψθ(v)。在编码器的坐标中,目标函数(此处是输入本身)被表示为一个线性 PDE 的解:
其中 L 是一个固定的算子(在我们的设置中是拉普拉斯算子,其格林函数通过高斯核近似),s 是一个学习到的源项。该目标迫使编码器的坐标对齐于数据流形的光滑结构,而不是任意非线性特征,从而产生的表示在其几何结构中编码了有意义的信号。相似文章
Extra-Merge: 追踪语言模型预训练中模型合并的 Rank-1 子空间
本文发现在 LLM 预训练轨迹中存在 Rank-1 子空间现象,并提出 Extra-Merge,一种无需训练的策略,沿该子空间外推以最小化损失,在 GPT-2 和 LLaMA 系列模型(最高 2B 参数)上实现了零样本准确率的一致提升。
预测与重建:自监督语言表示学习的联合目标
本文提出了一种混合预训练目标,结合了JEPA潜在空间预测和MLM重建,用于语言模型,显示出改进的嵌入均匀性和语义-词汇平衡。
大语言模型几何表示鲁棒性评测
# 大语言模型几何表示鲁棒性评测 来源:[https://arxiv.org/html/2604.16421](https://arxiv.org/html/2604.16421) Vedant Jawandhia 计算机科学与信息系统系,BITS Pilani \{f20220627, dhruv\.kumar, yash\.sinha\}@pilani\.bits\-pilani\.ac\.in Yash Sinha 计算机科学与信息系统系,BITS Pilani \{f20220627, dhruv\.kumar, yash\.sinha\}@pilani\.bits\-pilani\.ac\.in Ankan Pal 数学系,BITS Pilani
RDP LoRA:基于几何轨迹的大语言模型参数高效适配层选择方法
RDP-LoRA 通过几何轨迹分析与 Ramer-Douglas-Peucker 算法,自动挑出对参数高效微调最关键的层,效果优于全层及随机 LoRA 基线。
使用学习锚点和白化内积改进相对表示
本文提出通过学习鲁棒的语义锚点并使用几何感知相似度度量来改进相对表示,使得不同架构的独立训练模型之间能够实现近乎无损的信息传输和稳定的零样本通信。