Polar Probe线性解码LLM中的语义结构

arXiv cs.CL 论文

摘要

本文提出了一种Polar Probe,通过在学习的子空间中用距离和方向表示实体关系,从LLM激活中线性恢复语义结构。在算术、视觉场景、家谱、地铁地图和社交互动等多个领域的测试表明,该编码出现在中间层,能泛化到新实体,并对模型预测产生因果影响。

arXiv:2605.14125v1 公告类型: 新提交 摘要:人工神经网络如何将概念绑定以形成复杂的语义结构?本文提出了一种简单的神经编码,其中实体之间关系的存在和类型分别由它们嵌入之间的距离和方向表示。我们在多种大型语言模型(LLMs)中测试了这一假设,每个模型输入了来自五个不同领域的最小化任务的自然语言描述:算术、视觉场景、家谱、地铁地图和社交互动。结果表明,通过针对LLM层激活的子空间的Polar Probe,可以线性恢复真实的语义结构。其次,这种编码主要出现在中间层,并随LLM性能提升而改善。第三,这些Polar Probe成功泛化到新实体和关系类型,但会随语义结构规模增大而退化。最后,极性表示的质量与LLM回答语义结构相关问题的能力相关。这些发现表明,LLM通过学习使用简单的几何原理绑定表示来构建复杂的语义结构。
查看原文
查看缓存全文

缓存时间: 2026/05/15 06:19

# Polar probe 线性解码 LLMs 中的语义结构
来源:https://arxiv.org/html/2605.14125
Pablo J\. Diego\-Simón¹ Pierre Orhan² Yair Lakretz¹ Jean\-Rémi King³

¹ LSCP, ENS, PSL, EHESS, CNRS, 法国巴黎 ² 巴黎大脑研究所, 法国巴黎 ³ Meta AI, 法国巴黎

###### 摘要

人工神经网络如何将概念绑定以形成复杂的语义结构?本文提出一种简单的神经编码方式:实体间关系的存在性和类型分别由其嵌入向量的距离和方向表示。我们在多种大型语言模型(LLMs)中测试了这一假设,每个模型输入自然语言描述的最小任务,涵盖五个不同领域:算术、视觉场景、家谱、地铁线路和社交互动。结果表明,通过一个针对 LLMs 层激活子空间的 Polar Probe,可以线性恢复真实的语义结构。其次,这种编码方式主要出现在中间层,并随 LLM 性能提升而改善。第三,这些 Polar Probe 能够成功泛化到新实体和关系类型,但随着语义结构规模的增大而退化。最后,极性表征的质量与 LLM 回答语义结构问题的能力相关,且对该子空间进行干预会因果性地改变模型预测。综上所述,这些发现表明 LLMs 通过学习一种简单的几何绑定原则来构建复杂的语义结构。

## 1 引言

参考图注图1:Polar probe 从 LLM 激活值中线性读出语义结构。A:自然语言描述指定一组实体及其类型化关系(此处以*空间布局*为例,实体为物体,关系为空间谓词(左/右、上/下))。B:该描述对应一个语义结构,形式化为关系图,节点为实体,边为带类型的有向关系。C:LLM 对每个实体标记进行上下文编码,在其残差流中产生高维实体表示。D:Polar probe(一种从激活空间到探测空间的学得线性变换)恢复关系图:实体表示之间的欧几里得距离编码边的*存在性*,而相对方向编码关系的*类型*。底部面板:同样的方案适用于另外四个领域:空间布局、家谱、地铁线路和主题角色。##### 组合型表示。

人类语言不断地需要将词语组合成丰富的语义结构——例如亲属关系、空间排列或整体-部分连接。考虑句子“Bob 是 Alice 的父亲,Mary 是她的母亲”:理解它需要即时构建底层家谱的表示。然而,简单地为每种可能的组合分配一个独热特征很快就变得不切实际,并且确实阻碍了泛化(Fodor & Pylyshyn,1988 (https://arxiv.org/html/2605.14125#bib.bib12))。随着大型语言模型越来越能够组合新概念(Brown et al.,2020 (https://arxiv.org/html/2605.14125#bib.bib4)),理解其激活值的几何结构如何绑定实体以表示组合型结构变得至关重要。

##### 探测句法结构。

最近在句法表示方面已发现一种简单的绑定原理。事实上,Hewitt & Manning (2019 (https://arxiv.org/html/2605.14125#bib.bib18)) 通过*Structural Probe*表明,在 LLM 激活值的一个特定子空间中,句法上关联的词语(例如,主语-动词)比不关联的词语(例如,主语-宾语)表示得更近。基于这一提案,Diego-Simon et al. (2024 (https://arxiv.org/html/2605.14125#bib.bib8)) 进一步通过*Polar Probe*表明,句法关系的*类型*可以从该子空间中两个词语之间的相对*方向*恢复。总之,句法结构可以通过上下文词语嵌入之间的相对距离和方向显式表示。

##### 剩余挑战。

然而,这种绑定原理目前仅限于*句法*(Müller-Eberstein et al.,2022 (https://arxiv.org/html/2605.14125#bib.bib28);Eisape et al.,2022 (https://arxiv.org/html/2605.14125#bib.bib9);Limisiewicz & Mareček,2021 (https://arxiv.org/html/2605.14125#bib.bib23))。因此,尚不清楚类似原理是否也可能存在于*语义*绑定中。

##### 方法。

为检验这一假设,我们评估 LLMs 是否构建了激活子空间,其中词语嵌入之间的相对距离和方向线性表示相应的语义结构。为评估我们方法的通用性,我们引入一个合成数据集,涵盖五个语义域:变量序数性、空间布局、主题角色、家谱和地铁线路,每个域具有独特属性。数据集中的每个样本包含一段描述语义结构的文本(例如:狗在猫的左边。猫在桌子的下方。等等)。对于每个语义结构,我们生成多种有效的文本描述,其中关系的顺序和实体的顺序随机化,以消除词序与图结构之间的任何相关性。然后,我们将这些文本描述输入不同大小和预训练阶段的各种 LLMs,并针对每一层和每一域在其激活值上训练一个 Polar Probe(Diego-Simon et al.,2024 (https://arxiv.org/html/2605.14125#bib.bib8))。为验证所识别表示的实际泛化能力,我们在含有新实体名称和关系表面形式的域外(OOD)样本上进行评估。最后,为评估 Polar probe 的功能作用,我们测试这些极性表征的质量是否预测 LLM 回答语义结构相关问题的能力。

## 2 方法

### 2.1 问题形式化

##### 作为有向图的语义结构。

我们将语义结构形式化为一个关系图,包含带标签的节点(实体)和带类型的有向边(关系)。

设 V = {v₁, …, v_{|V|}} 为有限实体集,T = {t₁, …, t_{|T|}} 为有限关系类型集。定义

E = {(v_i, v_j, t_r) ∈ V × V × T : i ≠ j}。

那么语义结构就是一个图 G = (V_G, E_G, T_G),其中 V_G ⊆ V,T_G ⊆ T,且

E_G = {(v_i, v_j, t_r) ∈ E : v_i, v_j ∈ V_G, t_r ∈ T_G}。

我们用两个代数对象表示 G。首先,距离矩阵

M_G^ρ ∈ ℕ₀^{|V_G| × |V_G|},(M_G^ρ)_ij = d_G(v_i, v_j),

其中 d_G 是最短路径距离。其次,关联张量

M_G^φ ∈ {−1, 0, 1}^{|V_G| × |V_G| × |T|},(M_G^φ)_ijr = 1[(v_i, v_j, t_r) ∈ E_G] − 1[(v_j, v_i, t_r) ∈ E_G]。

参考图注图2:Polar probe 的几何形状镜像了真实的语义结构。上方:每个域中语义结构的预期 Polar probe 几何形状。下方:测试集中一个语义结构的 10 种不同描述的探测空间实体表示的 2D PCA;大标记表示实体质心,线条表示真实关系。投影倾向于遵循极性编码:方向编码关系的*类型*,欧几里得距离编码关系的*存在性*以及关系图中实体之间的接近程度。
##### 作为 LLM 激活值的语义结构。

一个语义结构 G 也可以用自然语言描述。为简单起见,我们假设每个实体 v_i ∈ V_G 由一个唯一标记 w_i 表示。如果 LLM 输入这样的文本描述并表示 G,那么这个结构应该能够从其隐藏激活值 h_i ∈ ℝ^d 中恢复(Vaswani et al., 2017 (https://arxiv.org/html/2605.14125#bib.bib36))。

总之,我们试图确定语义结构的符号/图形表示如何在神经网络的向量化激活值中表示。

##### Polar Probe。

探测到的成对距离矩阵 M̂_G^ρ ∈ ℝ^{|V_G| × |V_G|} 计算为

(M̂_G^ρ)_ij = ‖δ_ij‖₂,

其中 ‖·‖₂ 是 ℓ₂ 范数。

为了将每个关系分配到探测空间的一个特定方向,我们为每个关系类型 r ∈ T 学习一个原型向量 p_r,并训练探测使得每当类型 r 的关系存在于 (v_i, v_j) 之间时,探测到的差值 δ_ij 与 p_r 对齐。探测到的关联张量 M̂_G^φ ∈ ℝ^{|V_G| × |V_G| × |T|} 记录,对于每对标记 (w_i, w_j),δ_ij 与每个原型向量的余弦相似度:

(M̂_G^φ)_ijr = (δ_ij·p_r) / (‖δ_ij‖₂ ‖p_r‖₂)。

参考图注图3:语义结构在中间层线性解码最好,且仅出现在预训练 LLMs 中。Spearman 相关系数 ρ 表示从 Llama3-8B 的各个层解码的关系存在性(蓝色)和类型(橙色),涵盖五个域。在预训练模型(实线)中,解码在约 12-15 层达到峰值,并在后续层保持较高水平。在随机初始化模型(虚线)中,两个分数在所有层和域中均接近随机。
##### 学习目标。

因此,Polar Probe 的损失包含两项损失。结构损失 L_s(Hewitt & Manning, 2019 (https://arxiv.org/html/2605.14125#bib.bib18))为

L_s = (1/|B|) ∑_{G∈B} (1 - Ψ(M̂_G^ρ, M_G^ρ))。

Ψ(·,·) 是两个距离矩阵(M_G^ρ 和 M̂_G^ρ)的向量化上三角条目之间的可微 Spearman 秩相关系数;秩通过 Blondel et al. (2020 (https://arxiv.org/html/2605.14125#bib.bib3)) 的基于 Sinkhorn 的软排序算子计算。Ψ 评估相对距离排序的一致性(越高越好),并且不假设距离之间的共同尺度或等间距。

角度损失 L_a(Diego-Simon et al., 2024 (https://arxiv.org/html/2605.14125#bib.bib8))为

L_a = (1/|B|) ∑_{G∈B} (1/(|E_G| |T|)) ∑_{(i,j)∈E_G} ∑_{r∈T} ((M̂_G^φ)_ijr - (M_G^φ)_ijr)²。

Polar probe 和关系原型联合训练,以最小化结构损失 (L_s) 和角度损失 (L_a) 的加权和(λ ∈ ℝ):

(B^*, {p_r^*}_{r∈T}) = argmin_{B, {p_r}_{r∈T}} (L_s + λ L_a), λ > 0。

##### 实现细节。

为简单起见,我们系统地在给定 LLM 的每一层上独立训练和评估 Polar Probe。¹¹ 代码和数据将在论文的相机就绪版本中公开。经过网格搜索后,我们设置 λ = 5.0,学习率为 1×10⁻⁵。训练运行 100 个 epoch,默认情况下探测秩为 512,除非另有说明。对于每个语义域,训练集包含 30 个图,每个图有 20 种不同描述。验证集包含 50 个未见过的图,每个图有 20 种描述。数据集中所有图都有固定数量的实体;实体名称从 13 个项目的池中抽取。保留一个包含 13 个实体和关系表面形式的独立池用于域外(OOD)评估。

### 2.2 数据集

##### 语义域。

我们综合了五个数据集,每个数据集包含来自不同语义域的关系图。我们将语义域分为*欧几里得*(空间布局、变量序数性和主题角色)和*非欧几里得*(地铁网络和家谱)。分类标准是图是否可以在平坦(零曲率)空间中用极性编码忠实地编码,否则需要非零曲率。

##### 提示。

我们使用简短的、特定于域的提示来向 LLM 介绍语义域,并促使它推断实体之间的关系。更多细节请参考表 1 (https://arxiv.org/html/2605.14125#S5.T1)。例如(例如,“我将描述一个家谱,你需要理解所有家庭成员之间的关系”)。在这个提示之后,图中关系被详尽地以随机顺序描述。对于每个关系,实体的顺序也在两个等价选项之间随机化(例如,“James 是 Joseph 的父亲”或“Joseph 是 James 的儿子”)。因此,对于给定的关系图,存在多种文本描述。

##### 后提示。

有关系的实体在文本描述中往往相对接近,因为我们没有描述缺乏关系的句子。因此,为确保被探测实体之间的距离不受词语间距离的混淆,我们以固定顺序附加实体列表(例如,“谁是 James、Joseph 和 Amelia?”)并将这些用作被探测标记。为保证实体与标记之间的一对一映射,实体名称被选择确保它们由单个标记编码。

#### 2.2.1 欧几里得图。

我们通过算法 1 (https://arxiv.org/html/2605.14125#alg1) 为三个语义域生成欧几里得关系图。

##### 算术(变量序数性)。

首先,我们研究数学变量的序数性,该语义域仅包含一个关系类型。不同的变量名称被随机放置在一个量级轴上。关系图被构建,其中实体是数学变量(例如,*x*、*y*、*z*),关系表示相邻变量之间的相对顺序(例如,大于/小于)。

“xx 大于 zz。zz 小于 yy。”

相似文章

追踪大语言模型中的关系知识回忆

arXiv cs.CL

研究者通过探测每个注意力头的贡献,追踪大语言模型如何回忆关系事实,发现这些贡献是强线性特征,其保真度与关系特异性及实体连接度相关。

多模态大语言模型内部视觉表征的因果探针

arXiv cs.AI

本文提出了一种用于探测多模态大语言模型内部视觉表征的因果框架,揭示了实体与抽象概念在编码方式上的差异。研究强调增加模型深度对于编码抽象概念至关重要,并揭示了当前多模态大语言模型在感知与推理之间的脱节。