句法 vs. 语义:Transformers如何学习深层依赖
摘要
本文介绍了一个机制框架,用于分析Transformer学习动态,识别出梯度饥饿是深层语义依赖的障碍,并验证了思维链策略对有效学习的作用。
arXiv:2608.26139v1 公告类型:新
摘要:大型语言模型展现出显著的句法流畅性,但控制其获取深层语义依赖的优化动态仍知之甚少。我们提出一个机制框架,将该学习过程建模为表面统计与深层语义之间的竞争。我们的理论分析识别出一种“梯度饥饿”现象,其中稀疏语义依赖的误差信号在早期优化中被主动抑制。这种抑制阻碍了结构推理的学习,并导致其出现表现为突然的相变。此外,该框架为思维链(CoT)策略的有效性提供了机制基础。通过将中间推理步骤外部化为具体令牌,CoT有效绕过隐式推理固有的抑制机制。我们在从玩具Transformer到生产模型(Llama-3.1-8B, Qwen2.5-Coder-7B)的不同规模上验证了这些发现。最后,基于该理论,我们提出一个拓扑对齐的对比目标,明确修正梯度几何。在变量绑定任务上的实验表明,我们的方法实现的改进幅度超过标准交叉熵微调的两倍。
查看缓存全文
缓存时间: 2026/08/28 09:19
# 语法与语义:Transformer如何学习深层依赖关系
来源:https://arxiv.org/html/2608.26139
###### 摘要
大型语言模型展现出卓越的语法流畅性,但其习得深层语义依赖关系的优化动态机制仍未被充分理解。我们提出一个机械化框架,将这一学习过程建模为“表面统计”与“深层语义”之间的竞争。理论分析发现一种“梯度饥饿”现象:在优化早期,稀疏语义依赖的误差信号会被主动抑制。这种抑制阻碍了结构推理能力的学习,并导致其涌现表现为突发性的相变。此外,该框架为思维链(CoT)策略的有效性提供了机械化解释——通过将中间推理步骤外化为具体词元,CoT能有效绕过隐式推理固有的抑制机制。我们从玩具Transformer到生产级模型(Llama-3.1-8B、Qwen2.5-Coder-7B)的多层次验证了这些发现。最终,基于该理论,我们提出拓扑对齐的对比目标函数,明确修正梯度几何结构。在变量绑定任务上的实验表明,相比标准交叉熵微调,本方法实现了超过两倍的性能提升。
代码开源地址:https://github.com/jr-zhao/Deep-Dependencies/tree/main
机器学习,ICML
## 1 引言
参见图注
图1:梯度竞争动态。左图:高曲率语法(橙色)饥饿语义信号。右图:模型与深层拓扑依赖(蓝色)对齐。
通用智能的标志不仅是表面的流畅性,更是习得并利用超越局部模式的**深层依赖关系**的能力。这类依赖关系要求模型从上下文中恢复潜在的关系结构——这被长期认为是系统性泛化的核心能力(Fodor and Pylyshyn,1988;Marcus,1998)。尽管近期研究表明Transformer架构的模型最终能捕获这些抽象依赖关系(Vaswani et al.,2017;Olsson et al.,2022),但其涌现过程的优化动态机制仍不明确。实践中,模型通常在训练早期就能可靠掌握局部高频结构,但深层依赖推理能力的习得往往通过突然的质变而非渐进提升实现(Wei et al.,2022a;Power et al.,2022;Davies et al.,2023;Wu et al.,2025)。
我们认为这一现象并非源于架构限制,而是动态过程所致。深层依赖推理所需的算子在结构上是可实现的,它们以潜在线性子空间的形式存在于标准Transformer几何结构中(Dhayalkar,2025;Boix-Adsera et al.,2023)。然而,优化过程中访问这些子空间并非易事。我们提出一个机械化框架,将训练过程刻画为**表面统计**(语法)与**深层语义**(潜在依赖结构)的竞争。在优化早期,频繁局部模式诱导的高曲率梯度主导了损失景观,即“梯度饥饿”现象(Pezeshki et al.,2021)。这些梯度抑制了与长程依赖相关的较弱低曲率信号,有效掩盖语义学习直至发生临界相变。
语法结构与语义内容间的张力已被广泛研究,包括:显式分离二者的架构(Russin et al.,2019;Felhi et al.,2022;Caucheteux et al.,2021)、注入依存树等结构先验(Bai et al.,2021;Gong et al.,2022;Zhou et al.,2020;Kalyanpur et al.,2020),以及质疑语法能力是否蕴含语义泛化的探测分析(Weissweiler et al.,2022;Ahuja et al.,2025;Alleman et al.,2021)。但这些方法大多将语法和语义视为静态表征属性或架构设计选择。相比之下,我们的工作将其建模为梯度空间中的竞争者,为语法结构为何倾向于更早习得,以及其在训练中如何干扰深层依赖获取提供了机械化解释。
该框架产生两个核心预测:第一,解释推理能力的层级涌现——优化压力迫使注意力头优先恢复粗粒度关系拓扑,再解析细粒度数值,导致依赖回路呈现特征性的阶段式发展;第二,为思维链(CoT)提示的有效性提供因果解释(Wei et al.,2022b)——通过外化中间状态,CoT注入额外梯度路径改变了学习几何,部分绕过限制隐式推理的饥饿机制。
为实证验证这些动态机制,我们采用多阶段实验策略。由于自然语言缺乏潜在依赖结构的明确真实标签,我们主要使用源代码和抽象语法树(AST)作为语义拓扑的可控代理(Allamanis et al.,2017;Chen,2021)。我们从受控玩具模型到Pythia(Biderman et al.,2023b)的中间检查点追踪依赖回路的涌现,最终在Qwen2.5-Coder-7B(Hui et al.,2024;Yang et al.,2024)和Llama-3.1-8B(Dubey et al.,2024)等生产级模型上验证拓扑对齐干预的有效性。
## 2 机械化表征:语义涌现动态
本节为语义绑定回路(或上下文依赖回路)的涌现提供理论框架。我们将问题表述为表面统计(语法)与深层语义(潜在依赖结构)的竞争,展示该竞争受信号-噪声比(对齐率)动态支配:高曲率语法特征通过梯度饥饿主导优化动态,抑制语义方向的有效更新,延迟系统性推理的涌现直至临界相变发生。
### 2.1 问题设定:表面结构与深层绑定
设序列 $\mathcal{S}=\{x_{1},\dots,x_{T}\}$ 为输入。我们区分两类功能依赖:**语法**($\mathcal{F}_{syn}$)——包含局部高频模式(如分隔符);**语义**($\mathcal{F}_{sem}$)——包含恢复计算拓扑的长程依赖(具体指将查询词元映射至程序图中其信息前驱)。
### 2.2 竞争几何:梯度饥饿
**假设2.1(谱差异)**:假设优化压力不均匀分布。语法子空间 $\mathcal{U}_{syn}$ 涵盖大曲率特征向量 $\lambda_{syn}$,而语义子空间 $\mathcal{U}_{sem}$ 的曲率更小:$\lambda_{sem} \ll \lambda_{syn}$。初始残差 $r_{0}$ 在 $\mathcal{U}_{syn}$ 中具有非平凡能量。该假设在附录A.1中实证验证。
**命题2.2(谱偏差导致的梯度饥饿)**:考虑损失函数的局部二次近似 $\mathcal{L}(\theta) \approx \mathcal{L}(\theta^{*}) + \frac{1}{2}(\theta-\theta^{*})^{T}H(\theta-\theta^{*})$,令 $e=\theta-\theta^{*}$ 表示参数残差。梯度 $g \approx He$ 可在海森矩阵特征基 $\{(\lambda_{k}, v_{k})\}$ 中分解为:
$$g=\sum_{k}\lambda_{k}(v_{k}^{T}e)v_{k}$$
其中标量 $(v_{k}^{T}e)$ 是残差在第 $k$ 个特征向量上的投影。假设 $\lambda_{syn} \gg \lambda_{sem}$ 且残差在两个子空间上的平均投影幅度可比,梯度幅度由语法分量主导:
$$\frac{\|g_{syn}\|_{2}}{\|g_{sem}\|_{2}} \approx \frac{\lambda_{syn}}{\lambda_{sem}} \cdot \sqrt{\frac{m_{syn}}{m_{sem}}} \gg 1 \quad (1)$$
其中 $m_{syn}$ 和 $m_{sem}$ 为两个子空间的有效维度。因此,更新方向 $-g$ 被语法分量主导,优化在语义方向上进展缓慢,对 $\mathcal{F}_{sem}$ 产生掩蔽(梯度饥饿)效应(证明见附录C.1)。
### 2.3 抑制机制:Softmax饱和
我们分析早期语法收敛如何阻碍语义学习。令 $s_{sem}$ 为正确语义词元的logit,$A_{syn} \approx 1$ 为干扰语法词元的注意力权重。
**引理2.3(梯度抑制因子)**:令 $s_{sem}$ 为正确语义词元的注意力分数,$A_{sem}$ 为其softmax权重。在语法主导的饱和机制($A_{syn} \approx 1$)下,有 $A_{sem} \approx 0$。损失 $\mathcal{L}$ 对分数 $s_{sem}$ 的梯度为:
$$\frac{\partial \mathcal{L}}{\partial s_{sem}} = \sum_{k} \frac{\partial \mathcal{L}}{\partial A_{k}} \frac{\partial A_{k}}{\partial s_{sem}} \quad (2) = A_{sem} \left( \frac{\partial \mathcal{L}}{\partial A_{sem}} - \sum_{k} A_{k} \frac{\partial \mathcal{L}}{\partial A_{k}} \right)$$
其幅度与注意力权重线性相关:$\left\| \frac{\partial \mathcal{L}}{\partial s_{sem}} \right\| \propto A_{sem}$。
**定理2.4(消失梯度屏障)**:在top-1主导机制下,单一语法分数 $s_{syn}$ 主导softmax归一化器,有 $A_{sem} \approx \exp(-(s_{syn}-s_{sem}))$。当模型处于“语法相”($A_{syn} \to 1$)时,语义分量的有效学习信号随分数差 $s_{syn}-s_{sem}$ 指数衰减。在 $\frac{\partial \mathcal{L}}{\partial A_{k}}$ 有界条件下:
$$\left\| \frac{\partial \mathcal{L}}{\partial s_{sem}} \right\| = O\left(e^{-(s_{syn}-s_{sem})}\right) \to 0 \quad \text{(推导见附录C.2)}$$
**启示**:这种乘性抑制形成**梯度屏障**。即使定义词元包含有用信息,信号也会被衰减。因此语义学习在语法置信度 $A_{syn}$ 退化(如通过冲突模式或正则化)之前有效停滞,直至 $A_{sem}$ 超过可学习阈值。
### 2.4 通过子空间对齐实现涌现
一旦注意力头逃离饱和,交互矩阵 $W_{QK}=W_{Q}^{T}W_{K}$ 将与底层语义拓扑对齐。
**假设2.5(误差-噪声正交性)**:我们将每个词元嵌入分解为 $x=\mu+\delta$,其中 $\mu$ 位于低维信号子空间,$\delta$ 为零均值上下文噪声。
**假设2.6(信号分解)**:进一步假设 $\mathbb{E}[\delta]=0$,且无关词元对满足 $\mathbb{E}[\delta_{j}\delta_{i}^{T}] \approx 0$。令 $\gamma_{ji}=\frac{\partial \mathcal{L}}{\partial s_{ji}}$ 为回流至注意力分数的标量误差信号。我们假设在数据分布 $\mathcal{D}$ 下,反向误差信号 $\gamma$ 与嵌入固有的前向上下文噪声 $\delta$ 不相关:$\mathbb{E}_{\mathcal{D}}[\gamma_{ji} \cdot \delta_{i}] \approx 0$。该假设在附录A.3中实证验证。
**命题2.7(依赖拓扑的Hebbian重建)**:注意力分数为双线性形式 $s_{ji}=x_{j}^{T}W_{QK}x_{i}$。损失对交互矩阵 $W_{QK}$ 的梯度累积为输入的外积:
$$\nabla_{W_{QK}}\mathcal{L} = \sum_{j,i} \gamma_{ji} x_{j} x_{i}^{T}, \quad \text{其中 } \gamma_{ji}=\frac{\partial \mathcal{L}}{\partial s_{ji}}$$
代入信号分解 $x=\mu+\delta$(假设2.5)并援引正交性假设(合理性见附录C.3),期望更新方向变为:
$$\mathbb{E}_{\mathcal{D}}[\nabla_{W_{QK}}\mathcal{L}] \approx \mathbb{E}[\gamma_{ji}] \cdot (\mu_{use} \mu_{src}^{T}) \quad (3)$$
这证实优化器自然推动 $W_{QK}$ 与秩-1外积 $\mu_{use} \mu_{src}^{T}$ 对齐——该外积表示计算图中的拓扑边。
### 2.5 相变与临界阈值
为量化转变过程,我们定义**对齐率** $\rho(t)$。将理想拓扑算子 $M_{sem}$ 定义为编码依赖边的秩-1外积:$M_{sem} = \mu_{use} \mu_{src}^{T}$(注意 $M_{sem}$ 通常不对称,因使用≠来源)。
$\rho(t)$ 定义为当前梯度更新与目标算子的平方余弦相似度:
$$\rho(t) = \frac{\langle \nabla_{W_{QK}}\mathcal{L}, M_{sem} \rangle_{F}^{2}}{\| \nabla_{W_{QK}}\mathcal{L} \|_{F}^{2} \cdot \| M_{sem} \|_{F}^{2} + \epsilon} \quad (4)$$
该指标 $\rho(t) \in [0,1]$...相似文章
@simplifyinAI: DeepSeek 对 Transformer 架构进行了根本性重构。它解决了导致大规模 AI 模型崩溃的“身份危机”……
DeepSeek 发表了一篇论文,介绍了 mHC(流形约束超连接,Manifold-Constrained Hyper-Connections),这是一种对 Transformer 架构的根本性重写,通过用数学约束的多流路径替换标准残差连接,来稳定大型模型。
语义空间的几何:Transformer架构的连续几何框架
提出一个连续几何框架,将Transformer操作建模为语义纤维丛上的积分-微分方程,并在多种架构上进行了验证。
基于有界深度文法的深度Transformer层次建模表达性分析
本文对深度Transformer使用有界深度上下文无关文法建模层次结构的能力进行了理论分析,构建了显式的位置注意力Transformer,将文法状态编码到线性可分的子空间中。
基于强化学习的智能体Transformer可证明地学会搜索
本文从理论上研究了基于Transformer的策略如何从随机树环境中的强化学习训练动态中获得搜索能力。研究表明,一个双头Transformer可以实现深度优先搜索,并且在深度分阶段课程下,这种机制会自然地从稀疏奖励信号中涌现。
发展性方法揭示神经语言模型的统计学习:Transformer从最抽象的统计模式中泛化
本文采用发展性方法研究神经语言模型(特别是Transformer)如何从人工语法中学习统计模式,发现它们首先获取全局抽象统计信息,然后学习局部依赖关系,并在早期出现过度泛化。