高斯Transformer动力学的可达性与渐近性

arXiv cs.LG 论文

摘要

本文提出了一个将Transformer动力学视为概率测度上的非线性控制系统的数学框架,证明了高斯分布在流动下保持高斯性,简化为有限维双线性控制,并建立了可达性条件和渐近稳定性结果。

arXiv:2606.07600v1 公告类型:新 摘要:我们将通过Transformer(驱动大型语言模型的机器学习架构)的数据传播建模为概率测度空间上的非线性控制系统。对于具有自注意力和仿射前馈层的平均场Transformer模型,我们证明了高斯分布在诱导流下严格保持高斯性。这一不变性将无限维测度动力学简化为有限维双线性控制系统,该系统控制均值和协方差的演化,将Transformer的表达能力重新表述为对指定高斯矩的可达性问题,并揭示了与经典滤波和控制中Riccati型方程的新联系。 对于时变控制,我们证明了任何目标高斯分布(其协方差矩阵与初始分布秩相同)的精确有限时间可达性,这一秩约束是动力学的内在不变量。对于时不变参数,我们推导了显式的谱条件,这些条件要么导致正定平衡点的渐近稳定性,要么导致协方差的有限时间爆裂。 数值实验补充了理论,表明具有高斯输入的实际Transformer在早期和中间层保持与矩匹配的高斯分布接近,而具有指定注意力矩阵的Transformer再现了预测的协方差状态:稳定配置中的有界演化和失稳配置中的爆裂。
查看原文
查看缓存全文

缓存时间: 2026/06/09 08:48

# 高斯Transformer动力学的可达性与渐近行为††thanks: 提交至编辑日期。\funding AA由欧盟“欧洲地平线”MSCA项目ModConFlex资助(资助号101073558)。EZ由亚历山大·冯·洪堡教授项目、ERC高级资助项目CoDeFeL、MINECO资助项目PID2020-112617GB-C22 KiLearn和TED2021-131390B-I00-DasEl、MICIU(西班牙)资助项目PID2023-146872OB-I00-DyCMaMod、欧盟“欧洲地平线”MSCA项目ModConFlex(资助号101073558)、DFG Transregio 154项目“以天然气网络为例的数学建模、模拟与优化”、AFOSR 24IOE027项目以及挪威研究理事会SURE-AI中心资助357482提供资助。来源:https://arxiv.org/html/2606.07600 \\newsiamremark remark\\newsiamremarkhypothesisHypothesis\\newsiamthmclaimClaim\\newsiamremarkfactFact\\headers高斯Transformer动力学A\. Alcalde, Z\. Ji, 和 E\. Zuazua Albert AlcaldeChair for Dynamics, Control, Machine Learning & Numerics \(Alexander von Humboldt Professorship\), Department of Mathematics, Friedrich–Alexander\-Universität Erlangen–Nürnberg, 91058 Erlangen, Germany\. \(, , \)Enrique Zuazua22footnotemark:2Departamento de Matemáticas, Universidad Autónoma de Madrid, 28049 Madrid, Spain\. Chair of Computational Mathematics, Fundación Deusto\. Av\. de las Universidades, 24, 48007 Bilbao, Basque Country, Spain\. ###### 摘要 我们将数据通过Transformer(支撑大型语言模型的机器学习架构)的传播,形式化为概率测度空间上的一个非线性控制系统。对于具有自注意力和仿射前馈层的均场Transformer模型,我们证明了高斯分布在诱导流下保持精确的高斯形式。这一不变性将无穷维的测度动力学简化为一个有限维的双线性控制系统,该系统控制均值和协方差的演化,将Transformer的表达能力重新表述为对指定高斯矩的可达性问题,并揭示了与经典滤波和控制理论中Riccati型方程的新联系。对于时变控制,我们证明了任何目标高斯分布(其协方差矩阵与初始协方差矩阵具有相同秩)的精确有限时间可达性,该秩约束是动力学的一个内在不变量。对于时不变参数,我们推导了显式的谱条件,这些条件要么导致向正定平衡点的渐近稳定性,要么导致协方差的有限时间爆破。数值实验补充了理论,表明具有高斯输入的实际Transformer在早期和中间层保持接近矩匹配的高斯分布,而具有指定注意力矩阵的Transformer再现了预测的协方差状态:在稳定配置中为有界演化,在非稳定配置中为爆破。 ###### 关键词: 深度学习, 均场Transformer, 自注意力, Riccati微分方程, 协方差控制 \{MSCcodes\} 68T07, 93B03, 93D20 ## 1 引言 Transformer\[bahdanau2014neural,vaswani2017attention\]已成为现代机器学习中的主导架构,在自然语言处理\[achiam2023gpt4,devlin2019bert\]、计算机视觉\[carion2020end,liu2021swin\]、基因组学\[abramson2024accurate,jumper2021highly\]和科学机器学习\[bodnar2025foundation,price2025probabilistic\]中取得了最先进的性能。尽管取得了经验上的成功,但一个严格的数学框架来刻画Transformer在何时以及如何可靠地表示和传播信息仍然难以捉摸,这促使了越来越多的理论研究努力,通过连续深度和均场极限,利用非线性控制工具来理解它们\[bruno2025emergence,burger2025analysis,castin2025unified,geshkovski2025mathematical,sander2022sinkformers\]。当层数和输入数变大时,Transformer模型可以被视为一个作用于概率测度的受控非线性流\[peyre2025optimal\],其中受控状态空间是输入分布的密度,层索引被解释为连续时间变量,Transformer的逐层变化参数作为控制。研究这种测度流的一个自然且解析上易于处理的环境是高斯输入分布的不变流形\[castin2025unified\]。该环境在建模独立采样数据时被广泛采用(见Section1.2 (https://arxiv.org/html/2606.07600#S1.SS2)),并且关键的是,高斯不变流形将表征Transformer信息传播特性的无穷维受控演化简化为一个关于均值和协方差的有限维控制系统(见Section2.1 (https://arxiv.org/html/2606.07600#S2.SS1))。高斯框架提供了一个严格的控制理论范式来研究Transformer的训练动力学和表达能力。具体来说,Transformer的近似能力直接转化为一个可达性问题:是否存在一个时变控制(权重参数)序列,能够沿非线性流驱动一个初始高斯测度,使其匹配任意目标高斯?此外,理解前向传播动力学自然会引发渐近行为的基本问题:在什么控制参数状态下,Transformer流会稳定到一个平稳分布,何时会发散?用控制理论的语言来说,这些性质正好对应于系统的可控性和稳定性\[tabuada2022universal\]。

在本文中,我们解决了在均场Transformer模型的高斯设定下,非线性控制系统可达性和渐近行为的关键问题。Transformer架构提出了独特的控制理论挑战:(i) 由于自注意力的强非线性,当初始测度不是紧支撑时,均场演化的适定性无法保证;(ii) 高斯约化导致均值和协方差的耦合非线性动力学,使得经典几何控制技术\[bianchini2003needle\]的使用复杂化;(iii) 自注意力机制产生的控制矩阵的非交换性,为建立平衡点的存在性带来了重大障碍,而协方差流中的非线性使得全局稳定性分析复杂化。我们通过预解技术和摄动分析克服了这些困难,明确地将Transformer动力学与经典Riccati理论联系起来。

### 1.1 我们的贡献

本文的主要贡献如下:

*   我们研究了具有仿射前馈层和自注意力的均场Transformer模型,并证明了高斯测度类在所得系统下保持不变。这产生了一个用于均值和协方差演化的Riccati型ODE系统(命题2.1 (https://arxiv.org/html/2606.07600#S2.Thmtheorem1)),类似于最优滤波和控制理论中的经典表述:
    \[
    \begin{cases}
    \dot{\mu} &= (A+V)\mu + V\Sigma B\mu + b,\\
    \dot{\Sigma} &= A\Sigma + \Sigma A^\top + V\Sigma B\Sigma + \Sigma B^\top \Sigma V^\top,
    \end{cases}
    \tag{1}
    \]
    其中\(\mu(t)\in\mathbb{R}^d\)是均值,\(\Sigma(t)\in\mathbb{R}^{d\times d}\)是时刻\(t\)高斯的协方差,而\(A(t),B(t),V(t)\in\mathbb{R}^{d\times d}\)和\(b(t)\in\mathbb{R}^d\)是作为控制的可训练参数。此外,当使用ReLU激活构建前馈时,我们推导了测度流与高斯演化(1)之间差异的定量估计(命题2.4 (https://arxiv.org/html/2606.07600#S2.Thmtheorem4))。该论证并非特定于ReLU,并指出了如何对更一般的Lipschitz激活函数获得类似的估计。

*   对于时变参数矩阵,我们证明了协方差矩阵\(\Sigma\)的秩沿(1)的流保持不变(引理3.1 (https://arxiv.org/html/2606.07600#S3.Thmtheorem1))。利用矩阵合同变换,我们构造了显式的时变控制路径,实现了对任何共享初始协方差秩的目标高斯状态的精确有限时间可达性(定理3.3 (https://arxiv.org/html/2606.07600#S3.Thmtheorem3))。

*   对于时不变参数,我们刻画了均值/协方差动力学(1)的长时间行为。对于稳定参数状态,我们证明了正定平衡点的存在性,并导出了局部稳定性的充分条件(定理4.1 (https://arxiv.org/html/2606.07600#S4.Thmtheorem1)和4.7 (https://arxiv.org/html/2606.07600#S4.Thmtheorem7))。相反,在非稳定参数配置下,协方差在有限时间内爆破(定理4.8 (https://arxiv.org/html/2606.07600#S4.Thmtheorem8))。此外,在稳定条件下,可以通过参数的静态选择渐近匹配任意目标均值(定理4.11 (https://arxiv.org/html/2606.07600#S4.Thmtheorem11))。有趣的是,所得稳定性条件与预训练视觉Transformer\[trockman2023mimetic\]中的经验观察结果一致。

*   我们进行了数值实验,其目的超出了精确高斯理论的范围,起到补充作用。首先,我们展示了预训练的Transformer,尽管处于仿射均场模型假设之外,但当以高斯输入初始化时,在早期和中间层保持了近似高斯矩结构。其次,我们在更现实的具有非线性前馈块的离散架构中测试了协方差预测的鲁棒性,显示出在稳定符号配置中有界协方差增长,在非稳定配置中则有爆破。综合来看,这些结果为理解已训练Transformer中的数据传播提供了一个严格的框架——传统上,这一问题是通过静态近似理论来研究的,而我们现在从动力学和控制理论的角度进行分析。

### 1.2 高斯设定的动机

限制为高斯输入分布不仅仅是分析上的方便,也是Transformer上下文学习(ICL)能力理论研究中的标准范式\[garg2022can,goel2026training,von2023transformers,zhang2024trained\]。广义上讲,ICL研究Transformer如何直接从推理时提供的上下文示例中解决一系列监督学习任务。在该设定中,Transformer的输入通常由一个序列\(\{(x_1,y_1),(x_2,y_2),\dots,(x_m,y_m),(x_{\text{query}},0)\}\)组成,其中每个特征\(x_i\in\mathbb{R}^d\)(包括查询\(x_{\text{query}}\))独立采样自一个高斯分布(通常\(x_i\sim\mathcal{N}(0,\Sigma)\)),而标签\(y_i\)由某个未知的任务特定规则生成(例如,在线性回归任务中,\(y_i=w^\top x_i\),其中\(w\sim\mathcal{N}(0,I_d)\))。Transformer在许多这样的任务上进行训练,以从上下文示例中预测缺失的标签\(y_{\text{query}}\)。该框架的一个重要方面是,高斯输入并非旨在作为数据分布的现实模型。相反,它们提供了一个解析上易于处理的集成,允许我们隔离和研究注意力层聚合和传播信息的机制。

### 1.3 相关工作

我们的工作建立在最近通过均场极限和受控测度流理解Transformer架构的努力之上。我们将其贡献定位于三个紧密相关的研究方向:注意力动力学的渐近分析、Transformer的可控性以及Riccati型协方差动力学。

#### 注意力动力学的渐近学与均场视角

理论研究中的一个反复出现的主题是,注意力层的重复应用会导致坍塌现象:输入聚集,注意力矩阵可能变得有效低秩,从而限制表达能力。在粒子层面,仅含自注意力层的Transformer的渐近动力学已在\[alcalde2025clustering,11494448,geshkovski2023emergence,pham2025dynamical\]中研究。这些观察结果在均场框架下得到进一步阐明,其中动力学可以由\(\mathbb{R}^d\)中概率测度上的偏微分方程描述。早期贡献确定了适定性\[sander2022sinkformers\]、聚类\[burger2025analysis,geshkovski2025mathematical\]、亚稳态\[alcalde2026quantifying,bruno2025emergence,bruno2025a,geshkovski2024dynamic\]以及与长上下文注意力相关的相变\[chen2025critical\]。与我们工作最接近的是\[castin2025unified\],它证明了仅自注意力Transformer的高斯不变性,并推导了相应的均值和协方差方程。他们的渐近结果依赖于控制矩阵与初始协方差之间的强交换性条件。我们的贡献在于通过纳入仿射前馈层,超越了仅自注意力的设定,并基于对控制矩阵的较弱符号假设分析了所得的高斯系统。

#### Transformer的可达性与同步可控性

可控性和目标可达性问题对于Transformer至关重要。在离散层面,首个近似同步可控性结果在\[yun2019transformers\]中得到证明,并在\[alcalde2025exact,kim2023provable\]中扩展到精确设定。从均场视角,包括归一化层在内的Transformer的同步可控性已在\[geshkovski2024measure\]中建立,而\[akman2026optimal\]则采用最优控制方法研究Transformer的训练动力学。尽管相关,我们的工作采用了不同的视角,研究如何在控制上施加最小假设的情况下达到目标高斯。

#### 双线性系统与协方差控制

如命题2.1 (https://arxiv.org/html/2606.07600#S2.Thmtheorem1)所述,(1) 构成了一个双线性系统,揭示了Transformer模型与线性二次型调节器理论之间的惊人联系,因为协方差矩阵\(\Sigma\)可以被视为均值\(\mu\)的“反馈增益”(见第4.1节 (https://arxiv.org/html/2606.07600#S4.SS1))。这也与最优估计问题相关,后者旨在为闭环系统设计反馈控制器以达到指定的状态协方差\[hotz1987covariance\]。与最优控制中Riccati方程作为寻找最优增益的工具(具有保证的适定性)不同,在我们的分析中,Riccati/Bernoulli型方程是状态动力学的一部分,其稳定性存在问题:由于Transformer的具体结构,耦合结构(1)本质上是全新的,控制参数与协方差之间固有的非交换性使其行为复杂化。

相似文章

Transformer 残差流的动力学:谱几何与网络拓扑的耦合

arXiv cs.LG

本文对生产规模的大型语言模型进行了完整的 Jacobian 特征分解,揭示了从旋转主导的早期层到对称后期层的习得谱梯度,以及一个压缩扰动的低秩瓶颈。结果将扰动传播与压缩与网络功能拓扑联系起来。

Transformer 记忆的吸引子几何:从冲突仲裁到自信幻觉

arXiv cs.AI

本文提出了一个统一的几何框架,用于理解 Transformer 的内存故障,通过隐藏状态吸引子盆地(attractor basins)区分冲突仲裁与幻觉。研究表明,随着模型规模的扩大,几何边际(geometric margin)在检测这些故障方面优于输出熵。

动态Ising模型中的分布外神经推断

arXiv cs.LG

本文研究了用于重构动态Ising模型相互作用图的分布外神经推断,发现基于Transformer和卷积的模型展现出依赖于架构的统计先验,这些先验可能导致误导性的分布外鲁棒性。