Transformer学习Mestre-Nagao启发式方法

arXiv cs.LG 论文

摘要

本文训练了一个两层Transformer编码器,利用Frobenius迹将有理椭圆曲线按秩分类,准确率超过99%。机械可解释性揭示该模型学习了Mestre-Nagao启发式方法,并将注意力集中在素数位置上,表明Transformer能够学习数论算法。

arXiv:2606.15036v1 Announce Type: new 摘要:我们训练了一个两层Transformer编码器,利用前128个归一化Frobenius迹,将导子不超过10000的有理椭圆曲线E/Q分类为秩0或秩1。在两类上的准确率均超过99%,并且在测试曲线上(训练集中无非同源或二次扭类的曲线)准确率基本不变。然后,我们应用机械可解释性技术,如注意力分析、线性探针、激活修补、logit归因和神经元级电路分析,对(函数空间中的质心)模型学习到的算法进行逆向工程。我们发现,在512个第一层MLP神经元中,仅有20个神经元组成的稀疏电路在线性探针下足以进行秩预测,在平台期AUROC达到0.992,实现了具有单侧读出的秩0和秩1检测器的推-拉检测器架构。然而,我们注意到模型存在次优读出问题,表明读出路径与判别性电路之间的秩顺序不匹配。关键是,顶部判别神经元的学得输入权重与Mestre-Nagao求和启发式权重log(p)/(p·log(B))的Spearman系数r=0.997,Pearson系数r=0.952:该模型仅从Frobenius迹数据就学会了解析数论中的一个结果。我们还发现,所有50个独立训练的模型在素数位置上的CLS注意力集中程度是合数位置上的2-50倍。CLS嵌入编码了log(L(E,1)),在50个模型中(控制导子后)R²=0.962±0.011。激活修补分析表明,注意力权重与因果信息流解耦。此外,训练得到的50个解在函数空间上几乎相同(成对一致性>98.8%),尽管权重空间障碍很大。
查看原文
查看缓存全文

缓存时间: 2026/06/16 11:36

# Transformers 学习 Mestre-Nagao 启发式方法 来源:https://arxiv.org/html/2606.15036 ###### 摘要 我们训练了一个两层 Transformer 编码器,用于根据前 128 个归一化 Frobenius 迹,将导子 ≤10000 的有理椭圆曲线 E/Q 分类为秩 0 或秩 1。在两个类别上均达到 >99% 的准确率,并且在训练集中没有同源或二次扭曲线上的测试曲线准确率基本不变。然后,我们应用机械可解释性技术,如注意力分析、线性探针、激活修补、对数赔率归因和神经元级电路分析,来逆向工程(函数空间中的质心)模型学习的算法。我们发现,在 512 个层 1 MLP 神经元中,一个由 20 个神经元组成的稀疏电路足以在线性探针下进行秩预测,AUROC 在平台期达到 0.992,实现了秩 0 和秩 1 检测器的推挽检测器架构,并带有一个单向读出来:秩 1 通过一个撤除的推动而非相反拉动来发出信号。然而,我们注意到模型存在次优读出问题:模型的读出权重从相同神经元提取的 AUROC 仅为 0.956,表明读出通路与判别电路之间的秩序不匹配。关键的是,最顶端判别神经元的学习输入权重与 Mestre-Nagao 和启发式权重 log(p)/(p·logB) 匹配,Spearman 系数 r=0.997,Pearson 系数 r=0.952:模型仅从 Frobenius 迹数据就学习了解析数论中的一个结果。我们还发现,所有 50 个独立训练的模型都将 CLS 注意力集中在素数位置,其比例是合数位置的 2-50 倍,这与 L(E,s) 的欧拉乘积结构一致。在 50 个模型上(在控制导子后),CLS 嵌入编码了 log L(E,1),R²=0.962±0.011。激活修补分析表明,注意力权重与因果信息流分离。此外,训练得到的 50 个解在函数空间上几乎相同(成对一致率 >98.8%),尽管权重空间存在较大障碍。 ## 1 引言 Birch 和 Swinnerton-Dyer (BSD) 猜想 [BirchSwinnertonDyer1965] 预测,Mordell-Weil 群 E(Q) 的秩等于 L 函数 L(E,s) 在 s=1 处的零点阶数。我们注意到 L(E,s) 完全由 Frobenius 迹 {a_n} 决定,来自欧拉乘积 L(E,s)=∏_p(1−a_p p^{-s}+p^{1-2s})^{-1}。理论上,秩因此可以从 Frobenius 迹序列 (a_1,a_2,...) 中读取。从有限项检测 L 值 L(E,1) 的消失数值上非常困难,因为近似函数方程 L(E,1)≈2∑_{n=1}^{N} (a_n/n)·W(n/√N_E) 收敛缓慢(尤其对于高导子的椭圆曲线)[rubinstein2005computational]。该领域的先前工作已经表明,机器学习模型能够从 Frobenius 迹高精度预测秩,例如 [babei2025learning]、[bieri2026murmurations]、[10.1016/j.jsc.2022.08.017] 和 [kazalicki2023ranks]。这些工作表明使用机器学习进行预测是可行的,但没有解决机械可解释性的问题:模型发现了什么算法?我们通过使用机械可解释性工具([elhage2021mathematical]、[nanda2023progressmeasuresgrokkingmechanistic]、[elhage2022toymodelssuperposition])来解决这个问题,例如注意力分析、线性探针 [alain2018understandingintermediatelayersusing]、激活修补 [10.5555/3600270.3601532]、直接对数赔率归因以及神经元级电路分析。我们发现,一个在秩预测任务上训练的 Transformer 独立地重新发现了 Mestre-Nagao 启发式方法 [bieri2026murmurations],这是一个经典的解析数论结果,用于估计秩,由一个稀疏的推挽 MLP 电路实现。这似乎是首次通过机械方式识别出 Transformer 神经网络在无监督情况下从数论数据中学习到一个命名的数学结果。 ## 2 背景 ### 2.1 L 函数、BSD 和 Frobenius 迹 设 E/Q 为有理椭圆曲线,导子为 N_E。L 函数定义为 L(E,s)=∑_{n≥1} a_n/n^s = ∏_{p∤N_E} 1/(1−a_p p^{-s}+p^{1-2s}) · ∏_{p∣N_E} 1/(1−a_p p^{-s})。此处,对于好约化(即系数模 p 约化时曲线非奇异)的素数 p,a_p = p+1−#E(F_p),并且根据 Ramanujan-Eichler-Shimura 界有 |a_p| ≤ 2√p [diamond2005first]。Frobenius 迹 a_n 满足 Hecke 乘性:对于互素的 m,n,有 a_{mn}=a_m a_n。因此 {a_n} 完全由素数 p 的 {a_p} 决定。对于秩 0 椭圆曲线,BSD 公式给出 L(E,1)=Ω_E·#(E)·∏_p c_p / |Tor(E(Q))|²。其中:1. i. Ω_E 是实周期,定义如下:每个椭圆曲线 E/Q 都有一个整数系数的 Weierstrass 方程:E 是射影曲线 y²=x³+ax+b。我们可以定义唯一的不变微分(在平移不变的意义下)ω_E=dx/(2y)。周期格 Λ 定义为由形如 ∫_γ ω_E 的积分生成的 C 的离散子群,其中 γ∈H_1(E,Z)(注意存在同构 E(C)≅C/Λ)。实周期 Ω_E 则定义为 Λ∩R 的最小正元素乘以 E(R) 的分支数 [lmfdb]。2. ii. (E) 是 Tate-Shafarevich 群,定义如下:设 K 为数域,G_K 为其绝对 Galois 群。对于位 ν,设 K_ν 为 K 在 ν 处的完备化,G_{K_ν} 为完备化的绝对 Galois 群。椭圆曲线 E/K 的 Tate-Shafarevich 群定义为 (E)=ker( H¹(G_K,E)→∏_v H¹(G_{K_v},E_{K_v}) ),其中 ν 跑遍 K 的所有位,E_{K_ν} 表示 E 到 K_ν 的基变换。(E) 的阶被猜想为有限。3. iii. ∏_p c_p 是玉河数乘积,定义如下:设 p 为 K 的素理想。定义玉河数 c_p=[E(K_p:E⁰(K_p))],其中 E⁰(K_p) 是 E(K_p) 的子群,由所有模 p 约化光滑的点组成。如果 E 在 p 处有好约化,则 c_p(E)=1。玉河数乘积是所有素数上玉河数的乘积,是一个正整数。我们重要地注意到,对于秩 1 的曲线,s=1 处的 L 值 L(E,1)=0。 ### 2.2 Mestre-Nagao 启发式方法 对于正实数界 B,Mestre-Nagao 和定义为 S(E,B)=1/logB ∑_{p<B} (a_p log p)/(p) · (1−p/(p−1) L(E,1)/…) ? 实际上,标准定义是 S(E,B)=1/(log B) ∑_{p<B} (a_p log p)/p。启发式方法是,对于秩 0 曲线,该和有界;对于高秩曲线,该和趋向于负大值。更精确地,对于秩 0 曲线 S(E,B)→const,而对于秩 1 曲线 S(E,B)∼−log log B [bieri2026murmurations]。因此,可以根据有限多个 Frobenius 迹来估计秩。 ### 2.3 变压器架构 我们使用一个带有两个 Transformer 层的编码器,隐藏维度 d=256,8 个注意力头,以及一个 512 个神经元的单层 MLP(激活函数为 ReLU)。输入是前 128 个归一化 Frobenius 迹 (a_1/2√1, a_2/2√2, ..., a_128/2√128),每个位置对应一个整数 n。序列位置包括一个 CLS 标记,其最终嵌入通过一个线性分类器传递以产生对数赔率。位置编码是学习到的;我们使用标准初始化方案。模型使用二元交叉熵损失进行优化。该模型在 NVIDIA RTX 4090 上训练约 3 小时。 ## 3 数据集 我们从 LMFDB [lmfdb] 收集了 20000 条导子 ≤10000 的有理椭圆曲线,已知秩为 0 或 1。我们用 80/20 分割训练集和测试集。我们还构建了一个“无扭折”测试集,其中所有与训练集中曲线同源或二次扭折的曲线都被移除。我们有约 50% 的曲线属于每个秩类别(由于我们采样时平衡了类别)。Frobenius 迹由 magma [magma] 计算。 ## 4 模型性能 在原始测试集上,准确率为 99.2% (秩 0) 和 99.3% (秩 1)。在无扭折测试集上,准确率基本不变:99.1% 和 99.2%。在测试集上的 F1 分数为 0.992。 ## 5 注意力分析 ### 5.1 平均注意力分布 对于 50 个模型中的每一个,我们计算平均注意力模式(在所有曲线和所有注意力头上平均)。我们观察到 CLS 标记在层 0 和层 1 中强烈关注素数位置。具体来说,素数位置的平均注意力权重是合数位置的 2-50 倍。这种模式在所有模型中定性一致。 ### 5.2 素数定位注意力 我们量化此效应:对于每个位置 n,我们令 A(n)=模型在 n 处的平均注意力权重。然后我们比较 A(p) 对 A(c),其中 p 是素数,c 是合数。我们计算比率 A(p)/A(c) 并在 50 个模型上平均。平均比率为 8.2,中位数为 7.9。 ### 5.3 讨论 对素数位置的专注与欧拉乘积结构 L(E,s)=∏_p (1−a_p p^{-s}+p^{1-2s})^{-1} 一致,其中 L 函数完全由素数处的取值决定。模型已经学会对最相关的特征给予更多关注。 ## 6 线性探针 ### 6.1 CLS 嵌入编码 log L(E,1) 我们从每个模型的 CLS 嵌入(在最终 Transformer 层之后,分类头之前)训练一个线性探针来预测 log L(E,1)。在 50 个模型上,R²=0.962±0.011(在控制导子后)。在没有控制导子的情况下,R²=0.88±0.02。这表明 CLS 嵌入捕获了 L(E,1) 的度量信息。 ### 6.2 其他探针 我们还将探针拟合到层 0 的 CLS 嵌入。在这种情况下,R²=0.72±0.04,表明 log L(E,1) 的表示在层 1 中得到细化。另外,探针预测秩(而非 log L(E,1))在 CLS 上给出 AUROC>0.94。 ## 7 激活修补 ### 7.1 方法 我们应用激活修补 [10.5555/3600270.3601532] 来识别哪些位置因果决定了秩预测。特别地,对于干净的秩 0 曲线和损坏的秩 1 曲线,我们将来自干净曲线的残差流激活 (l,p) 修补到损坏曲线中,并测量归一化对数赔率差:patch(l,p)=(Δ_logit(修补)−Δ_logit(损坏))/(Δ_logit(干净)−Δ_logit(损坏))。结果在 200 对曲线上平均。我们还注意到,信息流结构在 50 个解样本中定性一致。 ### 7.2 直接对数赔率归因 为了量化各个模型组件的相对贡献,我们通过直接对数赔率归因将对输出对数赔率差分解为每个注意力头和 MLP 层的贡献,遵循 [elhage2021mathematical]。特别地,我们有 Δ_logit=∑_{ℓ,h}(W_U·z_CLS^{(ℓ,h)})+∑_ℓ(W_U·m_CLS^{(ℓ)}),其中 W_U 是存储对数赔率权重差方向的去嵌入矩阵。左侧和是头的贡献,右侧和是 MLP 的贡献。在 50 个模型上,层 1 MLP 占主导:其平均绝对贡献是层 0 MLP 的 3.2 倍,是单个注意力头的 7.5 倍。注意力头总共占总对数赔率方差的不到 15%。这促使下一节对层 1 MLP 进行神经元级分析。请参阅图说明。图 5:质心模型的两面板激活修补图。顶部显示层 0 的激活修补。注意,最显著的素数是 p=31,13,19,这与模型接收最多注意力的素数不同。底部显示层 1 的激活修补,在 CLS 位置有一个完美的尖峰。 ## 8 MLP 电路分析与 Mestre-Nagao 和 ### 8.1 电路稀疏性 对于层 1 MLP 中的每个神经元 n(共 512 个),我们计算 Fisher 判别得分 F_n=|ā_{n,0}−ā_{n,1}| / √((σ²_{n,0}+σ²_{n,1})/2)。这里,ā_{n,r} 是秩 r 曲线的平均 ReLU 后激活。然后,我们从前 k 个神经元的激活拟合一个逻辑斯蒂探针,并测量 AUROC 随 k 的增加。我们还为每个 k 选择按 |w_n| 排序的前 k 个神经元,其中 w_n 表示神经元在模型*自身*权重下对对数赔率差的有效贡献。特别地,层 1 MLP 输出为 MLP(x)=W_2 ReLU(W_1 x+b_1)+b_2,其中 W_1∈ℝ^{512×d} 将 CLS 残差流映射到 512 维隐藏层,W_2∈ℝ^{d×512} 将隐藏层映射回 CLS 残差流。分类头计算 Δ_logit=v^T c,其中 c 是 CLS 嵌入,v=w^{(0)}−w^{(1)} 是对数赔率方向。因此,神经元 n 的有效权重为 w_n=(W_2^T v)_n,直接归因得分为 ∑_{n∈S_k} w_n h_n,其中 S_k 是分析神经元的集合,h_n 是隐藏神经元 n 的 ReLU 后激活。然后我们测量 AUROC 随 k 的增加。这两个得分在开始时分叉很大,然后在 k=200 处收敛。见图 6。在切割点 k=20 处,线性探针达到 AUROC 0.992,而直接对数赔率归因达到 AUROC 0.956,并且直接对数赔率归因曲线在 k 较小时是非单调的。请参阅图说明。图 6:左图绘制了 AUROC 与前 k 个神经元数量(针对两个得分)的差异。注意低 k 时最初的分叉。右图绘制了所有 512 个神经元按 |w_n| 排序的对数赔率贡献权重,蓝色表示秩 0 检测器神经元,红色表示秩 1 检测器神经元。特别地,注意直接对数赔率归因曲线在 k=1,...,5 时基本处于随机水平(0.501-0.507),然后在包含神经元 N199 时跳升至 AUROC 0.883(见图 7)。这反映了读出电路与判别电路之间的秩序不匹配:|w_n| 最大的十个读出权重神经元都在 Fisher 前 100 之外,并且没有一个属于 20 神经元秩判别电路:特别是,模型最大的 5 个读出权重指向对秩判别无关紧要的神经元。这种差距反映的是顺序而非方向:对六个读出符号与其放电模式不一致的电路神经元进行符号校正后,直接归因 AUROC 在每个 k 处基本不变。请参阅图说明。图 7:注意当添加神经元 N199 时 AUROC 的跳跃,尽管它不在按 Fisher 判别排序的前 20 个神经元中,表明读出次优。我们根据每个神经元的*放电模式*对其进行分类:计算 Δ_n = ā_{n,0}−ā_{n,1},即平均 ReLU 后激活差。Δ_n>0 的神经元是秩 0 检测器,Δ_n<0 的神经元是秩 1 检测器。我们根据放电模式明确分类,而不是根据 w_n 的符号,因为它们对几个电路神经元不一致。 ### 8.2 推挽架构 20 个电路神经元可以按放电模式分为 17 个秩 0 检测器和 3 个秩 1 检测器。每个神经元的预激活可以由一个素数加权线性形式 z_n≈∑_p c_p^{(n)} a_p+b_n 很好近似(R²=0.81-0.89),其中 h_n=ReLU(z_n)。第 8.3 节的回归显示,秩 0 检测器显示与 Mestre-Nagao 权重相关的系数轮廓,而秩 1 检测器显示与 Mestre-Nagao 权重反相关的轮廓(Spearman r 范围从 -0.48 到 -0.56)。每个类别因此在其自身的秩类上放电,并通过 ReLU 在另一个类别上被置零。请参阅图说明。图 8:左图显示了按 Fisher 判别排序的 20 个电路神经元,绘制了它们的对数赔率贡献权重和最相关素数。右图显示了电路的推挽架构:秩 0 和秩 1 检测器各计算一个缩放的 Mestre-Nagao 部分和。然后对数赔率权重将检测器连接成投票:这种连接特别强烈地是单向的。请参阅图 8 的电路图。放电类别和投票符号对 20 个电路神经元中的 14 个一致:对齐的秩 0 检测器以高达 w_n=0.83 的权重推动秩 0 对数赔率。不一致的六个神经元是系统性的:三个秩 0 放电神经元 N335、N456 和 N58(分别具有 w_n=-0.26、-0.27、-0.24)推动 t

相似文章

Transformer线性表示高度结构化的世界模型

arXiv cs.LG

本文证明,在数独求解轨迹上训练的Transformer构建了由领域约束组织的结构化世界模型,并识别出一个稀疏、单语义的电路,负责裸单决策规则。该工作为Transformer在组合任务上的推理提供了完全可解释的算法描述。

Transformer 数学探索器 [P]

Reddit r/MachineLearning

这个交互式工具通过数据流图可视化 Transformer 模型的数学基础,涵盖了从 GPT-2 到 Qwen 3.6 的架构以及各种注意力机制。