单义性的复仇:专门化神经元提升多层感知机的数据效率

arXiv cs.LG 论文

摘要

论文表明,在具有聚类数据的回归问题中,多层感知机自然发展出单义性的专门化神经元,通过学习局部低维表示而非全局表示来提高数据效率。

arXiv:2608.24007v1 公告类型:新 摘要:理解神经网络如何学习和组织特征是理解其行为的关键。许多现有的特征学习理论集中在全局低维预测几何的涌现上。我们证明这一图景是不完整的。在具有聚类数据的回归问题中,我们证明多层感知机 (MLPs) 自然发展出单义性的专门化神经元:单个神经元与输入空间特定区域相关的特定预测特征强烈对齐。多层感知机学习一组局部低维表示,而不是单一的全局低维表示,这些表示可以共同跨越一个高维空间。这种专门化可证明地赋予MLPs相对于基于全局低维表示的特征学习方法的数据效率优势。
查看原文
查看缓存全文

缓存时间: 2026/08/26 09:30

# 单义性反击:专业神经元提升MLP数据效率
来源:https://arxiv.org/html/2608.24007  
作者:Amirhesam Abedsoltan1,Enric Boix-Adsera2,Fivos Kalogiannis1,Mikhail Belkin3  
1. 加州大学圣地亚哥分校计算机科学与工程系  
2. 宾夕法尼亚大学沃顿商学院统计与数据科学系  
3. 加州大学圣地亚哥分校哈利西奥格鲁数据科学研究所  

###### 摘要
理解神经网络如何学习和组织特征是理解其行为的核心。许多现有的特征学习理论都聚焦于全局低维预测几何结构的涌现。我们证明这一图景是不完整的。在具有聚类数据的回归问题中,我们表明多层感知机(MLP)会自然地发展出**单义性的专业神经元**:单个神经元与输入空间特定区域相关的特定预测特征强烈对齐。MLP并非学习单一的全局低维表示,而是学习一系列局部低维表示,这些表示可以集体跨越一个高维空间。这种专业化在理论上赋予MLP相对于基于全局低维表示的特征学习方法的数据效率优势。

## 1 重新审视特征学习
神经网络的实证成功促使了大量工作,旨在理解是什么使神经网络能够优于经典学习方法(Allen-Zhu和Li, 2019 (https://arxiv.org/html/2608.24007#bib.bib13); Ghorbani et al., 2019 (https://arxiv.org/html/2608.24007#bib.bib11); Ghorbani et al., 2020a (https://arxiv.org/html/2608.24007#bib.bib2))。一个著名的解释是它们执行*特征学习*的能力:神经网络不是在训练前固定的表示上优化预测器,而是可以使用监督信号使其内部表示适应预测任务的结构(Bengio et al., 2013 (https://arxiv.org/html/2608.24007#bib.bib14))。固定表示和特征学习之间的区别可以通过神经切线核(NTK)形式化。在特定的初始化缩放和无限宽度极限下,神经网络训练收敛于使用在整个训练过程中保持固定的NTK的核梯度下降(Jacot et al., 2018 (https://arxiv.org/html/2608.24007#bib.bib6); Lee et al., 2019 (https://arxiv.org/html/2608.24007#bib.bib15))。在此机制下,神经网络实际上等效于一个在固定表示上运行的经典核方法。然而,脱离此机制,NTK可能在训练过程中发生显著演化,由此产生的动力学不能再由初始化时固定的核来描述(Chizat et al., 2019 (https://arxiv.org/html/2608.24007#bib.bib1); Woodworth et al., 2020 (https://arxiv.org/html/2608.24007#bib.bib17); Geiger et al., 2020 (https://arxiv.org/html/2608.24007#bib.bib18); Yang and Hu, 2021 (https://arxiv.org/html/2608.24007#bib.bib8))。这就提出了一个基本问题:*这种核演化何时能提供相对于基于固定核的方法的优势?*

理解神经网络的一个重大进展是认识到神经网络可以利用目标中的低维结构,即预测仅依赖于输入空间中的少数方向。在这种情况下,神经网络可以调整其表示以识别这些预测方向,而固定特征(如核方法)则不能(Bach, 2017 (https://arxiv.org/html/2608.24007#bib.bib19); Soltanolkotabi, 2017 (https://arxiv.org/html/2608.24007#bib.bib12); Yehudai和Shamir, 2019 (https://arxiv.org/html/2608.24007#bib.bib16); Wei et al., 2019 (https://arxiv.org/html/2608.24007#bib.bib20); Ghorbani et al., 2019 (https://arxiv.org/html/2608.24007#bib.bib11); Ghorbani et al., 2020b (https://arxiv.org/html/2608.24007#bib.bib7); Malach et al., 2021 (https://arxiv.org/html/2608.24007#bib.bib21); Abbe et al., 2022 (https://arxiv.org/html/2608.24007#bib.bib10); Abbe et al., 2023 (https://arxiv.org/html/2608.24007#bib.bib30); Ba et al., 2022 (https://arxiv.org/html/2608.24007#bib.bib9); Damian et al., 2022 (https://arxiv.org/html/2608.24007#bib.bib3); Dandi et al., 2024 (https://arxiv.org/html/2608.24007#bib.bib28); Bruna和Hsu, 2025 (https://arxiv.org/html/2608.24007#bib.bib31))。在这种情况下,目标形式为 f(x) = g(U⊤x), U ∈ ℝ^(d×r), r ≪ d。虽然 x ∈ ℝ^d,但响应仅取决于由 U 的列张成的 r 维预测子空间。特征学习方法可以使用模型的响应来学习与预测子空间对应的表示,从而有效地将问题从环境维度 d 降低到内在维度 r。相比之下,与标签无关的固定表示仍然依赖于 d 维。总而言之,这条研究路线将特征学习主要视为发现低维预测结构的机制:监督重塑表示,使得学习由任务的内在维度而非输入的环境维度所支配。

在我们的工作中,我们发现了多层感知机(MLP)中一种性质不同的特征学习机制,它并不根本地与恢复单一全局低维预测子空间相关。在这种设置中,数据来自多个聚类,每个聚类可以有其自身的预测方向和自身的链接函数。  
![[未标注图像]](https://arxiv.org/html/2608.24007v1/figs/setting.png)  
因此,尽管在每个聚类内部预测问题可能是低维的,但全局可能不存在低维结构。我们表明MLP可以同时发现聚类结构并学习与每个聚类相关的预测函数。这揭示了一种新的特征学习形式,超越了恢复单一全局低维预测子空间的标准范式。我们的主要贡献如下:

我们表明,在训练过的MLP中,相当一部分单个神经元变得*单义性*,主要通过对齐于特定的聚类特定预测方向而专门化。这种专门化使MLP能够学习相关的局部低维特征以及一个隐式聚类,该聚类决定了每个特征在哪里有用。由此产生的行为类似于混合专家路由,但它是标准MLP内部涌现的,无需显式路由模块或专家分解。虽然这种专门化对于标准ReLU和GeLU(Hendrycks和Gimpel, 2016 (https://arxiv.org/html/2608.24007#bib.bib40))也会发生,但具有乘法门控的现代架构,如ReGLU和SwiGLU(Shazeer, 2020 (https://arxiv.org/html/2608.24007#bib.bib22)),可以显著提高此设置中的样本效率。此外,我们表明,随着聚类数量的增长,这种专门化会导致越来越有利的样本复杂度缩放,使MLP即使在聚类特定预测方向共同跨越环境空间且不存在有用的全局低维结构时,也能保持强大性能。

### 1.1 讨论
本研究中识别的特征学习形式与经典的特征学习不同,后者的主要目标是恢复单一的全局低维预测子空间。在此类情况下,为学习低维特征设计的方法可以表现得与MLP一样好或更好。一个突出的例子是递归特征机(RFM),这是一种基于监督的核方法,它使用输入-响应对来学习全局低维预测子空间(Radhakrishnan et al., 2024 (https://arxiv.org/html/2608.24007#bib.bib5); Radhakrishnan et al., 2025 (https://arxiv.org/html/2608.24007#bib.bib4))。因此,RFM是一个特别有信息量的比较对象:像MLP一样,它从数据中学习特征,而不是在固定表示上操作。  
![[未标注图像]](https://arxiv.org/html/2608.24007v1/figs/main_idea_final.png)  
然而,随着聚类数量的增加,聚类特定预测方向的跨度会增长,直到等于环境空间,因此它们不再位于单一的低维全局子空间中。这证明了MLP的一个关键优势——它们可以使用神经元专门化来保留每个预测方向与其相关聚类之间的关联,从而在聚类数量增长时仍保持有效,而RFM的特征学习能力随着聚类数量的增加而减弱。

为了系统地研究这种现象,我们考虑单索引模型的混合。假设数据来自 K 个聚类。对于属于聚类 c ∈ [K] 的输入 x ∈ ℝ^d,目标为 f(x) = g_c(v_c⊤x), v_c ∈ ℝ^d。因此,预测在每个聚类内是一维的,但相关的方向 v_c 和链接函数 g_c 可能因聚类而异。经典的单索引模型对应于 K = 1。然而,当 K > 1 时,不同聚类的预测方向可能共同跨越整个环境空间:rank([v_1 ... v_K]) = d。因此,即使在每个聚类内预测是低维的,也可能没有有用的全局低维预测子空间可供恢复。

### 1.2 先前工作
##### 全局低维结构的特征学习。大量工作研究了多索引目标的特征学习。这些研究表明,神经网络模型可以适应输入的未知低维子空间,在固定核方法样本效率低下的情况下取得成功(Bach, 2017 (https://arxiv.org/html/2608.24007#bib.bib19); Soltanolkotabi, 2017 (https://arxiv.org/html/2608.24007#bib.bib12); Yehudai和Shamir, 2019 (https://arxiv.org/html/2608.24007#bib.bib16); Ghorbani et al., 2020b (https://arxiv.org/html/2608.24007#bib.bib7))。最近的文献描述了基于梯度的训练如何在各向同性数据中成功恢复这个子空间(Abbe et al., 2022 (https://arxiv.org/html/2608.24007#bib.bib10); Abbe et al., 2023 (https://arxiv.org/html/2608.24007#bib.bib30); Damian et al., 2022 (https://arxiv.org/html/2608.24007#bib.bib3); Ba et al., 2022 (https://arxiv.org/html/2608.24007#bib.bib9); Dandi et al., 2024 (https://arxiv.org/html/2608.24007#bib.bib28); Damian et al., 2025 (https://arxiv.org/html/2608.24007#bib.bib32); Bruna和Hsu, 2025 (https://arxiv.org/html/2608.24007#bib.bib31)),以及在相关设置中对具有恒定聚类数的高斯混合数据进行分类(Refinetti et al., 2021 (https://arxiv.org/html/2608.24007#bib.bib34); Ben Arous et al., 2024 (https://arxiv.org/html/2608.24007#bib.bib35))。然而,在我们的工作中,我们证明神经元专门化是一种不同的特征学习形式,使MLP能够高效处理单一全局低维表示不足的设置。

##### 神经元专门化。专门化神经元的出现在多种情境下已被观察到。例如,训练神经网络进行模块化算术会导致专门化神经元,每个神经元代表不同的傅里叶分量(Nanda et al., 2023 (https://arxiv.org/html/2608.24007#bib.bib54); Gromov, 2023 (https://arxiv.org/html/2608.24007#bib.bib53); Morwani et al., 2024 (https://arxiv.org/html/2608.24007#bib.bib52); He et al., 2026 (https://arxiv.org/html/2608.24007#bib.bib29))。在学习XOR型目标时,也已证明神经元专门化于四个聚类,而不是均匀分布在预测低维子空间中(Frei et al., 2023 (https://arxiv.org/html/2608.24007#bib.bib27); Glasgow, 2024 (https://arxiv.org/html/2608.24007#bib.bib39))。并且在教师-学生设置中,已表明学生的神经元经常与教师的神经元对齐(Tian, 2020 (https://arxiv.org/html/2608.24007#bib.bib23); Oostwal et al., 2021 (https://arxiv.org/html/2608.24007#bib.bib24); Zhu et al., 2025 (https://arxiv.org/html/2608.24007#bib.bib33)),尽管这取决于初始化(Jarvis et al., 2025 (https://arxiv.org/html/2608.24007#bib.bib25))。这些工作主要研究对全局相关特征或本身决定目标的聚类方向的专门化。在我们的工作中,神经元专门化于局部预测特征。因此,MLP不仅要学习预测方向,还要保留它们与相关聚类的关联。此外,这些工作并未分离出专门化相对于基于单一全局表示的自适应特征学习方法(如递归特征机(Radhakrishnan et al., 2024 (https://arxiv.org/html/2608.24007#bib.bib5)))的样本复杂度优势。我们建立了这种优势:当聚类特定预测方向共同跨越高维空间时,神经元专门化使MLP能够保留这些局部特征-聚类关联,并实现更好的样本复杂度。

##### 单义性。对语言模型的可解释性工作发现,一些单个神经元是单义性的,主要响应于单个可解释的概念或模式,而另一些是*多义性的*,响应于多个不同的概念或模式(Bills et al., 2023 (https://arxiv.org/html/2608.24007#bib.bib55); Elhage et al., 2022 (https://arxiv.org/html/2608.24007#bib.bib56))。最近的工作认为,单义性特征不一定与单个神经元对齐,并使用稀疏字典学习从神经表示中恢复更多的单义性特征方向(Bricken et al., 2023 (https://arxiv.org/html/2608.24007#bib.bib57); Templeton et al., 2024 (https://arxiv.org/html/2608.24007#bib.bib58))。我们的工作表明,至少在简单的MLP中,单义性特征可以直接在单个神经元层面涌现,并且这种神经元层面的专门化相比于局限于全局特征发现的方法可以提高样本效率。

##### 混合专家模型。一条互补的研究路线研究了混合专家(MoE)架构中的专门化和潜在聚类恢复。Chen等人(2022年)(https://arxiv.org/html/2608.24007#bib.bib36)分析了一个聚类分类问题,并表明MoE路由器可以学习聚类中心特征,将问题划分为由不同专家处理的更简单的子问题。Dikkala等人(2023年)(https://arxiv.org/html/2608.24007#bib.bib37)同样从理论上和实证上表明,学习到的路由器可以根据潜在聚类对输入进行路由。特别接近我们统计设置的是,Kawata等人(2025年)(https://arxiv.org/html/2608.24007#bib.bib38)研究了具有潜在单索引模型聚类结构的非线性回归,并表明通过SGD训练的MoE可以检测到潜在组织并将其划分为特定于聚类的子问题;在他们的假设下,普通神经网络在他们的多项式复杂度范围内无法检测到这种组织。这些工作通过显式路由器和分离的专家将专门化构建到架构中。相比之下,我们研究了没有显式路由或专家分解的标准MLP,并表明隐式聚类和相应的局部预测特征...

相似文章

深度单项式网络中的奇异学习与奥卡姆剃刀

arXiv cs.LG

本文研究了具有单项式激活函数的深度全连接网络中的临界点,证明了当激活度足够大时,临界性恰好出现在子网络中,从而为模型倾向于收敛到更简单函数的隐式偏差提供了数学视角。