从损失景观到神经网络的多样特征学习

arXiv cs.LG 论文

摘要

本论文通过谱动力学阐明神经网络损失景观中的模式连通性,解释诸如grokking和记忆化等现象,并将见解应用于增强多样特征学习和实际神经网络训练。

arXiv:2608.28948v1 公告类型:新 摘要:在过去十年中,神经网络已从学术好奇心发展到推动国家市场。尽管研究和部署都出现了爆发式增长,但对其如何实现现有解决方案的理解相对较少。这既与科学相关,也对社会紧迫。当神经网络在自动驾驶、建筑、法律、招聘和医疗等领域做出决策时,已经存在并将继续存在意外后果。 然而,试图概括最大和最重要的生产系统的失败是一项非常困难的任务。但这些失败的迹象存在于神经网络的所有规模上,因此我们应能够研究一个更易于处理的环境。所有神经网络都必须经历一个称为训练的优化过程才能变得有用。在很大程度上,理解神经网络就是理解它们的优化:通过什么过程以及接触哪些数据来得到结果。但我们在这个领域的知识相当不精确。特别是,一种名为模式连通性的奇特现象——在损失曲面中连接神经网络的能力——完全无法解释。 本论文阐明、解释并利用损失景观中的这种特殊结构...
查看原文
查看缓存全文

缓存时间: 2026/09/01 13:02

# 摘要  
来源:https://arxiv.org/html/2608.28948  
# 《从损失景观到神经网络的多样化特征学习》  
作者:David Aram Yunis  
博士论文(部分要求)  
计算机科学哲学博士,TOYOTA TECHNOLOGICAL INSTITUTE AT CHICAGO  
伊利诺伊州芝加哥市,2026年9月  

论文委员会:  
Matthew R. Walter(论文导师)  
Michael Maire  
David McAllester  
Mikhail Belkin  

图1:神经网络损失景观的“帽子”结构。我们展示了这一结构,为其提供了初步解释,并利用该解释改进了实用的神经网络。  
过去十年间,神经网络已从学术界的好奇对象发展为推动国家市场变革的核心力量。尽管相关研究与部署呈现爆发式增长,人们对神经网络如何获得当前解决方案的理解仍相对匮乏。这既具有科学意义,也对社会具有紧迫性。当神经网络在自动驾驶、建筑、法律、招聘和医疗等领域做出决策时,曾出现且将继续出现非预期的后果。然而,尝试归纳最大、最重要生产系统的失败案例极为困难。但神经网络各层级中都存在此类失败的迹象,因此我们应当能在更可研究的场景中展开分析。所有神经网络必须经历被称为“训练”的优化过程才能发挥作用。理解神经网络在很大程度上等同于理解其优化过程:它们通过何种程序、接触哪些数据从而得出当前结果?然而,学界在此问题上的认知仍相当模糊。尤其值得注意的是,一个被称为“模态连通性”的特殊现象——即在损失曲面(图1 https://arxiv.org/html/2608.28948#Chx1.F1)中连接神经网络的能力——完全难以解释。  
本论文阐明、解释并利用了损失景观中的这一特殊结构。我们首先深入剖析模态连通性现象,证明其比先前认知更复杂、更具普遍性,且无法用已提出的常见理论解释。模态连通性将神经网络与过去简单模型区分开来。为解释该现象,我们提出一种以权重谱动力学为中心的经验方法——即优化过程中奇异值与奇异向量的行为。这些谱动力学不仅为损失景观的奇特结构提供了解释,还连接了包括顿悟学习(grokking)、彩票假设(lottery tickets)、记忆化(memorization)和正则化(regularization)在内的多种现象。这种高度统一的关联性此前在神经网络现象学研究中尚未出现。  
借助谱动力学的有力视角,我们将注意力转向多样化特征学习,旨在扩大神经网络从数据中提取的信息量。研究发现,这种谱视角使我们能够在简单场景中克服虚假关联(spurious correlations),且无需先前研究中常见的针对任务、损失或架构的特殊假设。基于此理解,我们进一步改进了更实用的神经网络训练方法,将其扩展至语言建模领域。我们希望这些成果能为未来神经网络研究提供蓝图。  

献给我的父亲。  

## 致谢  
很难说我的博士生涯非常愉快。经历了诸多波折、投稿失败,以及对即将呈现的这项工作的大量疑虑,我曾倍感艰辛。但这段经历极具意义。在攻读学位的大部分时间里,我因各种原因承受着各种压力,而在许多黑暗时刻,光明总是来自身边的人。与他人并肩奋斗自有其意义。我由衷感谢以下人员:  
首先感谢我的导师Matt Walter……我该怎么说呢?毫不夸张地讲,我职业生涯的起点源于Matt。当我还是一个过度自信、目光炯炯的本科生时,他接纳了我并给予成长空间。在研究生院初期,我曾误入歧途,多年研究其他课题,但即使在我成为名不见经传的三年级学生、尚未发表任何论文时,他仍欣然欢迎我重返实验室。他包容我的固执,支持我探索广泛课题的兴趣,并在众人质疑我的工作时,允许我开展本论文的研究。我至今仍不确定这一切是如何实现的,但我对他怀有深深的感激。他在研究、合作、跨学科工作、社会参与以及工作生活平衡方面都是我的榜样。希望你们能有机会与他合作,若研究对象是真正的机器人则更佳。  
我同样感谢论文委员会的各位成员。与Matt一样,Michael Maire也在我论文匮乏、信心低迷的糟糕三年级时接纳了我。我感激他敏锐的洞察力、对我过渡期的支持,以及他总能深入挖掘新实验的能力。希望我也能习得这些特质。在访问日与David McAllester的初次交流中,他转过显示器,指着GPT-2的输出对我说“别做理论研究”。或许没有这个推动,我就不会发现如今对实验的热爱。当然,本论文也不会以现有形式存在。在David那间角落办公室的对话总是特别愉快,无论是关于人工智能与社会、信息论还是自动定理证明的话题,都拓宽了我的视野。最后感谢Misha Belkin,尤其感谢他在这项工作仅呈现为笔记本电脑上几张图表时就给予的乐观态度与兴趣。他在TTIC讲解“双下降”现象的演讲,是我在研究生阶段听到的最佳报告之一;在机场前于酒店大堂进行的30分钟积极对话,支撑我度过了他人多年的质疑。能在工作尾声正式邀请他参与讨论,得以像同行般交流,并在加州阳光下前往UCSD度过了精彩一周,畅想特征学习的未来,令我深感满足。谢谢您。  
TTIC和芝加哥大学学术社区是支持研究的沃土。我得以在这栋小小的建筑里接触机器学习的方方面面,感谢那些帮助我实现这点的人,尤其是同学们。感谢Falcon Dai将我引入机器学习领域并带入实验室,感谢那些关于研究和志存高远的讨论。感谢Chip Schaff为我指点迷津,树立了科研工程师的典范。感谢Andrea Daniele的陪伴,他让实验室充满机器人,也让其他成员显得更出色。感谢Shane Settle和Shubham Toshniwal在COVID期间的建议,感谢他们在一切秩序崩塌时仍支持我坚持项目,提醒我所拥有的已足够渡过难关。感激你们站在我这边。感谢Pedro Savarese作为前辈的榜样力量,激励我为兴趣冒险一搏,感谢他的体贴以及对我早期稚嫩想法的认真对待。感谢Takuma Yoneda在我回归Matt团队、信心低迷时首个支持我的奇思妙想,并成为可讨论的伙伴。感谢Sudarshan Babu深夜的对话、幽默感、共担苦难与陪伴。感谢Kshitij Patel在所有工作中的早期合作,他的务实精神和尝试发现价值的意愿。感谢Gal Vardi对本论文核心章节的坚定支持。感谢Jungo Kasai帮助我了解实习市场,展示人脉网络的价值。感谢Kevin Stangl和Nick Kolkin的早餐聚会,以及在学位收尾阶段的帮助。感谢Sam Buchanan的好奇心和许多充实对话。感谢Pushkar Shukla的友谊,以及他相似的经历让我意识到并非独自前行。  
我也想感谢更广泛的TTIC社区。Rose Bradford在某个圣诞节假期花费巨大精力处理我的奖学金问题,使其不再阻碍实习。她在其他时候也继续为我牺牲,我心怀感激。感谢Asha在深夜时光带来的愉悦,让TTIC工作环境更舒适。感谢Mary Marre在整个学位期间对我的坚定支持,在我需要时提醒我注意任何遗留事项。感谢Chrissy Novak、Amy Minick、Erica Cocom和Alicia McClarin的高效响应,让许多本易变得繁琐的行政工作变得轻松。感谢Adam Bohlander在LLM时代之前的不懈教导,收到他关于办公室新技术的消息总是独特乐趣,每次交流离开时我都比来时更懂得多。感谢Jerry年复一年在冬日黑暗中带来的明亮能量,即使在我深陷低谷时亦如此。我心怀感激。  
特别感谢Xiao Zhang在博士中段与我的合作。我们开始合作时,我正为生存挣扎,庆幸在当时抓住了你的手。那个项目为我注入动力,虽与本论文无关,却给了我再次挑战此课题的信心。感谢提醒:有时只需优秀合作者,其余自会到来。  
专业同事方面,感谢Rui Shen在我学业困难时提供实习机会,鼓励我重返研究生院争取学位。感谢Andrew Anderson从早期就对我作为同事的信任,以及在纽约郊区夏天的友谊。感谢Fantine Huot的支持、务实精神,以及向我展示如何实现职业平衡。感谢Joshua Maynez、Sian Gooding和Q Green给予的工作场所归属感——这是我不曾想象的奇妙体验。感谢Mirella Lapata的犀利幽默和求职时直接实用的建议。感谢Sohee Wang在办公室深夜追逐梦想时的同袍情谊。  
时光荏苒,博士生涯接近尾声时,事情开始好转。特别是我在Matt实验室度过了愉快的最后一年,除了从事并享受自己的研究外,也很高兴与一群新同学互动。感谢Xiaodan Du、Tianchong Jiang、Luzhe Sun、Vincent Tan、Teddy Ayalew、Haoran Chen、Hung Le、Sam Wheeler、Jingtian Ji和Richard Xu。与你们共事、提供建议、向新一代学习的体验令人愉悦,我也得以反思所有早期错误。我怀念夏日里一同漫步午餐的时光,怀念小组会议两小时后仍继续的热烈讨论。希望你们从我们的互动中获得了有意义的启发,也希望我的经验能超越自身价值。感谢你们对我的信任。  
除了上述学术与职业联系,还有个人层面需要感谢。亲爱的朋友们:Miles Grogger、Lucas Penido、Kevin Li、Lucas Fagen、Jainaha Srikumar、Phil Blok。感谢你们在我最艰难时刻的陪伴,也感谢见证我高光时刻。我将永远珍藏答辩时满室的回忆。感激你们包容我,永远信任我。感谢Sensei Winston和空手道俱乐部其他成员,你们的恒久、修行和钢铁意志直接应用于这段学位历程。Osu!  
Gracias a mi Abuela por su confianza en mí. Y al resto de la familia en Colombia, en particular mi tío Iván, mi prima Alicia y mi Abuelo. Estar y hablar con ustedes siempre fue un descanso.(感谢祖母对我的信任。感谢哥伦比亚的其他家人,特别是叔叔Iván、表妹Alicia和祖父。与你们相处交谈总是放松。)  
感谢妹妹Catherine的轻松态度,以及洛杉矶日落时分的一系列温馨片段。共享餐桌旁的餐食提醒我们是谁,即使我漫无目的地在工作中漂浮时也让我脚踏实地。感谢母亲作为榜样,教我如何让世界触碰而不扰动。感谢花草、花园、厨房,以及务实完成工作的态度。感谢父亲多年来始终以我需要(虽不总如我所愿)的方式提醒我:最重要的是永不放弃。如同之前的旅程,我的博士生涯是一系列“不退学”的决定:第一年疫情中的决定,第二年研究进展停滞而同侪前行时的决定,实习后觉得无所适从时的决定,资深研究者质疑我工作价值时需寻找新方向的决定,多次论文遭三至四轮拒稿的决定,以及录用后毫无回响时的决定。现在我认为最重要的是坚持,而我能坚持全靠上述及不可避免遗漏的人们。感谢在这些时期身边有如此多优秀之人,没有他们的支持,我难以继续前行。希望你们喜欢他们在后续章节中给予的支持结晶。  

###### 目录  
1. [摘要](https://arxiv.org/html/2608.28948#Chx1)  
2. [1 引言](https://arxiv.org/html/2608.28948#Ch1)  
   1. [1.1 贡献](https://arxiv.org/html/2608.28948#Ch1.S1)  
3. [2 背景](https://arxiv.org/html/2608.28948#Ch2)  
4. [3 论神经网络的凸性与线性模态连通性 Yunis 等 (2022)](https://arxiv.org/html/2608.28948#Ch3)  
   1. [3.1 引言](https://arxiv.org/html/2608.28948#Ch3.S1)  
   2. [3.2 凸模态连通性](https://arxiv.org/html/2608.28948#Ch3.S2)  
   3. [3.3 凸性度量](https://arxiv.org/html/2608.28948#Ch3.S3)  
   4. [3.4 端点多样性](https://arxiv.org/html/2608.28948#Ch3.S4)  
   5. [3.5 讨论](https://arxiv.org/html/2608.28948#Ch3.S5)  
5. [4 通过权重谱动力学研究深度学习 Yunis 等 (2024)](https://arxiv.org/html/2608.28948#Ch4)  
   1. [4.1 引言](https://arxiv.org/html/2608.28948#Ch4.S1)  
   2. [4.2 相关工作](https://arxiv.org/html/2608.28948#Ch4.S2)  
      1. [4.2.1 奇异值动力学](https://arxiv.org/html/2608.28948#Ch4.S2.SS1)  
      2. [4.2.2 低秩特性](https://arxiv.org/html/2608.28948#Ch4.S2.SS2)  
   3. [4.3 共同量化指标](https://arxiv.org/html/2608.28948#Ch4.S3)  
   4. [4.4 顿悟学习与秩最小化](https://arxiv.org/html/2608.28948#Ch4.S4)  
   5. [4.5 跨任务谱动力学](https://arxiv.org/html/2608.28948#Ch4.S5)  
      1. [4.5.1 方法论](https://arxiv.org/html/2608.28948#Ch4.S5.SS1)  
      2. [4.5.2 有效秩最小化](https://arxiv.org/html/2608.28948#Ch4.S5.SS2)  
      3. [4.5.3 层间奇异向量对齐](https://arxiv.org/html/2608.28948#Ch4.S5.SS3)  
   6. [4.6 权重衰减的影响](https://arxiv.org/html/2608.28948#Ch4.S6)  
   7. [4.7 其他关联](https://arxiv.org/html/2608.28948#Ch4.S7)  
   8. [4.8 随机标签下的谱动力学](https://arxiv.org/html/2608.28948#Ch4.S8)  
   9. [4.9 超越泛化性](https://arxiv.org/html/2608.28948#Ch4.S9)  
      1. [4.9.1 主奇异向量更早稳定](https://arxiv.org/html/2608.28948#Ch4.S9.SS1)  
      2. [4.9.2 彩票假设保留最终主奇异向量](https://arxiv.org/html/2608.28948#Ch4.S9.SS2)  
      3. [4.9.3 谱动力学与线性模态连通性](https://arxiv.org/html/2608.28948#Ch4.S9.SS3)  
   10. [4.10 讨论](https://arxiv.org/html/2608.28948#Ch4.S10)  
6. [5 克服虚假关联...](原文截断)

相似文章

神经网络损失景观的谱渐近:曲率指数的精确分解

arXiv cs.LG

本文提出了神经网络损失景观中曲率指数α的精确分解,解释了为何该指数在不同层类型间存在差异。引入了谱对齐分解,并导出了一个谱传递恒等式,连接曲率、梯度秩衰减和Hessian指数,该恒等式已在多种架构和数据集上得到验证。

损失不足:对比表示学习中的采样条件与归纳偏置

arXiv cs.LG

本文发展了一个测度论框架,分析对比学习何时恢复有意义的潜在几何结构,引入了正对采样的'多样性条件'和一个支持修正的InfoNCE变体。实验表明,采样多样性与架构归纳偏置在对比表示学习中存在关键交互。

Transformer 残差流的动力学:谱几何与网络拓扑的耦合

arXiv cs.LG

本文对生产规模的大型语言模型进行了完整的 Jacobian 特征分解,揭示了从旋转主导的早期层到对称后期层的习得谱梯度,以及一个压缩扰动的低秩瓶颈。结果将扰动传播与压缩与网络功能拓扑联系起来。

遗忘并非擦除:通过传输键恢复潜在知识

arXiv cs.LG

本文认为神经网络中的灾难性遗忘并非擦除,而是一个接口对齐问题。它提出了'传输键'来从顺序训练的模型中恢复潜在的任务特定特征,展示了在分割CIFAR-100上的显著性能恢复。