@BetaTomorrow: https://x.com/BetaTomorrow/status/2076465790925336763
摘要
本文从范畴论视角深入探讨迁移学习,提出深度流形理论,认为神经网络通过无属性数值计算学习关系结构,从而实现跨领域迁移,并解释了分类的内在逻辑。
查看缓存全文
缓存时间: 2026/07/13 15:56
关于范畴论视角下迁移学习的数学思考
English Edition: Mathematical Considerations for Transfer Learning through Category Theory
我没有接受过范畴论的正规教育或训练。然而,通过深度流形,我们发现 Transformer 最终是通过无属性数值计数来完成分类的。这个观察促使我开始探索范畴论: 不是为了声称神经网络在形式上实现了范畴论,而是把它作为一种可能的语言,用来理解神经网络如何分类、抽象,并在不同领域之间迁移已经学习到的结构。
深度流形视角
关于神经网络与范畴论的联系,已经有不少研究。许多工作使用范畴论作为一种形式化语言,来描述组合、表示、等变性、逻辑或学习系统。图神经网络也许是目前最接近范畴论式实现的神经网络架构,因为它们本来就运行在显式的关系结构之上:节点、边、邻域、路径和消息传递。在这个设定中,范畴论可以很自然地描述信息如何在图结构中被保持、变换和组合。
但深度流形的出发点不同。
第一,深度流形从无属性数值计数开始。神经网络并不是从符号意义、对象属性或人类定义的类别开始的。它从没有内在属性的数值状态开始。通过模型架构、数据和训练,这些无属性数值状态被塑造成已经学习到的关系、变换和组合路径。分类不是从被储存的语义对象中产生的,而是从已经学习到的数值结构中涌现出来的。
第二,深度流形并不限于图神经网络这类显式关系架构。在图神经网络中,图结构通常已经被给定:节点和边提供了关系骨架。深度流形提出的是一个更广泛的问题:当输入一开始只是无属性数值状态,而不是一个显式图结构时,关系式抽象如何在普通神经网络,包括 Transformer 中涌现?在这个视角下,关系结构并不只是由数据格式直接提供的;它是通过模型架构、堆叠流形覆盖,以及以不动点类理论为基础的数据与训练策略学习出来的。
这正是深度流形提供独特统一视角的地方。它把类似范畴论的抽象、模型架构,以及以不动点类理论为基础的数据与训练策略连接起来。范畴论提供关系、态射、组合和分类的语言。模型架构提供这些关系得以被学习的计算结构。由不动点类理论指导的数据与训练策略,则提供边界条件,决定哪些关系结构能够稳定、复用并迁移。
这并不意味着 Transformer 在形式上实现了范畴论。那样的说法太强。更准确地说,深度流形指出,神经网络之所以能够呈现出类似范畴论的抽象性,是因为其学习到的计算在堆叠流形覆盖之间具有关系性、组合性和可迁移性。深度流形的贡献不是取代范畴论,也不是把神经网络还原为形式范畴论,而是追问:关系式抽象如何能够从无属性数值计算中产生?
范畴论与分类的内在逻辑
范畴论常被认为是现代数学中最抽象的分支之一。但它的抽象并不是空洞的抽象。它的力量来自一个简单的注意力转移:不是问一个对象内部包含什么,而是问对象之间如何相互关联、如何变换、如何组合,以及如何通过这些关系保持结构。
这也是为什么范畴论与分类有如此深的联系。分类并不只是把东西放进不同盒子里。浅层分类只是列出相似性。更深层的分类则解释为什么不同事物属于同一类,一个结构如何能够变换成另一个结构,以及在这些变换中什么东西保持不变。
在这个意义上,范畴论不仅是分类的工具;它是分类内在逻辑的语言。它不是只根据对象的内部实体来定义对象,而是通过对象之间的关系、态射、变换,以及对象在更大结构中的角色来定义对象。
这个视角对于理解神经网络很重要。神经网络并不只是记忆对象属性。它并不会把“猫性”、“红色”、“语法”或“推理”作为固定的符号对象储存在权重中。相反,它学习的是数值关系。它学习一个无属性数值状态如何被变换成另一个数值状态,局部结构如何跨层组合,以及最终输出如何从一长串已经学习到的变换中被分类出来。
从深度流形的视角看,神经网络因此呈现出一种类似范畴论的抽象性。意义并不存在于孤立的激活值或被储存的对象属性之中。意义是从跨越堆叠流形覆盖的、无属性数值状态之间所学习到的关系、变换与组合中涌现出来的。
意义在层叠流形覆盖中涌现
这也重新诠释了下一词元预测。Transformer 的最后一步通常被描述为预测下一个词元,但从数学上看,它实际上是一个大规模分类任务。给定上下文,模型会在所有可能的下一个词元上生成一个概率分布,并从一个极其庞大的离散词表中选择、采样或排序词元。
然而,最终的分类只是可见的终点。在到达这一终点之前,模型已经对提示进行了深层次的复合变换。每一层都会重塑数值状态;每一个注意力模块和前馈模块都会改变词元之间的局部关系;每一条残差路径都会承载并持续修改不断演化的状态。
因此,如果以一种过于简单的方式说语言模型“不过是下一词元预测器”,就会产生误导。是的,它的训练目标是下一词元预测;是的,最后一步是在词表上进行分类。但使这种分类成为可能的已学习结构并不简单。它是通过层叠的流形覆盖、已学习的关系、复合计算路径,以及由数据、模型架构和训练策略共同提供的边界条件而构建起来的。
范畴论帮助我们命名这种抽象层次。它提醒我们,结构并不总是存在于孤立对象内部。结构可以存在于关系之中。一个单标本身没有意义。一个激活值本身没有意义。一个神经元本身也没有意义。只有当这些无属性数值状态被放入已学习的关系系统中,并在层与层之间被变换时,意义才会出现。
用深度流形的语言来说,数学覆盖是更深层的已学习结构,而物理覆盖是可观察行为:激活、logits、分类、生成的单标和模型输出。输出单标不是流形本身。它只是在某个特定边界条件下,已学习流形计算留下的一条迹线。
为什么跨领域迁移学习是可能的
这种类似范畴论的抽象性,也有助于解释为什么跨领域迁移学习在理论上是可能的。神经网络并不需要把某个固定的对象属性从一个领域转移到另一个领域。它可以迁移关系结构和组合结构。
例如,模型可能在语言中学习到某些关系式结构,后来这些结构有助于代码任务。它可能学习到视觉与文本之间的对应关系,后来这些对应关系有助于多模态推理。它可能在一个领域中学习到组合模式,而这些模式在另一个领域中变得有用。迁移并不是魔法。它之所以可能,是因为已学习的计算并不只绑定在表面属性上,而是组织在更深层的数值关系之中。
当模型架构、数据和训练策略能够提供兼容的流形覆盖与边界条件时,这些已经学习到的结构就可以在新的领域中被复用、变换并稳定下来。这就是为什么同一个基础模型常常可以从文本迁移到代码,从语言迁移到推理,从图像迁移到描述,或者从科学数据迁移到预测任务。模型并不只是复制表面特征。它是在复用已经学习到的关系结构。
这也是深度流形能够补充范畴论视角的地方。范畴论给我们提供了关于关系、变换和分类的高层语言。深度流形则给出一种数值和几何解释,用来说明这种抽象如何能够在神经网络内部被学习出来。神经网络并不是把范畴论作为形式数学直接实现出来。更准确地说,它呈现出一种类似范畴论的抽象性,因为它学习到的计算在堆叠流形覆盖之间具有关系性、组合性和可迁移性。
在这个视角中,分类并不是一个狭窄的终点。它是一个更深层过程的最终表达。模型从无属性数值状态开始。通过训练,这些状态被数据塑造成流形覆盖。通过推理,提示词成为边界条件。通过层与层之间的计算,模型在这些覆盖之间执行已经学习到的变换。最后,系统回到分类:一个单标、一个标签、一个答案,或者一个行动。
范畴论告诉我们,分类可以通过关系来理解,而不是通过内部本质来理解。深度流形进一步指出,神经网络正是以这种方式学习的。它们不是先拥有意义,然后再分类。它们学习关系式数值结构;当这种结构稳定到足以支持分类、迁移和组合时,意义才会涌现出来。
这也许是神经网络能够展现出惊人泛化能力的原因之一。它们的抽象不是经典意义上的符号抽象。它不是纯逻辑的,不是纯语义的,也不是纯统计的。它是已学习的数值抽象。它是被组织成关系的无属性计算。而当这些关系在不同领域之间足够稳定时,迁移学习就不仅是实践上有效的,而且在理论上也是自然的。
-
What is Deep Manifold ?
-
Neural Network Fixed-Point Field
-
Deep Manifold in the Real World
Single Token Geometry Series 单标几何系列
-
Single Token Geometry 01: Topology 单标的几何:拓扑
-
Single Token Geometry 02: DeepSeek V4 and Manifold Tearing 单标几何:DeepSeek V4 与流形撕裂
-
Single Token Geometry 03: Data Complexity 单标几何:数据复杂性
-
Single Token Geometry 04: A Critique of Manifold Steering 单标几何:对流形引导的批评
-
Single Token Geometry 05: Numerical Manifold Method 单标几何 :数值流形
-
Single Token Geometry 06: Stacked Piecewise Manifold 单标几何 06:堆叠分片流形
-
Single Token Geometry 07: Attention 单标几何 07:注意力
deepmanifold.ai
相似文章
@BetaTomorrow: https://x.com/BetaTomorrow/status/2077136657275646278
本文从数学角度探讨人工智能对齐的困难,指出神经网络通过病态反问题推断、无属性数值计算和满秩变换等特性,使得人类价值难以被明确规定和准确表征,从而阐明对齐问题的数学本质。
@snowboat84: https://x.com/snowboat84/status/2062686432335184321
这篇文章探讨了物理学与深度学习之间的深层联系,分析了Scaling Law、涌现等现象与物理学中临界标度律、相变等概念的同构性,并梳理了物理方法论在AI中的应用现状与前景。
@BetaTomorrow: https://x.com/BetaTomorrow/status/2079015742738157750
一篇批评神经网络研究中常见地将优化与学习混为一谈的文章,主张训练应被理解为逆向重建,并通过权重定义的分段流形的演化同调来研究。
@BetaTomorrow: https://x.com/BetaTomorrow/status/2076323776518906204
This article presents a mathematical perspective on why modern neural networks accommodate diverse architectures and attention mechanisms, framing them as different implementations of constraints within a learnable numerical system.
@tanzhengmc97: https://x.com/tanzhengmc97/status/2066531753762656730
用通俗易懂的语言解释了大模型的运行原理,包括词向量、Transformer注意力机制、下一个词预测训练以及涌现能力,适合初学者理解AI基础概念。