The Cognitive Categorical Transformer: 语言建模中的范畴理论归纳偏差

arXiv cs.AI 论文

摘要

The Cognitive Categorical Transformer (CCT) 使用范畴理论组件增强GPT-2 Small,在匹配训练条件下在WikiText-103上实现了12%的相对困惑度降低,其中单纯消息传递贡献了84%的改进。

arXiv:2605.28864v1 Announce Type: new 摘要:The Cognitive Categorical Transformer (CCT) 是一个306M参数的架构,它使用源自范畴理论和认知科学启发的认知组件增强预训练的GPT-2 Small主干。在WikiText-103上采用匹配步长协议(215,000优化器步、匹配数据、匹配优化器和调度),CCT达到21.27验证困惑度,而经过相同微调的GPT-2 Small基线为24.19。因此,该架构在仅领域内微调的基础上贡献了2.92 PPL(12%相对)的降低。一个从头开始的消融实验,在整个七阶段激活调度中绕过GT-Full单纯消息传递,达到23.72 PPL,将84%的架构改进(2.45 of 2.92 PPL)归因于GT-Full。我们首次提供了经过消融验证的证据,证明在WikiText-103上,单纯消息传递在306M参数规模下改进了语言模型的困惑度。已发表的GPT-2 Large在WikiText-103上达到22.05零样本PPL,其参数比GPT-2 Small多6.2倍;本文将该数字视为外部已发表的参考,而非架构基准。关于一致性型范畴先验(层平滑、伴随往返、曲率正则化)的三个负结果,以及GT-Full和PrecisionWeightedPP的联合结构先验结果,共同支持一个经验模式,称为*结构/一致性区分*,其中添加新拓扑的范畴先验改进了语言建模,而强制执行一致性恒等式的先验则没有。
查看原文
查看缓存全文

缓存时间: 2026/05/29 09:10

# 语言建模的范畴论归纳偏置  来源:https://arxiv.org/html/2605.28864 ## 认知范畴变换器:用于语言建模的范畴论归纳偏置(2026年5月) ###### 摘要 认知范畴变换器(CCT)是一个具有3.06亿参数的架构,它在预训练的GPT-2 Small骨干网络上,增加了源自范畴论和认知科学若干启发的认知基础组件。在WikiText-103上采用匹配步数协议(215,000优化器步数、匹配数据、匹配优化器和学习率调度)下,CCT达到21.27验证困惑度,而同等微调的GPT-2 Small基线为24.19。因此,该架构在域内微调本身带来的改善之外,额外贡献了2.92 PPL(相对降低12%)。从头重新训练的消融实验(在整个七阶段激活调度中绕过GT-Full单纯消息传递)达到23.72 PPL,将84%的架构改进(2.45/2.92 PPL)归因于GT-Full。我们提供了首个经消融验证的证据,表明在WikiText-103上,单纯消息传递能在3.06亿参数规模上改善语言模型困惑度。已发表的GPT-2 Large在WikiText-103上达到22.05零样本PPL,参数量是GPT-2 Small的6.2倍;本文将此数字视为外部已发表参考,而非架构基准。关于一致性风格范畴先验(层平滑、伴随往返、曲率正则化)的三个负面结果,以及GT-Full和PrecisionWeightedPP的联合结构先验结果,共同支持一个经验模式,称为*结构/一致性区分*,其中增加新拓扑的范畴先验能改善语言建模,而强制一致性恒等式的先验则不能。 ## 1 引言 扩展Transformer架构(Vaswani等人,2017 (https://arxiv.org/html/2605.28864#bib.bib30))一直是提升语言模型质量的主导策略,但这带来了参数、计算和能耗方面的显著成本。另一条互补的研究路线探究源自数学和认知科学的原理性结构先验,是否能在相同数据上、采用匹配步数训练协议下,用拓扑替代参数数量。严格回答这个问题需要一种方法论:将待研究的架构与一个共享骨干初始化、训练语料、优化器、步数预算和学习率调度的微调基线进行比较,使得唯一差异是所测试的架构增强。本文的主要贡献是在3.06亿参数规模下,通过完全匹配步数的比较,给出这一问题的实证答案。在WikiText-103上采用匹配步数训练和匹配数据,认知范畴变换器(CCT)达到21.27 PPL,而同等微调的GPT-2 Small基线为24.19 PPL;2.92 PPL(相对12%)的差异就是架构贡献。从头重新训练的消融实验(在整个七阶段激活调度中绕过GT-Full单纯消息传递)达到23.72 PPL,将84%的架构改进(2.45/2.92 PPL)单独归因于GT-Full。 标准Transformer将词符视为度量空间中的点,依靠点积注意力来发现成对关系。这种设计除了位置排序外,不包含关于语言的任何结构先验:没有捕捉高阶关系的几何结构,没有层级,也没有超出上下文窗口的记忆。范畴论提供了一种形式化语言来表达这类结构关系。层(Sheaves)形式化地将局部观测粘合为全局一致的表示。余代数(Coalgebras)捕捉依赖于状态的观测过程,例如记忆。米田引理(Yoneda lemma)完全通过对象与其他所有对象的关系来刻画对象,为自我监控提供了形式化基础。单纯复形(Simplicial complexes)将图泛化为捕捉成对注意力无法表达的高阶关系(三角形、四面体)。每种结构都有精确的数学语义,约束了神经组件的设计。 自我决定理论(SDT)(Ryan和Deci,2017 (https://arxiv.org/html/2605.28864#bib.bib26);Sheldon,2022 (https://arxiv.org/html/2605.28864#bib.bib27))是CCT设计阶段查阅的若干启发来源之一,其他还包括预测处理(Clark,2013 (https://arxiv.org/html/2605.28864#bib.bib5);Friston,2010 (https://arxiv.org/html/2605.28864#bib.bib9))和可微分记忆传统(Graves等人,2016 (https://arxiv.org/html/2605.28864#bib.bib12));在本文评估的匹配步数、静态语料训练制度下,七项SDT到架构的对应关系中,有两项带来了可测量的贡献(第9节 (https://arxiv.org/html/2605.28864#S9))。因此,SDT的作用更准确地描述为一种设计空间约束,帮助选择实施哪些结构先验,而非可测量收益的来源。 认知范畴变换器(CCT)将这些思想实例化为围绕预训练GPT-2骨干网络的具体神经模块。一个关键发现是,并非所有范畴结构都贡献相同:*结构*先验(单纯拓扑、精度加权预测)产生实质性收益,而*一致性*先验(层平滑、伴随往返、曲率正则化)被证明是冗余或有害的。这一模式与近期关于神经网络的层理论分析(Bosca和Ghrist,2026 (https://arxiv.org/html/2605.28864#bib.bib4))一致,该分析证明前馈ReLU网络的前向传播已经实现了最小的层差异。 ### 1.1 贡献 1. 1. 单纯消息传递在从头重新训练消融实验中改善了语言模型困惑度。GT-Full单纯消息传递在全部七个训练阶段被绕过时,相对于微调的GPT-2 Small基线贡献了2.45/2.92 PPL的架构改进(84%)(表8 (https://arxiv.org/html/2605.28864#S6.T8),图4 (https://arxiv.org/html/2605.28864#S6.F4))。同一组件的仅评估消融占比为91.6%(表9 (https://arxiv.org/html/2605.28864#S6.T9)),测量的是评估时对该组件输出分布的学习依赖;仅评估和重新训练的数字测量的是相关但不同的量。我们提供了首个经消融验证的证据,表明单纯消息传递能在WikiText-103上、3.06亿参数规模下改善语言模型困惑度。 2. 2. 一个验证有效的结构先验,另一个尚待猜想。在通过从头重新训练消融评估的两个范畴结构先验中,GT-Full单纯消息传递被验证为主要的架构贡献者。PrecisionWeightedPP也显示出潜力:在完整CCT轨迹中,从阶段6到阶段7,其激活使困惑度降低了1.40 PPL,但当GT-Full不存在时,其独立贡献要小得多(在E2重新训练消融中为−0.07 PPL),这表明PP的收益可能依赖于GT-Full的结构信号。验证PP的独立性需要第三种反事实条件(有GT-Full但没有PP的CCT),我们留待未来工作。除这两个结构先验外,三个范畴一致性先验(层平滑、伴随往返损失、曲率正则化)均未能改善语言建模,这与Bosca和Ghrist(2026 (https://arxiv.org/html/2605.28864#bib.bib4))一致,他们证明前馈ReLU网络的前向传播已经最小化了基于架构构建的细胞层上的层差异,使得一致性强制在该设定下是明显冗余的(第8节 (https://arxiv.org/html/2605.28864#S8))。 3. 3. 在匹配步数训练下,拓扑替代了参数数量。CCT在WikiText-103上以3.06亿参数、215,000步训练预算达到21.27 PPL,相对于消耗相同预算但无架构增强的微调GPT-2 Small基线(24.19 PPL),实现了2.92 PPL(相对12%)的改进(第6.1节 (https://arxiv.org/html/2605.28864#S6.SS1))。已发表的GPT-2 Large达到22.05零样本PPL,参数量是GPT-2 Small的6.2倍(Radford等人,2019 (https://arxiv.org/html/2605.28864#bib.bib23));本文报告此数字作为已发表的外部参考,而非架构基准。 ## 2 相关工作 ### 2.1 机器学习中的范畴论 Gavranovic等人(2024 (https://arxiv.org/html/2605.28864#bib.bib10))在ICML上建立了范畴深度学习的基础理论,将神经网络形式化为幺半群范畴中的参数化态射。Mahadevan(2026 (https://arxiv.org/html/2605.28864#bib.bib18))编纂了连接层、单纯注意力和Kan扩张与Transformer架构的范畴框架,Mahadevan(2025 (https://arxiv.org/html/2605.28864#bib.bib19))将同一工作扩展到拓朴理论;两者共同构成了CCT所依赖的数学基础设施。¹¹¹本文使用的单纯注意力和Kan扩张构造遵循Mahadevan在马萨诸塞大学阿默斯特分校2026年春季COMPSCI 692CT课程的第4周(“单纯集与几何Transformer”)和第5周(“伴随与Kan扩张”)。Ehresmann和Vanbremeersch(2007 (https://arxiv.org/html/2605.28864#bib.bib7))使用范畴余极限开发了记忆演化系统(Memory Evolutive Systems),为认知绑定建模,预示了CCT记忆架构中的多个思想。Rosen(1991 (https://arxiv.org/html/2605.28864#bib.bib25))使用范畴闭包公式化了预应系统,通过米田引理与CCT的自我监控相连。与本文同时,Frost(2026 (https://arxiv.org/html/2605.28864#bib.bib8))发布了FunctorFlow.jl,这是Mahadevan的Python FunctorFlow包的Julia移植版本,共享CCT在Mahadevan范畴框架下的理论基础,并提供了一种替代的、非训练的DSL级实现;上游README链接了伴随的Lean 4形式化项目sridharmahadevan/catagi。FunctorFlow的GT原语(gt_neighborhood_block,在单纯结构上的几何消息传递)与CCT的GT-Full是相同的概念原语;两种实现是互补的,FunctorFlow.jl占据DSL/IR层,CCT占据训练模型层。本文的实证贡献是这一分工中训练模型的部分。 CCT在三个方面区别于先前的范畴机器学习工作:(a) 它作为完整、可训练的架构实现,而非理论框架;(b) 它将范畴结构基于认知心理学而非纯数学;(c) 它通过从头重新训练消融提供了实证证据,表明范畴归纳偏置能在3亿参数规模下改善语言建模。 ### 2.2 神经网络的层理论基础 Bosca和Ghrist(2026 (https://arxiv.org/html/2605.28864#bib.bib4))证明,任何前馈ReLU网络的前向传播都是基于网络架构构建的细胞层上边界数据的唯一调和扩展。这一结果对范畴架构设计有直接推论:前向传播已经最小化了层差异(层拉普拉斯算子上的狄利克雷能量),因此任何额外的层一致性损失在数学上是冗余的,只会与主要训练目标冲突。 ### 2.3 几何与拓扑深度学习 Bodnar等人(2021 (https://arxiv.org/html/2605.28864#bib.bib3))引入了单纯消息传递网络,证明高阶交互能够捕捉标准图神经网络无法获取的结构信息。Hajij等人(2022 (https://arxiv.org/html/2605.28864#bib.bib13))提供了拓扑深度学习的综合框架。这些工作主要应用于具有固定、由输入给定拓扑的分子和社会图。CCT通过三项修改将对序列建模的单纯消息传递进行适配:(a) 拓扑从学习的坐标投影动态构建,(b) 图在每一层从演化的表示中重建,(c) 读出通过门控融合与残差流聚合回序列维度。 ### 2.4 认知架构与瓶颈机制 预测处理(Clark,2013 (https://arxiv.org/html/2605.28864#bib.bib5);Friston,2010 (https://arxiv.org/html/2605.28864#bib.bib9))将大脑建模为一个最小化精度加权预测误差的层级预测引擎。CCT将其实现为具有学习到的逐特征精度网络的具体模块。经典认知架构(ACT-R,Anderson,2007 (https://arxiv.org/html/2605.28864#bib.bib1);SOAR,Laird,2012 (https://arxiv.org/html/2605.28864#bib.bib17);CLARION,Sun,2002 (https://arxiv.org/html/2605.28864#bib.bib29))在符号层面实现认知理论,而CCT将认知原则实现为端到端训练的可微分神经模块。Goyal和Bengio(2022 (https://arxiv.org/html/2605.28864#bib.bib11))倡导深度学习中的认知动机归纳偏置。CCT为此计划提供了基于范畴论的具体实例化。 ### 2.5 AI中的自我决定理论 自我决定理论(SDT)(Ryan和Deci,2017 (https://arxiv.org/html/2605.28864#bib.bib26))是指导CCT设计阶段的若干启发来源之一。Sheldon(2022 (https://arxiv.org/html/2605.28864#bib.bib27))通过自我一致理论和有机整合连续体扩展了SDT,Sheldon(2025 (https://arxiv.org/html/2605.28864#bib.bib28))通过目标突破模型(Goal Breakthrough Model)将SDT扩展到人工智慧,该模型规定了在自我决定的目标选择过程中,默认模式、显著性和认知控制脑网络如何相互作用。目标突破模型认为,几个SDT构念需要交互式、目标导向的上下文才能变得在计算上有意义,在静态语料训练下不会产生可测量的收益。本文诚实地报告了实证的不对称性:在WikiText-103上进行匹配步数训练下,七项SDT到架构的对应关系中,有两项带来了可测量的贡献(第9节 (https://arxiv.org/html/2605.28864#S9));其余五个映射被报告为未验证而非架构成功。它们是否在交互式训练下变得有效留作开放问题。 ### 2.6 可微分记忆 Graves等人(2016 (https://arxiv.org/html/2605.28864#bib.bib12))引入了可微分神经计算机(DNC)。CCT的HierarchicalMemory将DNC扩展为三层层次结构(缓冲区、工作记忆、情景记忆)和消除了顺序瓶颈的批处理实现。 ### 2.7 参数高效方法 LoRA(Hu等人,2022 (https://arxiv.org/html/2605.28864#bib.bib16))和适配器方法(Houlsby等人,2019 (https://arxiv.org/html/2605.28864#bib.bib15))向预训练Transformer添加轻量级模块。CCT共享增强范式但目的不同:PEFT方法旨在用最少参数进行任务适应,而CCT引入旨在改进核心语言建模能力的新归纳偏置。CCT增加的1.82亿参数反映了结构丰富化。

相似文章

更好的语言模型及其影响

OpenAI Blog

OpenAI 推出 GPT-2,这是一个拥有 15 亿参数的基于 Transformer 的语言模型,在 40GB 的互联网文本上进行训练,在语言建模基准上达到了最先进的性能,并在阅读理解、翻译、问答和摘要生成等任务上展示了零样本学习能力。出于安全考虑,仅公开发布了较小的模型和技术论文,而非完整的训练模型。

简化自然语言中任意条件建模

arXiv cs.CL

提出 ac-gpt,一种对因果Transformer的简单修改,使其能够在单个前向传递中评估和采样任意条件(过去、未来、混合),同时保持从左到右的顺序和下一个词预测,从而允许现有LLM微调用于任意条件建模。

GiLT:利用依存图增强Transformer语言模型

arXiv cs.CL

论文提出了GiLT(Graph-Infused Layers Transformer Language Model),它通过在token预测过程中增量构建的依存图特征来调整注意力权重,从而改善句法泛化能力,在保持竞争性困惑度的同时超越基线模型。