前馈层中的显式模糊逻辑:自遗忘量词发现可读的语法许可检测器

arXiv cs.CL 论文

摘要

本文提出了一种参数中性的Transformer前馈层替代方案,使用显式模糊集运算和序列上的量词。该方法在困惑度上与GELU基线相当,同时实现了可解释的语法许可检测器,尽管完全布尔FFN仍不稳定。

arXiv:2606.31845v1 公告类型:新 摘要:Transformer的前馈(FFN)子层具体化了注意力所收集的区分,但并未解释其计算内容。在一项参数中性的替代方案中,每个隐藏单元是对sigmoid约束的[0,1]隶属度进行的显式模糊集运算:交集 A*B 和差集 A*(1-B),后者是一种有界正否定("A但不是B"),这是门控/双线性单元所缺乏的——即具备否定能力的FFN(NC-FFN)。在N位奇偶校验问题上,它们是浅层中最参数高效的推理基础;在更大规模(125M参数,OpenWebText)上,NC-FFN与GELU基线的困惑度持平,每个单元都携带显式逻辑形式。两个局限性有一个共同原因:双操作数逻辑局限于第0层并在训练中退化,而唯一稳健的语法缺陷集中在许可和量词上,超出了词内算子。我们用一小块序列量词解决了这两个问题:一个软存在量词和一个软比例量词,每个单元都通过粘性初始化学习遗忘率。这使第一个epoch就恢复了缺陷(使第二个epoch的更大差距减半),在LAMBADA上略有领先,并使FFN具有可读性:结构现在得以保持并迁移到深层;衰减解除了粘性(中位半衰期约1.5个token;零锁存单元);在语义层,这些单元无需字典学习即可读取为语法许可检测器:每个单元在许可触发词(比较级、过去分词、负极性词项)上激活,并将其记忆前传以预测被许可的词(than, by, nor)。这种可读性是局部的,且仅在某个分区内是自由的(完全布尔FFN在训练中发散),但结果是得到一个参数中性的、具有语言模型质量的Transformer,其语法机制是可读的、构造上可解释的——不仅说明了前馈层表示什么,还说明了它如何许可。
查看原文
查看缓存全文

缓存时间: 2026/07/01 05:35

# 前馈层中的显式模糊逻辑:自遗忘量词揭示可读的语法许可检测器

来源:https://arxiv.org/html/2606.31845  
Mark Oskin  
教授  
计算机科学与工程学院  
华盛顿大学  
mhoskin@uw\.edu  
(2026年6月)

###### 摘要

前馈(FFN)子层是Transformer物化其注意力所收集的合取与区分的地方——但其标准形式(线性投影的逐点激活)并未显式说明它*计算了什么*。我们研究一种参数中性的替换方案,其中每个隐藏单元都是对sigmoid约束边界\[0,1\]\[0,1\]隶属度值进行的显式模糊集合运算:交运算$A\cdot B$与集合差$A\cdot(1-B)$。后者是负运算(“$A$但非$B$”)的一种有界、*正*编码,而门控或双线性单元在结构上缺乏这种编码。我们称这种前馈层为带否定能力的前馈层(NC-FFN)。在一个受控的推理探针(纯前馈堆栈中的$N$比特奇偶校验)上,有界乘法单元是浅层深度下最参数高效的推理基元;在语言模型规模(125M参数,OpenWebText)上,NC-FFN在同等参数下与GELU基线的困惑度持平,且每个单元都携带显式逻辑形式。但同一原因导致了两个局限。真正的双操作数逻辑强烈局限于嵌入相邻层,并在语言模型训练下*退化*为软门控;并且模型唯一稳健的语法缺陷集中在*许可*和*量词*上——恰恰是词内集合运算符无法表达的序列级结构。我们的核心成果同时解决了这两个问题。我们在序列上添加了一个小的、参数中性的模糊*量词*块——一个软存在量词和一个软比例量词,每个都具有每单元*学习遗忘率*,初始化为非遗忘(粘性)极限。这在一个epoch内就弥补了语法缺陷——将epoch二时打开的更大差距缩小了一半——并在LAMBADA上适度领先基线,同时使前馈层显著更易读。逻辑结构现在*保持并迁移到深层*,而非退化;学习到的衰减*反向学习*了自身的粘性——每个单元在几个词元内都会遗忘(半衰期中位数$\sim 1.5$;*零*个接近永久的单元)——因此量词是一个局部的、预测性的算子,而非锁存器;在语义层,无需字典学习,这些单元即可解读为语法*许可检测器*。每个单元对一个语法*许可项*(比较级、被动分词、负极词项)触发,其约$\sim 1.5$词元的记忆将隶属度向前传递,以预测被许可的功能词(*than*、*by*、*nor*)——衰减已自我调节至语法许可窗口。这种可读性是局部化的(网络中占比很小,集中在深层),并且只有在一种划分下才是免费的:一个*完全*布尔型前馈层,无稳定化的GELU部分,在训练中仍会发散,留下一个仍然开放的最优化问题。但在这些界限内,结果是一个参数中性、语言模型质量的Transformer,其中包含一个可读的、构造即可解释的语法机制——不仅显式说明了前馈层*表示什么*,还说明了它*如何*进行许可。

## 1 引言

机器可解释性在计算结构暴露的地方取得了最大进展:注意力模式是可读的,因为注意力本质上是对值进行加权路由,而归纳或复制电路可以从QK/OV结构中读取出。前馈子层持有Transformer大部分参数,并被广泛认为承载了事实和特征级别的计算(Geva等人,2021 (https://arxiv.org/html/2606.31845#bib.bib23)),但其透明度远低:线性投影的逐点激活是一个稠密、多义、无符号概念的对象,其对其输入的*操作*没有原生的解读。事后字典方法恢复了层表示*什么*方向(Bricken等人,2023 (https://arxiv.org/html/2606.31845#bib.bib21); Cunningham等人,2024 (https://arxiv.org/html/2606.31845#bib.bib22)),但无法恢复层*如何*组合它们。我们采取一种互补的、架构性的路径:选择一个*组合规则显式*的前馈层,并探究其代价和揭示的内容。

前馈层是集合逻辑的自然归宿——它是注意力收集的特征被合成为“此词元是一个动词*且*主语是复数”或“一个引文*但不*是一个标题”的地方。最后一个例子是关键。否定很容易*陈述*但难以*表示*:原始特征方向没有“缺失”的概念,因此“非$B$”没有简洁的肯定形式。知识图谱逻辑查询嵌入中的解决方法(Ren和Leskovec,2020 (https://arxiv.org/html/2606.31845#bib.bib14))是使特征成为\[0,1\]\[0,1\]中的*有界*隶属度,这个空间在补运算下封闭,因此“非$B$”就是简单的$1-B$。将模糊逻辑的集合运算符——交运算$A\cdot B$、集合差$A\cdot(1-B)$(补运算提供否定)——嵌入到Transformer前馈层中,就得到了一个每一隐藏单元都是两个操作数的命名and/and-not操作的层,且无需改变参数预算、头部配置或注意力。我们称其为带否定能力的前馈层(NC-FFN);“有能力”是架构属性,而非性能承诺。这些运算符、乘法前馈层形式(GLU及其双线性变体)、运算符软化的优化病态,以及通过补运算实现否定的思想,都是已有的先验知识(第2节 (https://arxiv.org/html/2606.31845#S2));我们的贡献在于将它们组装到一个Transformer语言模型内部,并对其行为进行实证描述。该描述包含五个部分:四个描述NC-FFN本身,第五部分用一个序列级运算符扩展它,并得出本文最重要的成果。

#### 能力(第5节 (https://arxiv.org/html/2606.31845#S5))。  
驱动性问题——一个更*结构化*的组件是否更*紧凑*地推理?——无法从困惑度中得到答案,困惑度奖励的是分布拟合,而非推理。我们通过一个受控探针将其隔离:$N$比特奇偶校验,这是典型对积易、对和难的函数,由每种前馈层类型的纯前馈堆栈学习。测量作为宽度和深度函数的每个能解决的最大$N$,将“推理能力”转化为一个数字。结果是一个清晰的分离:*有界*乘法单元(NC-FFN、sigmoid双线性)是浅层深度下最参数高效的推理基元——单层超过了严格更大的GELU——而*无界*双线性乘积在浅层无用,但通过深度进行组合。我们的架构切换的两个属性——乘法和有界——实际上控制着推理效率的两个不同轴心。此处的小网络是用于测量能力的受控工具,而非规模宣称。

#### 语言建模(第6节 (https://arxiv.org/html/2606.31845#S6))。  
作为一个125M参数的语言模型,NC-FFN是一个忠实的参数中性即插即用组件:它在困惑度上与GELU基线持平(并且随着训练进程这种持平更加紧密),但在语法结构(BLiMP)上有一个微小且持续的缺陷。我们将此缺陷归因于能力*分配*而非缺失:一个有界乘法单元每个参数暴露的独立独立特征比无界激活函数少,而普通语言需要独立特征。架构所购买的能力是真实的,但对于下一个词元预测而言是*休眠*的,后者并不需要这种能力。

#### 可读性及其动态(第7节 (https://arxiv.org/html/2606.31845#S7))。  
每个NC-FFN单元都携带显式逻辑形式,且一小部分子集无需字典学习即可解读为可识别的谓词。真正的双操作数逻辑强烈局限于嵌入相邻层;可读单元跟踪的特征是*因果使用的*,尽管这些单元个体上是冗余的。最引人注目的是,网络的逻辑内容是*动态且任务塑造的*:在奖励乘法推理的任务上训练时,布尔结构在顿悟转变处*结晶*;作为语言模型(不奖励乘法推理)训练时,相同的结构*退化*为软门控。架构保留了任务为其付费的逻辑。

#### 可训练性边界(第8节 (https://arxiv.org/html/2606.31845#S8))。  
布尔块旁边的稳定化GELU\\operatorname\{GELU\}主体部分并非可选。随着布尔比例上升,模型训练时间更长但随后更快发散,而一个*完全*布尔前馈层在约$\sim 16$k步内发散;显然的补救措施——对残差写入做有界化、并行线性高速公路——只能推迟它,表明存在饱和乘积梯度病态而非写入幅度问题。因此可读性只在一种划分下是免费的,而一个端到端可读的模型被消除这种不稳定性所门控。

#### 自遗忘量词与可读许可(第9节 (https://arxiv.org/html/2606.31845#S9))。  
上述发现中有两个局限共享一个原因:双操作数逻辑退化并局限于第0层,且语法缺陷集中在*许可*和*量词*上——这些结构关乎一个特征是否*在序列中更早出现*,而NC-FFN的词内运算符无法表达。我们添加了缺失的基元:一个参数中性的序列级模糊量词块(一个软存在量词和一个软比例量词),带有每单元*学习遗忘*率,初始化为非遗忘(粘性)极限。它同时解决了两个局限:在一个epoch内弥补了语法缺陷——将更大的epoch二差距缩小了一半——并在LAMBADA上领先基线;逻辑结构现在*保持并迁移到深层*,而非退化;学习到的衰减*反向学习*了其粘性初始化——每个单元在几个词元内都会遗忘——因此量词是局部的、预测性的算子,而非锁存器;在语义层,无需字典学习,这些单元即可解读为语法*许可检测器*,每个单元对一个语法许可项触发并将其向前携带——在一个约$\sim 1.5$词元的记忆(衰减已调节至许可窗口)上——以预测被许可的功能词。可读性是局部化的,并非网络范围,但它是一个可读的、构造即可解释的语法机制,且无参数或语言模型质量成本。

综合来看,这些表明:一个显式组合的前馈层是一个可行的、参数中性的组件,在需要它的任务上更紧凑地推理,并暴露了它*如何*计算——代价适中且局部化;“逻辑量”并非架构的固定属性,而是其训练目标奖励的读出;并且给予前馈层一个显式的*序列*运算符(可自由学习记住多久),将NC-FFN最严重的语法失败转化为其最可读的机制——一个计算可读语法许可的自遗忘量词库。

## 2 相关工作

NC-FFN处于几个成熟研究线的交叉点:门控和乘法前馈层、可微模糊逻辑、用于逻辑查询回答的集合运算符嵌入,以及Transformer前馈(FFN)子层的可解释性。各个成分都是已有的。我们的贡献在于*放置方式和视角*:将sigmoid约束的模糊集合运算符——包括显式补/否定项——组装成仅解码器语言模型的参数中性前馈子层,并定性该选择的作用。我们据此组织先验知识,并为每条线指明仍存在的精确缺口。

### 2.1 门控和乘法前馈层

门控线性单元(GLU)用两个线性投影的按分量乘积(其中一个通过门控)替换前馈激活(Dauphin等人,2017 (https://arxiv.org/html/2606.31845#bib.bib3))。Shazeer (2020 (https://arxiv.org/html/2606.31845#bib.bib4)) 系统化了Transformer前馈层的GLU变体——GEGLU、SwiGLU以及纯粹*双线性*变体 $(xW)\odot(xV)$(无逐元素非线性)——并表明它们在同等参数数量下提升了语言模型质量。这些是NC-FFN最接近的架构亲属:GLU本身就是一个sigmoid门控的乘法单元。区别在于结构性:GLU将门控和值合并为*单一*乘法门控通路,而NC-FFN将一个标准激活块*放在*一个单独的显式集合运算块*旁边*,并通过一个共享投影读出它们;关键是,没有GLU变体携带补/否定($1-B$)项或其积的集合论解读。Pearce等人 (2025 (https://arxiv.org/html/2606.31845#bib.bib5)) 和Pearce等人 (2024 (https://arxiv.org/html/2606.31845#bib.bib6)) 专门研究双线性前馈层 $g(x)=(W_1x)\odot(W_2x)$ 在Transformer语言模型中作为*基于权重*的机械可解释性的基板:因为该层是纯粹的双线性形式(无非线性),每个输出是一个二次形式,其相互作用结构可以通过特征分解恢复。他们报告双线性MLP是一个有竞争力的、参数中性的即插即用替代激活MLP。这是与我们最接近的单篇先验工作,我们将它同时作为行为控制和直接的可解释性比较(第4节 (https://arxiv.org/html/2606.31845#S4),第7节 (https://arxiv.org/html/2606.31845#S7))。区别具体且承担重量:双线性操作数是无界且带符号的,而非sigmoid约束到\[0,1\]\[0,1\];没有补/否定项;也没有集合运算符语义。如我们所示,这些并非装饰性:sigmoid约束给NC-FFN一个优雅的单操作数回退,而原始双线性单元在结构上缺乏这一点。神经算术逻辑单元(Trask等人,2018 (https://arxiv.org/html/2606.31845#bib.bib8)) 使用sigmoid门控在加法和乘法通路之间选择以实现系统性的数值外推——相邻的门控乘法机制,但目标在于算术而非集合逻辑,且未用作通用前馈层。

### 2.2 可微模糊逻辑与逻辑门网络

NC-FFN使用的运算符是教科书式的连续(模糊)布尔连接词松弛。积t-范数将合取实现为 $A\cdot B$,强补运算将否定实现为 $1-A$,集合差则随之而来为 $A\cdot (1-B)$。神经符号框架如逻辑张量网络(Badreddine等人,2022 (https://arxiv.org/html/2606.31845#bib.bib10)) 和逻辑神经网络(Riegel等人,2020 (https://arxiv.org/html/2606.31845#bib.bib11)) 从这些运算符构建可微逻辑公式,van Krieken等人 (2022 (https://arxiv.org/html/2606.31845#bib.bib9)) 分析了它们的优化行为,表明梯度下降倾向于*软化*清晰模糊运算符,因为乘积形式门控在操作数饱和时会遭遇梯度消失。可微逻辑门网络(Petersen等人,2022 (https://arxiv.org/html/2606.31845#bib.bib12), 2024 (https://arxiv.org/html/2606.31845#bib.bib13)) 通过温度退火松弛在每神经元学习十六个双输入布尔函数之一,并在视觉基准上实现了强大效率。这些工作建立了运算符及其优化病态,但始终是作为*独立*逻辑网络(通常用于视觉或表格数据),从未作为Transformer内部用于语言建模训练的前馈子层。van Krie

相似文章

点间解读:解码填充标记中的隐藏计算

arXiv cs.CL

本文表明,前沿LLM能够在无内容的填充标记上进行多步推理,并且残差流中的隐藏状态可以被解码以高精度恢复中间值,挑战了思维链监控是唯一审计工具这一假设。

Transformer FFN神经元的稀疏层间依赖

arXiv cs.LG

本文介绍了一种无需训练的归因方法,用于识别Transformer FFN神经元中稀疏的层间依赖,结果表明少量前序激活足以高保真地保留神经元激活。