动态参数化并非动态推断
摘要
本文质疑了将动态参数化与动态推断混为一谈的做法,引入了冻结控制器审计(Frozen-Controller Auditing),以证明输入相关的系数并不意味着计算节省。在Transformer上的实验表明,尽管没有条件执行,静态逐层配置文件仍能保持近乎完整的性能。
arXiv:2607.26192v1 Announce Type: new
摘要:输入相关的控制器系数常被视为动态推断或计算节省的证据。这种解释混淆了三个性质:系数变化、冻结模型对系数如何分配给输入的依赖性,以及条件执行。我们关注第二个性质,并提出了冻结控制器审计的一般原则。我们提供了一个具体实现,即冻结控制器审计(FCA),它会沿未扰动轨迹缓存完整的系数张量,禁用控制器,并通过跨输入重新分配、令牌混洗以及从独立校准集估计的静态配置文件来重放冻结模型。由于系数在任何干预之前被缓存,重放下性能变化衡量的是分配依赖性,而无需根据扰动的隐藏状态重新计算控制器的反馈。在七个独立训练的76M FeatureGate Transformer和三个504M模型上,静态逐层配置文件分别保留了Correct-to-GlobalMean性能差距的98.70%和99.43%。层标识解释了系数方差的87%到96%。然而,FeatureGate执行了每一个Transformer块,其测量的推理速度比Dense慢30.8%。在公开的MUDDPythia-1.4B检查点上,跨输入重新分配和令牌混洗分别使NLL增加了1.9067和2.9637。这些惩罚表明模型强烈依赖于内容调节的跨层分配。MUDDPythia也执行了每一个Transformer块。结果表明,仅靠动态参数化并不能建立动态推断,功能动态也不能建立计算节省。关于动态模型的声明应分别报告系数变化、冻结模型的功能依赖性以及实际执行情况。
查看缓存全文
缓存时间: 2026/07/30 09:56
# 动态参数化并非动态推理 来源:https://arxiv.org/html/2607.26192 ###### 摘要 输入相关的控制器系数常被视为动态推理或计算节省的证据。这种解释混淆了三个性质:系数变化、冻结模型对系数如何分配到输入的依赖性,以及条件执行。我们聚焦于第二个性质,并提出了冻结控制器审计的一般原则。我们提供了一个具体实现——冻结控制器审计(FCA),该方法沿未扰动的轨迹缓存完整的系数张量,禁用控制器,并通过跨输入重新分配、令牌洗牌以及从独立校准集估计的静态画像来重新运行冻结模型。由于系数在干预前已缓存,因此重放下的性能变化衡量的是系数分配依赖性,而无需考虑从扰动隐藏状态重新计算控制器的反馈。在七个独立训练的76M FeatureGate Transformer和三个504M模型上,静态层级画像分别保留了98.70%和99.43%的Correct-to-GlobalMean性能差距。层级身份解释了87%到96%的系数方差。然而,FeatureGate仍执行了每一个Transformer块,其测量推理速度比Dense慢30.8%。在公开的MUDDPythia-1.4B检查点上,跨输入重新分配和令牌洗牌分别使NLL增加了1.9067和2.9637。这些惩罚表明模型强烈依赖于内容条件化的跨层分配。MUDDPythia也执行了每一个Transformer块。结果表明,动态参数化本身并不能确立动态推理,而功能动态性也不能确立计算节省。关于动态模型的声明应分别报告系数变化、冻结模型的功能依赖性以及实际执行情况。 ## 1 引言 自适应计算旨在根据每个输入或令牌的需求分配模型容量。变步长模型和自适应深度网络会改变应用于表示的细化步骤次数(Graves2016 (https://arxiv.org/html/2607.26192#bib.bib2); Dehghaniet al.2019 (https://arxiv.org/html/2607.26192#bib.bib3); Baninoet al.2021 (https://arxiv.org/html/2607.26192#bib.bib12); Houet al.2020 (https://arxiv.org/html/2607.26192#bib.bib29))。提前退出和跳层系统会针对特定输入终止计算或绕过选定的块(Teerapittayanonet al.2016 (https://arxiv.org/html/2607.26192#bib.bib23); Wuet al.2018 (https://arxiv.org/html/2607.26192#bib.bib33); Elbayadet al.2020 (https://arxiv.org/html/2607.26192#bib.bib4); Schusteret al.2022 (https://arxiv.org/html/2607.26192#bib.bib5))。稀疏专家和令牌路由方法在计算预算下仅激活选定的专家或令牌(Shazeeret al.2017 (https://arxiv.org/html/2607.26192#bib.bib34); Feduset al.2022 (https://arxiv.org/html/2607.26192#bib.bib36); Raoet al.2021 (https://arxiv.org/html/2607.26192#bib.bib41); Raposoet al.2024 (https://arxiv.org/html/2607.26192#bib.bib6))。尽管这些方法常被统称为动态推理,但它们修改的是推理的不同方面。硬路由会改变哪些层、令牌或专家被执行,因此可以减少FLOPs或延迟。软残差门控会评估每个块,并仅重新缩放相应的更新。动态跨层混合也可以在保持完整计算图的同时,改变来自不同深度的表示对后续计算的贡献方式。所有这些机制都可能产生输入相关的系数,但仅仅系数变化并不能确定所计算的函数或所执行的计算是否真正是动态的。 现有的评估常常模糊了这一区别。门控热力图、系数方差和跨输入差异表明控制器的输出是非常数,但并未确立冻结模型是否需要系数与输入之间的原始对应关系。即使一个输入无关的层级画像几乎能重现相同的推理函数,控制器也可能在不同输入和令牌之间变化很大。相反,一个动态混合机制可能关键依赖于将每个系数张量与生成它的内容和令牌位置对齐。当每个块仍然保持激活时,这两种结果都不意味着计算节省。因此,关于动态模型的声明需要回答三个独立的问题:系数是否变化、冻结的推理函数是否依赖于系数对特定输入的分配、以及该机制是否改变了实际执行的计算。 参考图注图1:冻结控制器审计(FCA)概述。FCA区分了系数变化、功能依赖性和实际执行。它首先沿未扰动的轨迹缓存控制器系数,然后禁用控制器,并使用重新分配、洗牌或静态系数重新运行冻结模型。审计发现,静态深度画像能紧密再现FeatureGate的推理行为,而MUDDPythia则强烈依赖于跨层系数与其原始输入和令牌位置的对齐。这两个模型仍然执行了每一个Transformer块。因此,单纯的动态系数并不能确立条件执行或计算节省。本工作的核心见解是,功能依赖性可以通过对冻结模型的干预直接测试。评估首先沿未扰动的计算轨迹记录完整的系数张量。然后禁用控制器,并使用缓存的系数(无论是保留还是系统性地转换)重新运行同一模型。由于系数是在任何干预之前收集的,并且不会从扰动的隐藏状态重新计算,因此由此产生的性能变化隔离了系数分配依赖性,而不受通过控制器反馈的影响。这一思想定义了一个通用的冻结控制器审计原则。我们通过跨输入重新分配、令牌洗牌、从独立校准集估计的静态画像以及单独的执行测量,将该原则实例化为冻结控制器审计(FCA)。FCA是该更广泛原则的一个自然实现,而非其唯一可能的形式;可以为不同的控制器结构和架构声明设计其他系数保留的干预措施。 我们将FCA应用于两个特意对比的模型家族。FeatureGate是一种用于仅解码器Transformer的软残差门控机制(Vaswaniet al.2017 (https://arxiv.org/html/2607.26192#bib.bib1))。它为每个层和令牌生成一个系数,但不会跳过任何块。在七个独立训练的76M模型和三个独立训练的504M模型上,FeatureGate的输出随输入和令牌变化,然而一个静态的层级深度画像保留了Correct-to-GlobalMean性能差距的98.70%和99.43% respectively。层级身份解释了大部分系数方差,而破坏输入或令牌分配的干预仅带来微小的惩罚。相比之下,公开的MUDDPythia-1.4B检查点(它对查询、键、值和残差流使用位置特定的动态跨层混合(Xiaoet al.2025 (https://arxiv.org/html/2607.26192#bib.bib15)))对跨输入重新分配、令牌洗牌和静态替换高度敏感。因此,相同的审计区分了一个其动态变化在很大程度上可被替代的控制器和一个其动态分配具有实质性功能角色的控制器。然而,两个模型家族都执行了每一个Transformer块,并且FeatureGate的测量推理速度比Dense基线更慢。 我们的贡献如下: 1. 1.我们阐述了一个三方面评估原则,将系数变化、冻结模型的功能依赖性和实际执行分开,从而澄清了关于动态参数化、动态推理和条件计算所需证据的要求。 2. 2.我们引入了FCA作为冻结控制器干预的可复现实现,结合了两阶段缓存与重放、系数保留的重新分配、独立校准的静态画像、因子交互分析和显式的执行测量。 3. 3.我们提供了一个多尺度、多模型的实证研究,表明FeatureGate主要学习了一个稳定的深度画像,而MUDDPythia则强烈依赖于内容条件化的跨层分配;我们进一步表明,两种形式的动态参数化都没有确立跳块或计算节省。 ## 2 相关工作 ### 2.1 动态网络与输入条件化参数化 动态网络会在样本、空间位置或序列位置之间调整参数或计算路径(Hanet al.2022 (https://arxiv.org/html/2607.26192#bib.bib18))。该文献的一个分支直接生成或组合输入相关的权重。动态滤波器网络从输入生成卷积滤波器,超网络使用一个网络生成另一个网络的参数,CondConv和动态卷积以输入相关权重组合多个内核(Jiaet al.2016 (https://arxiv.org/html/2607.26192#bib.bib19); Haet al.2017 (https://arxiv.org/html/2607.26192#bib.bib20); Yanget al.2019 (https://arxiv.org/html/2607.26192#bib.bib21); Chenet al.2020 (https://arxiv.org/html/2607.26192#bib.bib22))。输入条件化参数即使在计算图保持密集和固定时也可能有用。因此,动态参数化并不能确立动态执行,而仅仅系数变化并不能表明训练后的函数使用了这种变化。 ### 2.2 自适应深度与提前退出 自适应计算时间和通用Transformer会变化循环计算步骤的数量,而PonderNet学习一个停止分布(Graves2016 (https://arxiv.org/html/2607.26192#bib.bib2); Dehghaniet al.2019 (https://arxiv.org/html/2607.26192#bib.bib3); Baninoet al.2021 (https://arxiv.org/html/2607.26192#bib.bib12))。在视觉模型中,BranchyNet、MSDNet和Shallow-Deep Networks使用中间分类器进行提前退出。SkipNet和BlockDrop则学习输入相关的跳块策略(Teerapittayanonet al.2016 (https://arxiv.org/html/2607.26192#bib.bib23); Huanget al.2018 (https://arxiv.org/html/2607.26192#bib.bib24); Kayaet al.2019 (https://arxiv.org/html/2607.26192#bib.bib25); Wanget al.2018 (https://arxiv.org/html/2607.26192#bib.bib32); Wuet al.2018 (https://arxiv.org/html/2607.26192#bib.bib33))。 Transformer模型采用了类似的思想。Depth-Adaptive Transformer、DeeBERT、FastBERT、PABEE、LeeBERT、BERxiT和CALM通过置信度准则或学习到的退出规则减少执行的层数(Elbayadet al.2020 (https://arxiv.org/html/2607.26192#bib.bib4); Xinet al.2020 (https://arxiv.org/html/2607.26192#bib.bib26); Liuet al.2020 (https://arxiv.org/html/2607.26192#bib.bib27); Zhouet al.2020 (https://arxiv.org/html/2607.26192#bib.bib28); Zhu2021 (https://arxiv.org/html/2607.26192#bib.bib30); Xinet al.2021 (https://arxiv.org/html/2607.26192#bib.bib31); Schusteret al.2022 (https://arxiv.org/html/2607.26192#bib.bib5))。DynaBERT暴露了具有可调宽度和深度的子网络,LayerDrop训练允许深度剪枝的网络,而Mixture-of-Depths在固定容量预算下选择哪些令牌进入一个块(Houet al.2020 (https://arxiv.org/html/2607.26192#bib.bib29); Fanet al.2020 (https://arxiv.org/html/2607.26192#bib.bib8); Raposoet al.2024 (https://arxiv.org/html/2607.26192#bib.bib6))。这一家族中的声明涉及执行,因此仅凭准确性是不够的。证据还必须包括执行深度、FLOPs、延迟或吞吐量。 ### 2.3 稀疏专家路由 稀疏MoE模型在扩展参数容量的同时,仅为每个示例激活一小部分专家(Shazeeret al.2017 (https://arxiv.org/html/2607.26192#bib.bib34))。GShard将稀疏路由与自动分片结合,Switch Transformer通过top-1路由简化训练,BASE Layers使用均衡分配来控制专家负载(Lepikhinet al.2021 (https://arxiv.org/html/2607.26192#bib.bib35); Feduset al.2022 (https://arxiv.org/html/2607.26192#bib.bib36); Lewiset al.2021 (https://arxiv.org/html/2607.26192#bib.bib37))。V-MoE、GLaM和Expert Choice分别将稀疏路由扩展到视觉、大语言模型和专家驱动的令牌分配(Riquelmeet al.2021 (https://arxiv.org/html/2607.26192#bib.bib38); Duet al.2022 (https://arxiv.org/html/2607.26192#bib.bib39); Zhouet al.2022 (https://arxiv.org/html/2607.26192#bib.bib40))。这些模型区分了总参数和激活参数,但路由分布仍然是描述性的。要建立对输入到专家分配的依赖性,需要进行一个干预,在保持专家权重和路由值固定的同时改变分配。 ### 2.4 令牌级动态计算 另一类方法在令牌级别改变后续计算。DynamicViT逐步移除不重要的视觉令牌,EViT重新组织并融合低注意力令牌,Dynamic Transformer根据图像难度选择令牌分辨率和退出深度(Raoet al.2021 (https://arxiv.org/html/2607.26192#bib.bib41); Lianget al.2022 (https://arxiv.org/html/2607.26192#bib.bib42); Wanget al.2021 (https://arxiv.org/html/2607.26192#bib.bib43))。A-ViT将自适应暂停扩展到空间令牌,AdaViT联合选择补丁、注意力头和块,自适应令牌采样选择输入相关数量的令牌,令牌合并通过在层之间合并令牌来减少序列长度(Yinet al.2022 (https://arxiv.org/html/2607.26192#bib.bib44); Menget al.2022b (https://arxiv.org/html/2607.26192#bib.bib45); Fayyazet al.2022 (https://arxiv.org/html/2607.26192#bib.bib46); Bolyaet al.2023 (https://arxiv.org/html/2607.26192#bib.bib47))。令牌相关的系数只有在改变后续执行时才构成条件计算。稳定的绝对位置结构也可能表现为令牌变化,因此合适的静态基线应保留层和位置的联合结构,而不仅仅是层均值。 ### 2.5 残差缩放与跨层信息流 随机深度在训练期间随机跳过残差块。Fixup、ReZero、SkipInit、LayerScale和DeepNorm则通过初始化或静态残差缩放来改进深度网络优化(Huanget al.2016 (https://arxiv.org/html/2607.26192#bib.bib7); Zhanget al.2019 (https://arxiv.org/html/2607.26192#bib.bib48); Bachlechneret al.2021 (https://arxiv.org/html/2607.26192#bib.bib9); De and Smith2020 (https://arxiv.org/html/2607.26192#bib.bib49); Touvronet al.2021 (https://arxiv.org/html/2607.26192#bib.bib10); Wanget al.2022 (https://arxiv.org/html/2607.26192#bib.bib11))。这些方法表明,层级系数可以在不依赖输入的情况下发挥作用。 相关架构改善了跨深度的信息流动。DenseNet引入了密集连接;透明注意力、DLCL和RealFormer重用来自较早层的表示或注意力分数;DenseFormer通过深度加权平均聚合较早的表示(Huanget al.2017 (https://arxiv.org/html/2607.26192#bib.bib50); Bapnaet al.2018 (https://arxiv.org/html/2607.26192#bib.bib51); Wanget al.2019 (https://arxiv.org/html/2607.26192#bib.bib52); Heet al.2021 (https://arxiv.org/html/2607.26192#bib.bib53); Paganiet al.2021 (https://arxiv.org/html/2607.26192#bib.bib13))。
相似文章
动态Ising模型中的分布外神经推断
本文研究了用于重构动态Ising模型相互作用图的分布外神经推断,发现基于Transformer和卷积的模型展现出依赖于架构的统计先验,这些先验可能导致误导性的分布外鲁棒性。
动态规划的表示几何
本文研究为何标准神经网络架构在动态规划中无法对更长输入进行泛化,通过利用热带半环理论的几何分析来揭示组合中的结构限制。
基于物理感知潜空间代理的变分参数校准
本文介绍了一种基于物理感知自编码器的潜空间框架,用于参数化动力系统的降阶正向建模和变分参数估计,并在计算流体动力学基准上进行了演示。该方法实现了基于可微代理的逆向建模,并在现实噪声或部分观测条件下展现出更好的校准鲁棒性。
建构的现实,有争议的先验:自由能原理下的解耦与认知复发结构
本文研究了自由能原理下的“本体论反转”概念,使用卷积变分自编码器探究合成环境是否能永久取代系统的默认生成模型。研究发现表征准确性与默认行为之间存在解耦,并引入了“认知复发”现象,即系统部分回归其原始模型。
一种训练好的快速权重记忆:一个3M参数Transformer在推理时安装从未训练过的规则,仅前向传播——其中测试时训练不传递任何内容(单块RTX 3090,完全可复现)
本文介绍了一种用于3M参数Transformer的训练好的快速权重记忆机制,该机制在推理时通过仅前向传播的测试时训练安装从未训练过的规则,且不产生任何迁移。该工作可在单块RTX 3090上完全复现。