Coupled Scaling: 神经缩放定律的表示可访问性框架
摘要
本文介绍了 Coupled Scaling,一个任务条件框架,用于解释神经缩放定律如何根据任务结构与架构优化系统可访问的几何表示之间的关系而变化。
arXiv:2609.03533v1 公告类型:新
摘要:现有理论从数据几何或指定的数据-模型谱推导神经缩放,但在相同数据上训练的系统在架构或优化改变其可高效到达的表示时,可能表现出不同的缩放行为。我们引入 Coupled Scaling,一个任务条件框架,其中有限预算缩放取决于任务结构与架构优化系统可访问几何之间的关系。在一个可解的模式截断模型中,损失分离为架构支持之外的目标能量和未解析的支持尾部。对于任意优先级顺序,残差介于最佳-N支持尾部和最大完成高价值前缀之后的尾部之间。如果累积尾部和覆盖对数率为 $\gamma_{A,T}$ 和 $\rho_{A,O,T}$,则残差指数位于 $[\rho_{A,O,T}\gamma_{A,T},\gamma_{A,T}]$ 中。在有界前缀外增益下,完成的前缀是速率决定性的,且 $\alpha_{A,O,T}=\rho_{A,O,T}\gamma_{A,T}$;对于 $a_{A,T,j}\asymp j^{-b_{A,T}}$,这给出 $\alpha_{A,O,T}=\rho_{A,O,T}(b_{A,T}-1)$。一个固定核特化从独立于损失拟合定义的任务加权谱度量的近零尾部推导训练时间指数。该框架将架构支持与有限预算获取分离,并激发两个测试:静态任务相关几何应在共同预算下跟踪损失,而多尺度几何应跟踪耦合特定指数排序,包括跨对比任务的反转。对已发布涌现轨迹的审计确定了直接因子测试所需的控制措施,该测试独立测量几何与缩放拟合。
查看缓存全文
缓存时间: 2026/09/04 06:30
# 1. 引言
来源:https://arxiv.org/html/2609.03533
**耦合缩放:一种神经缩放定律的表征可达性框架**
作者:王杰
**大语言模型使用说明**:OpenAI 的 ChatGPT 和 Anthropic 的 Claude 协助完成了文献检索、代码起草与调试、统计交叉检验、格式整理以及语言修订。作者独立提出了研究问题与框架,确定了论点、推导和实验设计,独立验证了引用、代码及报告结果,并对全文负责。
西南政法大学民商法学院
2026年9月
**摘要**
现有理论从数据几何或预设的数据-模型谱系推导神经缩放规律,但实践中,在相同数据上训练的系统若因架构或优化改变其高效可达的表征,可能表现出不同的缩放行为。我们提出**耦合缩放**,一种任务条件下的框架,其中有限预算缩放取决于任务结构与架构-优化系统可达几何之间的关系。在可解的**模态截断模型**中,损失可精确分解为架构支持之外的目标能量与未解析的支持内尾部残差。对于任意优先级排序,残差介于最佳NN支持尾部与已完成的高价值前缀之外的尾部之间。若累积尾部对数率为γA,T,已完成前缀覆盖对数率为ρA,O,T,则残差指数位于[ρA,O,T·γA,T, γA,T]区间内。该区间区分了前缀受限缩放与分散获取。当前缀外增益有界时,已完成前缀成为速率决定因素,且下界精确成立:αA,O,T = ρA,O,T·γA,T;对于幂律情况aA,T,j ≍ j^{-bA,T},可恢复αA,O,T = ρA,O,T·(bA,T−1)。**固定核特化**从任务加权的谱度量近零尾部推导训练时指数,该度量独立于损失拟合。
这些结果强化了架构支持与有限预算获取的区分,并启发了两项实证检验:静态任务相关几何应与相同预算下的损失相对应;多尺度几何应与耦合特定的指数排序对应,包括其在对比任务中的预设反转。对已发布涌现轨迹的审计确定了直接检验所需的控制变量,并将其组织为交叉设计,将几何测量与缩放拟合分离。
神经缩放定律描述损失如何随模型规模、数据量和计算量变化,指导资源分配与未来能力预测(Hestness等,2017;Kaplan等,2020;Hoffmann等,2022)。一个核心比较问题仍未解决:何时在相同数据上训练的系统应共享缩放定律,何时其斜率或可达损失应发生分歧?现有几何与谱理论通过解释任务结构如何进入缩放来解决该问题的任务侧部分。流形理论在平滑假设下将参数缩放与内在维度关联(Sharma与Kaplan,2022);核与随机特征模型从预设的特征映射、数据-模型谱系、目标对齐和统计状态推导学习曲线(Maloney等,2022;Bahri等,2024)。当表征固定或充分灵活时,这些理论最为直接适用。当在相同数据上训练的系统达到不同的任务相关几何时,比较将发生变化。等变与非等变模型在相同神经场数据上训练时,表现出不同的参数、数据和计算缩放指数(Ngo与Ravanbakhsh,2026)。特征学习改变了与初始表征对齐不良目标的训练时与计算指数(Bordelon等,2025);预处理改变了受控随机特征回归中的拟合模型规模指数(Ramani与Jain,2026);对叠加的权重衰减干预为宽度缩放提供了直接几何机制(Liu, Liu与Gore,2025)。这些研究共同将学习系统置于缩放关系之内。在不同资源维度上,它们揭示了相同的结构性可能性:模型可能包含与目标相关的方向,但为其分配的强度不足或到达过晚,在观测尺度下无足轻重。架构塑造可用性;训练塑造可用方向变为有用的时间。其效应要求一个由学习系统、任务和可用预算共同索引的对象。我们将由此产生的关系称为**耦合缩放**。
> 注:Cheng等(2026)将“耦合”用于深度-宽度路径L=u(N),训练与测试样本量进入有限样本可靠性条件,沿该路径的收益在该条件下仍可观测。此处耦合指架构-优化系统可达几何与任务结构之间的关系。
设B为参数、数据、计算和训练时间的有限包络,P=(D_train, ℓ)固定训练问题与目标。对于架构A与训练程序O,**表征可达集**R_B(A,O; P)包含该包络内可达的几何。架构可塑造结构支持,特征学习可重塑已实现表征,优化可改变表征方向的获取顺序。耦合缩放通过其与任务的交互追踪这些通道。其实证特征是任务依赖的耦合,具有显著的水平与速率差异。在相同有限预算下,静态任务相关几何与该预算下的损失配对;跨尺度时,几何增长与拟合指数差异配对。共享的任务相关访问预测向适用数据侧速率的收敛。在§3.3形式化的**公共尾部**与**前缀充分性**条件下,跨任务的反转获取速率排序预测反转指数排序。静态探针测量固定预算下的有用任务结构;多尺度轨迹测量其增长。几何量独立于损失曲线。
该交互在模态截断模型中存在精确见证。架构提供支持集S_A,架构-优化耦合提供支持方向上的优先级排序π_{A,O}。总体损失分解为目标能量(在支持外)与未解析的支持尾部。对于任意优先级排序,累积支持尾部与最大已完成高价值前缀给出普适区间:
Ā_{A,T}(N) ≤ E_{A,O,T}(N) ≤ Ā_{A,T}(J_{A,O,T}(N))。
若累积尾部与已完成前缀的对数率分别为γ_{A,T}与ρ_{A,O,T},残差指数位于[ρ_{A,O,T}·γ_{A,T}, γ_{A,T}]内。有界前缀外增益使已完成前缀成为速率决定因素,给出α_{A,O,T}=ρ_{A,O,T}·γ_{A,T}。对于a_{A,T,j}≍j^{-b_{A,T}},γ_{A,T}=b_{A,T}−1,恢复幂律特化。该区间也捕获分散获取:附录B.2构造了一个固定嵌套顺序,具有相同的已完成前缀速率与严格更快的残差速率。**固定核特化**从任务加权谱质量近零处推导训练时指数。
在理论层面,耦合缩放提供了一个比较框架与可解见证。它识别了严格下界,为任意优先级排序给出了精确的尾部-覆盖区间,陈述了单标量已完成前缀速率何时预测指数,并将构造锚定在固定核谱极限中。实证贡献是识别设计,将静态几何与匹配预算损失配对,将多尺度几何与拟合速率配对。已发布的涌现轨迹识别了所需控制变量;提出的因子检验将耦合与对比任务交叉。
**图1**(https://arxiv.org/html/2609.03533#Sx1.F1)总结了该逻辑:
- **目标** f_T
- **架构支持** S_A
- **不支持的目标能量** ∑_{k∉S_A} c_{T,k}^2 → **严格下界** L_A^∞(T)
- **累积支持尾部** Ā_{A,T}(m) = ∑_{j>m} a_{A,T,j} → **对数率** γ_{A,T}
- **标准已完成前缀** J_{A,O,T}(N) → **对数率** ρ_{A,O,T}
- **残差率** ργ ≤ α ≤ γ;有界前缀外增益:α=ργ
**(A) 最小支持-尾部-覆盖见证**
固定核K_q与目标f_T → 任务加权谱度量ν_{q,T}
- 零原子 ν_{q,T}({0}) → L_{q,T}^∞
- 正近零尾部 F_{q,T}(x) ∼ cx^{β_{q,T}} ℓ(1/x) → L_{q,T}(t)−L_{q,T}^∞ ∼ Ct^{-β_{q,T}} ℓ(t)
- 训练时指数 α_t(q,T) = β_{q,T}
**(B) 固定核特化**
- 在每个预设N处测量几何:静态水平 g_{q,t}^{level}(\bar{N})
- 与相同预算下的损失比较:L_{q,t}(\bar{N})
- 速率敏感轨迹:g_{q,t}(N) → 估计ρ^{(g)},或使用固定核β
- 与拟合指数α_{q,t}比较
- 检验匹配预算追踪、速率预测与任务反转
**(C) 直接2×2几何追踪检验**
图1:耦合缩放作为支持-尾部-覆盖框架与直接检验。(A) 架构支持外的目标能量确定严格下界。在支持内,累积目标尾部与标准已完成前缀覆盖给出普适速率区间;有界前缀外增益使下界精确。对于a_{A,T,j} ≍ j^{-b_{A,T}},累积尾部速率为γ_{A,T}=b_{A,T}−1。(B) 在固定核特化中,任务加权谱质量近零处的正则变化给出训练时指数(直至慢变因子)。(C) 在因子设计中,\bar{N}处的静态几何与相同预设预算下的损失比较。多尺度轨迹提供ρ^{(g)},固定核替代方案使用β。公共尾部与前缀充分性准则定义乘积律比较。任务内对比为主,拟合指数排序跨任务预设反转检验。
---
## 2. 从数据侧缩放到模型侧依赖
### 2.1 数据几何与固定表征说明
实证缩放研究确定了跨模型规模、数据与计算的规律幂律或幂律加常数关系(Hestness等,2017;Kaplan等,2020;Hoffmann等,2022)。这些关系对预测与分配有用;其拟合参数仍主要描述性。数据侧理论通过连接缩放与学习问题结构提供机制。例如,Sharma与Kaplan(2022)在平滑与通用函数假设下将参数缩放与内在维度关联。Bahri等(2024)从数据-模型谱系、目标对齐和有限样本效应推导多个统计状态;可解核与随机特征模型通过特征谱、目标系数、噪声、正则化与资源状态表达学习曲线(Maloney等,2022;Bordelon等,2020;Canatar等,2021)。离散覆盖说明提供密切相关尾部视角。Zou等(2026)在排序Zipfian模式空间中形式化尖锐单调有效前沿,并从该前沿之外的质量推导资源依赖损失。Song等(2026)构建语料库内在预测贡献谱,并通过匹配观测超额损失与其残差尾部推断移动数据规模截断。这些论文共同确立尾部-前沿组合作为直接邻近机制。
耦合缩放将该机制扩展至支持与严格下界可能不同的系统,允许交错目标等级的获取路径,并在损失拟合前从几何获取实证获取速率。前缀精确特化恢复Zou等的尖锐前沿律。在完全支持与K_R={1,...,k_⋆(R)}下,标准已完成前缀为J(R)=k_⋆(R),命题2给出E(R)=Ā(k_⋆(R))。因此a_j ≍ j^{-b}与k_⋆(R) ≍ R^ρ给出E(R) ≍ R^{-ρ(b−1)}。该恢复分离出附加比较对象:耦合索引支持、交错获取、前缀充分性准则与跨任务反转。Zou等的资源特定前沿推导与最大瓶颈分析处理互补问题。Song等通过匹配观测超额损失与残差尾部质量推断截断;耦合缩放从损失拟合前指定的几何轨迹估计获取,并将其评估为指数排序的预测因子。匹配数据跨系统问题是架构-优化系统如何使任务相关方向变强、早期可用或在可行预算内可达。
### 2.2 相同数据的模型侧依赖证据
架构比较使模型侧依赖具体化。Tay等(2023)报告匹配语言模型预训练下的架构依赖缩放行为与排名变化。Ngo与Ravanbakhsh(2026)在相同数据与任务上比较等变与非等变神经场模型,发现不同参数、数据和计算缩放指数,任务匹配的等变缩放更高效。在受控分层语言生成器中,Cagnetta等(2025)发现通过局部性与权重共享对齐的卷积网络比Transformer缩放更快;表征探针追踪潜在层次结构的获取。Defilippis, Krzakala, Loureiro与Maillard(2026a)为分层多索引目标上的两层网络强化该结构图景,推导表征受限状态、子空间恢复转变、平台与谱结构。一项近期的资源匹配架构比较研究循环深度,同时密切匹配循环与非循环稀疏MoE Transformer的每token FLOPs、总非嵌入参数与KV缓存大小。Wang等(2026)将中间一半层循环两次,并为四种模型规模的两种架构拟合独立Chinchilla式缩放曲面。循环配置具有更陡峭的计算缩放。相似文章
统一神经缩放定律
提出了一种统一神经缩放定律,能够精确建模深度神经网络在多个维度(包括参数量、数据集大小、训练步数和计算量)上的缩放行为,并在多种架构和任务上得到验证。
统一神经缩放定律
本文提出了统一神经缩放定律(UNSL),这是一种函数形式,能够准确建模和推断深度神经网络在多个维度(如参数、数据和步骤)同时变化时的缩放行为,相较于之前的缩放定律有所改进。
@lilianweng: 一篇超级迟到的(3年以上?)关于扩展定律的帖子。计算很昂贵。扩展定律是一种帮助我们推理…
Lilian Weng的博客文章全面概述了深度学习中的扩展定律,涵盖了它们的推导、计算最优分配以及Kaplan等人与Chinchilla之间的争论。
扩展定律,谨慎解读(25分钟阅读)
全面概述深度学习中的扩展定律,追溯其理论基础和实证发现,并解释损失如何随模型大小、数据和计算量可预测地降低。
Skaling:Chinchilla的指数与Kaplan的耦合
本文介绍了Skaling定律,这是一种广义的神经缩放定律,通过一个交互指数将模型容量和数据耦合,将预测误差降低1.5至3倍,并能在计算量约为均匀扫描十分之一的情况下实现全网格外推。