Neural Spectral Capacity: 从网络规范直接测量和设计架构

Hugging Face Daily Papers 论文

摘要

本文介绍了Neural Spectral Capacity (NSC),一种基于奇异值谱的无需训练的指标,用于评估和优化神经网络架构,并提出了动态规划方法以在约束下进行最优设计。

现代Transformer设计和压缩都归结为在预算下分配容量。这些决策的标准标量,参数数量和FLOPs,捕获规模和计算但不包含架构结构:两个具有相同参数预算但不同深度-宽度、头或FFN分配的架构得到相同的分数但行为不同。我们提出了Neural Spectral Capacity (NSC),一种基于每个权重矩阵奇异值谱的解析标量。在标准随机初始化下,Marchenko-Pastur定律使得NSC仅从架构规范即可计算,无需模型实例化、数据或梯度。其逐层可加结构支持NSC-DP,一个精确的动态规划求解器,在几秒内于CPU上返回在资源约束下全局最大化NSC的架构——这是现有的无需训练代理的黑箱搜索无法提供的保证。实证表明,NSC在七个Transformer和CNN系列中的排名优于参数数量、FLOPs和代表性的无需训练代理(在FlexiBERT上,τ= 0.505,对于参数数量差异小于10%的配对,而参数数量降至0.082);NSC-DP在WikiText-103上发现了Transformer-XL架构,在2秒内超越人工设计的基线;并且将LLaMA-7B剪枝到在八个常识推理任务中最佳的5.7B模型,无需任何校准数据,比最强的无需训练代理基线快约5900倍。
查看原文
查看缓存全文

缓存时间: 2026/09/25 07:44

论文页面 - 神经网络谱容量:仅从网络规格测量与设计架构

来源:https://huggingface.co/papers/2609.23087

摘要

现代Transformer设计与压缩都归结为在预算下分配容量。衡量这些决策的标准标量参数(#Params 和 #FLOPs)仅捕捉了模型规模和计算量,而无法反映架构结构:两个具有相同参数预算但不同深度-宽度、注意力头或前馈网络分配的架构会获得相同的分数,但行为却不同。我们提出神经网络谱容量(Neural Spectral Capacity, NSC),这是一个基于每个权重矩阵奇异值谱的闭式标量。在标准随机初始化下,Marchenko-Pastur定律使得仅从架构规格即可计算NSC,无需模型实例化、数据或梯度。其逐层可加性结构催生了NSC-DP,这是一个精确的动态规划求解器,能在CPU上数秒内返回资源约束下全局最大化NSC的架构——这是现有免训练代理方法的黑盒搜索无法提供的保证。实证表明,在七族Transformer和CNN架构(在FlexiBERT上,对参数数量差异小于10%的架构对,其排序相关系数τ=0.505,而#Params在此情况下下降至0.082)的排序任务中,NSC优于#Params、#FLOPs及代表性免训练代理方法;NSC-DP在2秒内发现的Transformer-XL架构在WikiText-103上超越了人工设计的基线;并且能在不使用任何校准数据的情况下,将LLaMA-7B剪枝至在八项常识推理任务上表现最佳的5.7B模型,速度比最强的免训练代理基线快约5900倍。

查看 arXiv 页面 (https://arxiv.org/abs/2609.23087) 查看 PDF (https://arxiv.org/pdf/2609.23087) GitHub2 (https://github.com/Optima-CityU/neural-spectral-capacity) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.23087)

引用本文的模型0

无模型链接本文 在模型 README.md 中引用 arxiv.org/abs/2609.23087 以从本页链接。

引用本文的数据集0

无数据集链接本文 在数据集 README.md 中引用 arxiv.org/abs/2609.23087 以从本页链接。

引用本文的 Spaces0

无 Space 链接本文 在 Space README.md 中引用 arxiv.org/abs/2609.23087 以从本页链接。

包含本文的收藏0

无收藏包含本文 将本文添加到收藏 (https://huggingface.co/new-collection) 以从本页链接。

相似文章

通过内部激活的频谱分析检测神经网络故障

arXiv cs.LG

本文识别了神经网络在错误分类期间内部激活中的频谱漂移,并引入了自检测神经网络(SDNN),通过监控频谱动态来检测故障,在CIFAR-10上实现了79%的AUROC,比基于置信度的方法高出25-30个百分点。

基于无调度频谱优化的随时训练

arXiv cs.LG

本文介绍了SF-NorMuon,一种无调度频谱优化器,在参数规模达7.72亿的语言模型上匹配或超越调优后的AdamW,并提供了平稳性和长期稳定性的理论保证。