Neural Spectral Capacity: 从网络规范直接测量和设计架构
摘要
本文介绍了Neural Spectral Capacity (NSC),一种基于奇异值谱的无需训练的指标,用于评估和优化神经网络架构,并提出了动态规划方法以在约束下进行最优设计。
查看缓存全文
缓存时间: 2026/09/25 07:44
论文页面 - 神经网络谱容量:仅从网络规格测量与设计架构
来源:https://huggingface.co/papers/2609.23087
摘要
现代Transformer设计与压缩都归结为在预算下分配容量。衡量这些决策的标准标量参数(#Params 和 #FLOPs)仅捕捉了模型规模和计算量,而无法反映架构结构:两个具有相同参数预算但不同深度-宽度、注意力头或前馈网络分配的架构会获得相同的分数,但行为却不同。我们提出神经网络谱容量(Neural Spectral Capacity, NSC),这是一个基于每个权重矩阵奇异值谱的闭式标量。在标准随机初始化下,Marchenko-Pastur定律使得仅从架构规格即可计算NSC,无需模型实例化、数据或梯度。其逐层可加性结构催生了NSC-DP,这是一个精确的动态规划求解器,能在CPU上数秒内返回资源约束下全局最大化NSC的架构——这是现有免训练代理方法的黑盒搜索无法提供的保证。实证表明,在七族Transformer和CNN架构(在FlexiBERT上,对参数数量差异小于10%的架构对,其排序相关系数τ=0.505,而#Params在此情况下下降至0.082)的排序任务中,NSC优于#Params、#FLOPs及代表性免训练代理方法;NSC-DP在2秒内发现的Transformer-XL架构在WikiText-103上超越了人工设计的基线;并且能在不使用任何校准数据的情况下,将LLaMA-7B剪枝至在八项常识推理任务上表现最佳的5.7B模型,速度比最强的免训练代理基线快约5900倍。
查看 arXiv 页面 (https://arxiv.org/abs/2609.23087) 查看 PDF (https://arxiv.org/pdf/2609.23087) GitHub2 (https://github.com/Optima-CityU/neural-spectral-capacity) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.23087)
引用本文的模型0
无模型链接本文 在模型 README.md 中引用 arxiv.org/abs/2609.23087 以从本页链接。
引用本文的数据集0
无数据集链接本文 在数据集 README.md 中引用 arxiv.org/abs/2609.23087 以从本页链接。
引用本文的 Spaces0
无 Space 链接本文 在 Space README.md 中引用 arxiv.org/abs/2609.23087 以从本页链接。
包含本文的收藏0
无收藏包含本文 将本文添加到收藏 (https://huggingface.co/new-collection) 以从本页链接。
相似文章
Spectral Energy Centroid: 一种用于提升性能与分析隐式神经表示中频谱偏差的度量
本文介绍了Spectral Energy Centroid (SEC) 度量,用于分析与改进隐式神经表示中的频谱偏差,展示了其在超参数选择、信号复杂度测量和跨架构对齐中的实用性。
Spectral Neuron - 一种用于可扩展且可解释模型的机器学习原语 [R]
本文提出了一种新的机器学习原语,称为 Spectral Neuron,提供了一个简单、可扩展且可解释的模型,并具有训练和初始化的数学基础。
通过内部激活的频谱分析检测神经网络故障
本文识别了神经网络在错误分类期间内部激活中的频谱漂移,并引入了自检测神经网络(SDNN),通过监控频谱动态来检测故障,在CIFAR-10上实现了79%的AUROC,比基于置信度的方法高出25-30个百分点。
基于无调度频谱优化的随时训练
本文介绍了SF-NorMuon,一种无调度频谱优化器,在参数规模达7.72亿的语言模型上匹配或超越调优后的AdamW,并提供了平稳性和长期稳定性的理论保证。
秩不等于容量:潜在图模型的光谱占用分析
本文提出了一种名为 Spectra 的方法,利用光谱占用率来分析和控制潜在图模型的实际容量,并论证了模型的秩并不等同于其容量。