利用LLM扩展闭环特征通道配置
摘要
本文将基于LLM的闭环通道配置搜索扩展到每周期250个候选,在CIFAR-100上展示了正向的准确率趋势和参数效率提升,并揭示了LLM生成的通道先验中的架构规律性。
arXiv:2607.20516v1 公告类型: 新
摘要: 基于闭环大语言模型的通道配置搜索的初步有前景的结果表明,神经网络宽度可以通过可执行代码生成和准确率反馈直接优化。然而,这些结果来自相对稀疏的有效评估集,未解答观察到的优化行为是否能迁移到更密集的采样场景,以及当评估更多生成的网络时是否会出现额外的架构规律性。为了验证这一点,我们将相同的搜索设置扩展到每个微调周期250个候选网络。分析涵盖来自8个完整周期的2000个生成候选,经过任务和元数据过滤后得到462个经过验证的CIFAR-100评估。每周期平均准确率呈现正向线性趋势,斜率为9.87e-4(p=0.043),而高性能前沿的提升更为显著:最佳观测准确率从0.3144提高到0.3676,前5和前10周期均值均呈现正向趋势。扩展运行还揭示了参数效率的提升。最佳模型以1180万参数达到0.3676,而早期高性能模型以1.665亿参数达到0.3144。除了准确率之外,更大的样本暴露了从稀疏观察中难以评估的架构规律性。41.8%的已验证候选具有非2的幂次通道宽度,最强模型共享结构化的通道分配模式,其特征是适中的早期宽度和扩展的中期或后期块。这些发现表明,初始研究中观察到的通道搜索信号得以迁移
查看缓存全文
缓存时间: 2026/07/24 05:10
# 使用大语言模型扩展闭环特征通道配置
来源: https://arxiv.org/html/2607.20516
11机构:德国维尔茨堡大学计算机视觉实验室,CAIDAS & IFI
11邮箱:t\.atincuzun@gmail\.com
###### 摘要
基于闭环大语言模型的通道配置搜索取得了有前景的初步结果,表明可以通过可执行代码生成和精度反馈直接优化神经网络宽度。然而,这些结果来自于相对稀疏的有效评估集合,尚不清楚观察到的优化行为能否迁移到更密集的采样场景,以及当评估更多生成网络时是否会出现额外的架构规律性。为验证这一点,相同的搜索设置被扩展到每微调周期生成250个候选网络。分析涵盖了来自8个完整周期的2000个生成候选网络,经过任务和元数据过滤后,获得了462个经过验证的CIFAR-100评估结果。每个周期的平均精度呈现出正向线性趋势,斜率为9.87×10^(-4) (p=0.043),而高性能前沿的提升更为显著:最佳观测精度从0.3144提高到0.3676,并且前5名和前10名的周期级平均值也表现出正向趋势。扩展运行还揭示了参数效率的提升。最佳模型以1180万参数达到0.3676的精度,而早期高性能模型以1.665亿参数达到0.3144。除精度外,更大的样本暴露了在稀疏观测中难以评估的架构规律性。在经验证的候选网络中,41.8%包含非2的幂次通道宽度,最强的模型共享结构化的通道分配模式,其特点是适中的早期宽度和扩展的中间或后期模块。这些发现表明,初始研究中观察到的通道搜索信号能够迁移到更大数据量的场景,并且增加的采样规模将孤立的候选发现转变为对LLM生成通道先验的可测量分布性和架构分析。
## 1 引言
神经架构搜索通常被表述为在受限图或超网络上的优化问题[24 (https://arxiv.org/html/2607.20516#bib.bib2),11 (https://arxiv.org/html/2607.20516#bib.bib3)]。通道数搜索是一个更窄但实践中重要的情况:它改变每层宽度,同时保持可执行网络的骨架,并与高效模型设计和通道剪枝文献密切相关[7 (https://arxiv.org/html/2607.20516#bib.bib32),13 (https://arxiv.org/html/2607.20516#bib.bib33),12 (https://arxiv.org/html/2607.20516#bib.bib34),19 (https://arxiv.org/html/2607.20516#bib.bib8)]。先前的研究探讨了大语言模型是否可以直接在神经网络源代码上执行此类搜索[16 (https://arxiv.org/html/2607.20516#bib.bib1)]。在该框架中,LLM生成PyTorch模型,训练工具对其进行评估,并将成功生成的结果反馈到后续微调周期中。
先前的结果在较小的评估样本上确立了可行性。许多生成的程序可能会失败,一些成功的执行可能对应于非目标设置,并且最佳候选是在采样的架构总体中的一个顺序统计量。因此,仅报告最终的最佳架构留下了搜索行为是否能迁移到更大生成预算的问题。
本研究分析了相同通道配置循环的更密集运行。每个完整周期包含250个生成候选,而先前实验中的样本量要小得多。所得数据支持三个观察结果:每个周期的平均精度呈正向趋势,高性能前沿在扩展下有所改善,并且后期周期确定的通道配置在参数效率上显著优于早期候选。因此,本研究的贡献是对LLM驱动的通道搜索以及随着更多候选生成而变得可见的架构模式进行了一次扩展的实证分析。
贡献。首先,研究为LLM生成的架构实验提供了一个严格的候选计数协议,区分了失败代码、缺失日志、非目标数据集和目标有效评估。其次,扩展运行恢复并加强了先前研究中讨论的精度和前沿信号。第三,使用程序化提取和生成网络的动态PyTorch工具在大规模上分析了通道模式。第四,一个自包含的分析脚本从原始文件夹重建所有表格和图表,而不依赖预先存在的数据帧。
## 2 相关工作
神经架构搜索与通道配置。经典的NAS将架构设计表述为离散或连续搜索空间上的优化问题。基于强化学习的NAS证明了可以从验证反馈中学习架构[24 (https://arxiv.org/html/2607.20516#bib.bib2)],而可微方法如DARTS通过将架构决策放宽为连续参数降低了搜索成本[11 (https://arxiv.org/html/2607.20516#bib.bib3)]。对于高效卷积网络,一个密切相关的工作是搜索或剪枝通道维度,而不是整个宏观架构。Network Slimming使用稀疏性诱导的通道选择[13 (https://arxiv.org/html/2607.20516#bib.bib33)];AMC将压缩框架定义为自动化策略搜索[7 (https://arxiv.org/html/2607.20516#bib.bib32)];MetaPruning预测剪枝通道配置的权重[12 (https://arxiv.org/html/2607.20516#bib.bib34)];AutoSlim在可伸缩网络中搜索通道宽度[19 (https://arxiv.org/html/2607.20516#bib.bib8)]。这些方法通常在预定义的搜索空间或超网络中运行。相比之下,本研究分析的是由语言模型作为可执行代码生成的通道配置,同时将科学焦点保持在通道分配、参数效率以及在扩展候选预算下的代理精度上。
语言模型用于架构生成。最近的工作探索了将LLM作为优化器、代码编辑器或架构设计知识来源。GPT风格的模型已被测试用于NAS提示和迭代架构提议[21 (https://arxiv.org/html/2607.20516#bib.bib11),18 (https://arxiv.org/html/2607.20516#bib.bib23)]。EvoPrompting和LLMatic在进化或质量多样性搜索循环中使用语言模型代码生成[4 (https://arxiv.org/html/2607.20516#bib.bib16),14 (https://arxiv.org/html/2607.20516#bib.bib19)]。其他系统使用LLM来转移设计原则[23 (https://arxiv.org/html/2607.20516#bib.bib20)],执行自我进化和知识启发搜索[2 (https://arxiv.org/html/2607.20516#bib.bib21)],或协调多个LLM角色进行知识引导搜索[10 (https://arxiv.org/html/2607.20516#bib.bib22)]。另一条互补的工作线研究存储、评估和重用生成的神经网络所需的基础设施。NNGPT围绕LLM生成的神经网络代码,在可执行API约束下重新思考AutoML[9 (https://arxiv.org/html/2607.20516#bib.bib24)],而LEMUR和LEMUR2为自动化神经设计探索提供了大型神经网络数据集和面向多样性的资源[6 (https://arxiv.org/html/2607.20516#bib.bib37),17 (https://arxiv.org/html/2607.20516#bib.bib38)]。与本研究最接近的先前工作是闭环通道先验论文,该论文引入了反馈驱动的LLM通道配置搜索,并报告了有前景的非标准通道先验[16 (https://arxiv.org/html/2607.20516#bib.bib1)]。与这些更广泛的架构生成和数据集工作相比,本分析隔离了一个更窄的问题:先前研究中观察到的通道搜索行为在每周期生成网络数量增加时是否持续存在,以及从更大的生成总体中可以测量到什么架构规律性。
代理评估与短时域信号。NAS系统通常在进行昂贵的完整训练之前依赖低成本评估。代理信号可能来自短训练计划[22 (https://arxiv.org/html/2607.20516#bib.bib44)]、通过超网络的权重共享[11 (https://arxiv.org/html/2607.20516#bib.bib3)]、从单个小批量计算的零成本指标[1 (https://arxiv.org/html/2607.20516#bib.bib45)],或缩减的搜索空间。系统比较显示,代理在多大程度上保持架构的真实排名方面差异很大[20 (https://arxiv.org/html/2607.20516#bib.bib46),22 (https://arxiv.org/html/2607.20516#bib.bib44)]。这种近似对于排名许多候选者很有用,但必须解释为搜索时的证据,而非最终的训练性能。本研究遵循这一逻辑:一个周期的CIFAR-100精度被视为早期学习行为的固定代理。因此,动态PyTorch分析询问哪些生成的通道配置在该代理下学习迅速,哪些逐阶段分配与短时域精度相关联,以及哪些模型在完整训练确认之前改善了精度-参数前沿。
## 3 闭环流水线与扩展评估设置
该流水线将通道搜索视为条件代码生成[16 (https://arxiv.org/html/2607.20516#bib.bib1)]。输入提示包含一个基线网络、任务元数据、超参数和目标改进。LLM随后生成一个完整的神经网络程序及相关训练模块。候选者在固定的一周期代理协议下在CIFAR-100上评估。有效且经过评估的候选者被存储,随后通过使用LoRA的参数高效微调来更新模型[8 (https://arxiv.org/html/2607.20516#bib.bib12),5 (https://arxiv.org/html/2607.20516#bib.bib13)]。实验使用 OlympicCoder-7B 代码模型[15 (https://arxiv.org/html/2607.20516#bib.bib42)]和类AirNet的残差卷积骨架[3 (https://arxiv.org/html/2607.20516#bib.bib41)]。生成的网络和元数据存储在LEMUR/NNGPT生态系统中[6 (https://arxiv.org/html/2607.20516#bib.bib37),17 (https://arxiv.org/html/2607.20516#bib.bib38),9 (https://arxiv.org/html/2607.20516#bib.bib24)]。LoRA超参数遵循标准适配器设置:秩32,α=32,dropout 0.05,应用于基础模型的q、k、v投影模块;微调在每个周期开始时从基础模型的原始副本重新开始,而不是从之前的适配器继续。
研究将相同的闭环流水线扩展到每周期250个候选,相比之前的采样密度有显著增加。原始实验目录包含周期A0到A8。周期A0–A7是完整的,每个包含250个候选文件夹。周期A8是部分的(包含7个CIFAR-100评估),因此被排除在主分析之外。
计算开销。在462个严格的CIFAR-100评估中,每个候选的一周期训练耗时中位数为35秒(IQR 26–48秒),总共约7.4 GPU小时,峰值GPU内存中位数为21.5 GB。12.8%–34.4%的严格成功率意味着大约三分之二的每周期实际时间花在未进入分析的候选上。这部分成本解释了为什么需要8个周期(每个周期250个候选)来积累462个有效的CIFAR-100评估,并将搜索视为一个采样效率问题以及一个精度问题。
## 4 数据计数协议
目标有效成功定义为A0–A7中的一个候选,具有有效的{epoch_number}.json文件(在一周期协议下为1.json)以及确认在cifar-100上进行评估的eval_info.json。数据集检查会移除其他任务上的假阳性成功评估。此规则从2000个生成的候选中得到462个严格的CIFAR-100评估。
表1 (https://arxiv.org/html/2607.20516#S4.T1)和图1 (https://arxiv.org/html/2607.20516#S4.F1)总结了完整的计数。在所有完整周期中,1348个候选以错误跟踪终止,185个没有日志输出,5个是在CIFAR-100之外的数据集上成功评估。非目标评估并非代码执行失败,但被排除在CIFAR-100分析之外,因为它们不能回答目标通道搜索问题。
表1:完整周期的每个周期候选计数。每个周期包含250个生成的候选。只有严格CIFAR-100列用于精度和架构声明。
参见图注
图1:8个完整周期上的候选计数。该图区分了目标有效CIFAR-100评估、非目标评估、代码错误和缺失输出。
总体而言,在此过滤规则下,23.1%的生成候选成为目标有效的CIFAR-100评估。失败的候选用于错误分析,而成功训练的CIFAR-100模型用于后续的精度、效率、通道配置和动态PyTorch分析。
## 5 扩展下的精度趋势
表2 (https://arxiv.org/html/2607.20516#S5.T2)总结了严格的CIFAR-100结果。平均值在0.2107到0.2203的窄带内。对每周期平均值进行线性拟合,得到正向斜率9.87×10^(-4)精度点/周期 (p=0.043),表明在八个周期级观测上,周期平均水平存在上升趋势。单个候选高度可变,因此更强的实证信号出现在分布的上尾,而不是在每个候选的回归中。
表2:严格CIFAR-100候选的精度统计。前5名平均值在每周期内计算,突出显示了高性能尾部。
主要的扩展信号在前沿。A0中最优的严格CIFAR-100模型达到0.3144。后期周期将最高记录提高到A6/B190的0.3676。图2 (https://arxiv.org/html/2607.20516#S5.F2)展示了这一区别:分布的中心质量保持广泛且嘈杂,而上尾的改善更为明显。对每周期前5名和前10名平均值的线性拟合分别给出斜率4.81×10^(-3) (p=0.017)和4.02×10^(-3) (p=0.016)。这支持了扩展候选预算主要揭示改进的高性能候选,而不是整个生成总体的均匀转移。
参见图注
图2:精度趋势和前沿动态。左图:所有严格CIFAR-100候选的每周期平均精度,附带95%置信区间、四分位距阴影、中位数线和前5名平均值。右图:每周期最佳值和累积最高记录;虚线参考是先前研究中报告的最佳精度[16 (https://arxiv.org/html/2607.20516#bib.bib1)]。
这些结果表明,搜索在连续周期中改进了高性能前沿。最佳模型是一个依赖于采样预算的顺序统计量,扩展实验使得这种依赖性变得可见:后期样本包含了早期较小样本中难以获得的罕见高性能配置。
趋势p值是在八个周期级点上计算的;每周期平均值和最大值的自助法95%置信区间较宽,且在周期之间重叠。最稳定的统计证据是前5名平均值的正向线性趋势。相似文章
LLM作为噪声通道:模型容量与缩放定律的香农视角
该论文提出了一种香农缩放定律,将LLM训练建模为通过噪声通道的信息传输,解释了灾难性过训练和量化退化等非单调性能现象,并展示了相比传统缩放定律更优越的预测精度。
自信扩展:针对自适应测试时间缩放的LLM置信度校准
本文提出了C3RL,一种在保持准确性的同时校准LLM置信度的强化学习算法,以及CAS,一种基于置信度的自适应测试时缩放策略,可将推理成本降低多达12.33倍。
LLM持续预训练中最佳超参数的可预测缩放规律
本文发现了LLM持续预训练中最佳超参数(学习率、批量大小)的可预测缩放规律,提出了一个两阶段框架,可将超参数搜索开销降低高达90%,同时保持性能。
可训练的平滑旋转变换与学习到的通道缩放用于LLM量化
本文提出了可训练的平滑旋转变换,结合分位数鲁棒缩放和基于梯度的优化,以改进LLM的训练后量化,在LLaMA-3.2-1B的W4A4量化下实现了显著的误差降低。
持续LLM升级循环:一种用于从稠密到稀疏LLM的预测器门控按组稀疏训练方案
本文提出了一种用于大语言模型的从稠密到稀疏的持续训练方法,采用预测器门控的按组稀疏性实现4倍FFN稀疏度,并在Qwen2.5-8B上通过长上下文训练进行了验证。