预先知道何时进化外层循环无益:一种预注册的廉价基线筛选规则

arXiv cs.CL 论文

摘要

本文介绍了一种预注册的筛选规则,可在实施前判断对神经网络参数进行进化外层循环是否值得构建,并通过两个案例验证,显示可节省大量GPU小时。

arXiv:2606.29119v1 公告类型:新 摘要:我们引入了一种预注册的筛选规则,可在任何实施之前判断对神经网络参数或结构进行进化/种群/生命周期外层循环是否值得构建。此类外层循环的成本是其梯度内层循环的10^2-10^3倍,但通常只有在付出代价后才发现它们是否优于廉价的单次替代方案。我们的规则在第0阶段关口计算一个单一数值:恢复率R = s/G,即最佳单次梯度/曲率统计量的增益s除以所评估的任何廉价方法的最佳增益G,当R >= 90%时建议跳过外层循环。我们在一个实验室内部的一系列预注册的外层循环试验(两个已分析案例加上一个已公开的未发表案例)上验证了该规则:在分析的两个案例中,静态或单次计算捕获了项目自身指标上的效果,关口触发(两个案例中R均约为1.0;在更严格指标下其中一个约为0.95),外层循环被放弃,其中包括一个案例,其伴随的因子分解将表观收益归因于静态基础变化,而进化生命周期未贡献可检测的增益。在一个项目中,关口花费约50-70 GPU小时,并筛选掉了估计400+ GPU小时(仅第一个单元)以及数周的实施时间,实现了6-8倍的节省。该规则在预期上可被证伪:若一项任务R < 90%但外层循环仍未能胜过单次方法,则反驳该规则。
查看原文
查看缓存全文

缓存时间: 2026/06/30 05:30

# 提前知道进化外部循环何时无益:一项预注册的廉价基线筛选规则
来源:https://arxiv.org/html/2606.29119

###### 摘要

我们引入了一项预注册筛选规则,该规则*在实施之前*决定,是否值得构建一个针对神经网络参数或结构的进化/群体/生命周期外部循环。此类外部循环的成本是其梯度内部循环的10²–10³倍,然而它们是否能胜过廉价的单次替代方案,通常只有在付出代价后才能发现。我们的规则在Phase-0门控处计算一个单一数值——恢复率R = s/G,即最佳单次梯度/曲率统计量的增益s除以所评估的任何廉价方法的最佳增益G——并规定当R ≥ 90%时跳过外部循环。我们在一个实验室内部的预注册外部循环押注系列(两个已分析案例加上一个公开的文件抽屉案例)上验证了该规则:在两个已分析案例中,静态或单次计算都捕捉到了对项目自身度量的影响,门控触发(两个案例中R ≈ 1.0;一个案例在更严格度量下≈0.95),外部循环被放弃——包括一个案例,其中配套的因子分解将表面上的胜利定位为静态基底的变化,而进化生命周期没有贡献可检测的增益。在一个项目上,门控成本约为50–70 GPU小时,并筛选掉了估计约400+ GPU小时(仅第一个单元)外加数周的实施——节省约6–8倍。该规则在预期上是可证伪的:一个R < 90%但外部循环仍未能胜过单次方法的任务将反驳该规则。

## 1 引言

在参数、掩码、路径或结构上进行搜索的进化、基于群体和生命周期*外部循环*是一个有吸引力的想法:它们可以优化梯度内部循环无法直接服务的目标。但它们也很昂贵——通常成本是其包裹的内部循环的10²–10³倍。因此实验室面临的实际问题不是“*外部循环能*帮助吗?”,而是“如何廉价且提前知道它是否会?”

本文通过一项预注册的纪律回答了这个问题,并报告了将其应用于我们自己工作的结果。贡献是*方法论*上的,而非新算法;该纪律产生的个别负面结果本身并不令人惊讶(参见第2节 (https://arxiv.org/html/2606.29119#S2))。新颖之处在于打包好的、有证据支持的、在预期上可证伪的*决策程序*。

#### 贡献。

- •**廉价基线证伪门控**(第3节 (https://arxiv.org/html/2606.29119#S3)):一项预注册的Phase-0协议,在构建外部循环之前,在*论文将使用的同一度量*上运行最廉价的合理非机制解释(随机、单次启发式、静态/非进化)。
- •**操作筛选规则**(第3节 (https://arxiv.org/html/2606.29119#S3)):当恢复率R = s/G ≥ 90%时跳过外部循环,其中s是最佳单次梯度/曲率统计量的增益,G是任何廉价方法评估的最佳增益。90%阈值是置于观察到的“击杀”点之下的保守约定,且该规则在预期上是可证伪的。
- •**在实验室内部系列上验证**(第4节 (https://arxiv.org/html/2606.29119#S4)–5节 (https://arxiv.org/html/2606.29119#S5)):两个已分析案例,外加一个公开的文件抽屉案例。在两个已分析案例中,门控都筛选掉了外部循环,包括一个案例,其提交的配套因子分析将外部循环确定为非贡献者。(我们不声称独立性——见第8节 (https://arxiv.org/html/2606.29119#S8)。)
- •**节省的GPU小时账本**(第6节 (https://arxiv.org/html/2606.29119#S6)):量化门控带来的收益。

我们明确说明这篇论文*不是*什么:它不是声称进化外部循环永远无益。第7节 (https://arxiv.org/html/2606.29119#S7)陈述了相反的情况——它们*应该*有益的条件——作为一个假设,并带有一个已命名的、预注册的后续设计,其首次筛选现已报告;这里没有声称依赖于其未运行的分支。

## 2 相关工作与定位

我们针对三条工作线进行定位;这篇论文没有与任何一条争论,这就是为什么我们的个别负面结果并不令人惊讶,我们的贡献在于筛选程序而非任何一个结果。

#### 平滑目标上的进化策略。

当梯度不可用或地形崎岖时,ES 是一个有竞争力的黑盒优化器(Salimans等人,2017 (https://arxiv.org/html/2606.29119#bib.bib1);Such等人,2017 (https://arxiv.org/html/2606.29119#bib.bib2);Lehman等人,2018 (https://arxiv.org/html/2606.29119#bib.bib3))。在内部优化器已经服务的平滑、可微目标上,已知 ES 至多具有竞争力,通常更差:Zhang等人(2017 (https://arxiv.org/html/2606.29119#bib.bib13))表明 ES 估计高斯平滑目标的梯度,因此当每个小批量的梯度已经可访问时,其开销是不合理的;Lenc等人(2019 (https://arxiv.org/html/2606.29119#bib.bib12))发现 ES 仅在小问题上与基于梯度的搜索竞争。我们的案例处于这种状态,筛选规则将*提前检测*到这一点操作化。这是一个活跃领域:ES 正被重新提议用于 LLM 微调(Sarkar等人,2025 (https://arxiv.org/html/2606.29119#bib.bib22)),并且其失败模式正在被积极研究(Abdi等人,2026 (https://arxiv.org/html/2606.29119#bib.bib23);Hoy等人,2026 (https://arxiv.org/html/2606.29119#bib.bib24))——这正是预构建门控有用的原因,因为它能在你投入 ES 外部循环之前告诉你,一个廉价的基线是否已经恢复到了前沿。

#### 基于重要性的掩码选择/剪枝。

幅度剪枝(Han等人,2015 (https://arxiv.org/html/2606.29119#bib.bib4))、带重绕的迭代幅度剪枝(Frankle and Carbin,2019 (https://arxiv.org/html/2606.29119#bib.bib5);Frankle等人,2020 (https://arxiv.org/html/2606.29119#bib.bib6))、连接敏感性(Lee等人,2019 (https://arxiv.org/html/2606.29119#bib.bib7))和 Fisher 信息重要性(Kirkpatrick等人,2017 (https://arxiv.org/html/2606.29119#bib.bib8);Sung等人,2021 (https://arxiv.org/html/2606.29119#bib.bib9))能从单次或廉价迭代统计量中产生强大的掩码。Su等人(2020 (https://arxiv.org/html/2606.29119#bib.bib11))更进一步:随机重新洗牌每层内*哪些*权重被保留,最终准确率保持不变,因此只有每层稀疏率携带信息,掩码标识本身不携带信息——这直接类比于我们的随机 κ 对照。这些方法能与搜索到的掩码相媲美是已知的;我们的掩码标识结果(第5.2节 (https://arxiv.org/html/2606.29119#S5.SS2))是在双层约束适应度设定中的一个确认,而非新主张。

#### LLM 上 ES 的参数空间约束(并发)。

Schweighofer等人(2026 (https://arxiv.org/html/2606.29119#bib.bib10))研究了 LLM 微调中 ES 的参数空间约束(幅度锚定)——属于同一家族的并发工作,与掩码标识选择正交。我们的掩码标识基线包括一般的*锚定权重衰减*机制——一个将适配器拉向其中间检查点的纯 L₂ 惩罚(γ ∑ ‖W − W_warm‖²),我们将其作为基线运行,而非重新实现他们的具体公式;我们仅使用他们报告的范围作为单一强度超参数 γ 的起始估计。这个一般的锚定权重衰减在噪声范围内与最佳单次掩码方法不相上下——这是一个定位点,而非竞争。

#### “搜索值得吗?”决策程序。

最接近的形式化亲属决定*是否*进行昂贵的搜索,而非如何运行它。Weerts等人(2020 (https://arxiv.org/html/2606.29119#bib.bib19))形式化了一个非劣效性检验和一个“调参风险”——因将超参数保留为其默认值而非调优而损失的性能——并发现默认值通常是非劣效的;Bahmani等人(2021 (https://arxiv.org/html/2606.29119#bib.bib20))同样推荐哪些超参数值得调优。在神经架构搜索中,随机搜索是一个有竞争力的基线(Li and Talwalkar,2019 (https://arxiv.org/html/2606.29119#bib.bib16)),搜索阶段常常无法胜过随机选择(Yu等人,2019 (https://arxiv.org/html/2606.29119#bib.bib17)),并且相对于随机的改进已被提议为唯一诚实的 NAS 度量(Yang等人,2019 (https://arxiv.org/html/2606.29119#bib.bib18))。决定性的区别在于*何时*咨询廉价基线:在上述所有工作中,它是一个*事后*比较器,用于在方法构建后对其进行验证或反驳。我们的则是一个*预注册的、预构建的*通过/不通过门控,带有承诺的恢复率阈值,决定是否构建外部循环。我们找到的最接近预构建直觉——先运行随机搜索以评估搜索空间的潜力(Krishna等人,2021 (https://arxiv.org/html/2606.29119#bib.bib21))——是作为非正式建议陈述的,没有恢复率、阈值或预注册。我们不声称底层直觉是新的;我们声称将其打包为一个可证伪的、预先承诺的决策规则是新的。

筛选规则本身——一个预注册的、度量匹配的、预构建的决策程序,带有可证伪的阈值——据我们所知,在此类文献中尚未被打包呈现。

## 3 筛选门控与规则

#### 门控。

在任何外部循环实施之前,列举预期效果的最廉价合理非机制解释(随机、单次启发式、静态/非进化)并在*论文将使用的同一度量*上运行它们。仅当这些基线未能捕捉到效果时,才构建外部循环。图1 (https://arxiv.org/html/2606.29119#S3.F1)总结了该程序。

热身检查点(无进一步适配)
在论文自身度量上运行廉价基线:
单次梯度/曲率统计量(增益 s);随机;静态/非进化;无掩码的全适配。
前沿 G = 所有方法中的最大增益。
计算恢复率 R = s/G ∈ [0,1]
R ≥ 90%?
是:跳过外部循环(单次方法已在前沿)
否:构建外部循环(搜索可能有所利用的空间)
图 1:Phase-0 廉价基线证伪门控。所有增益均在论文自身度量上相对于热身(无进一步适配)基线测量。恢复率 R = s/G 将最佳单次梯度/曲率统计量的增益 s 与可实现的前沿 G(由*任何*廉价方法(包括单次方法)达到的最佳增益)进行比较。将 G 定义为该最大值可使 R 保持为适当分数,并使“击杀”信号变为“单次方法*就是*最佳廉价方法”。

#### 筛选规则。

所有增益均在论文度量上相对于热身(无进一步适配)基线测量。令*可实现的前沿* G 为在 Phase-0 门控处评估的任何方法(单次统计量、随机和静态基线、无掩码全适配)达到的最佳增益,s 为最佳单次梯度/曲率统计量的增益。定义 R = s/G ∈ [0,1]。如果 R ≥ 90%,则跳过外部循环——单次统计量已经位于(或定义了)前沿。将 G 定义为所有评估方法的最大值可使 R 保持为适当分数,并使“击杀”信号变为“单次方法*就是*最佳廉价方法”。

#### 阈值锚定。

两个语料“击杀”点都位于 R ≈ 1.0(掩码标识研究,第5.2节 (https://arxiv.org/html/2606.29119#S5.SS2),在更严格的 ΔAcc_B 视角下也读作 ≈0.95——这是*一个*案例的两种视角,而非案例间的分散);唯一一个外部循环胜过单次方法的案例其 R ≈ 0.004。因此数据支持在 ≈0.004 和 ≈0.95 之间的宽空白带中的*任何*截断点;它并*没有*精确定位 90%(图2 (https://arxiv.org/html/2606.29119#S3.F2))。我们采用 90% 作为一个故意保守的约定——如有疑问,宁可错误地*构建*外部循环,而非错误地*跳过*它——并指出没有语料点落在模糊带内,因此该约定不影响此处报告的任何决策。该规则在*预期上是可证伪的*:一个 R < 90% 但外部循环仍未能胜过单次方法的任务将反驳该规则。表1 (https://arxiv.org/html/2606.29119#S3.T1) 收集了该规则所验证的完整语料。

参见图注
图 2:恢复率轴与保守的 90% 约定。语料中唯一一个外部循环胜过单次搜索的案例位于 R ≈ 0.004(一个合成、神谕对齐的阳性对照;第7节 (https://arxiv.org/html/2606.29119#S7));两个真实“击杀”点都位于 R ≈ 1.0(掩码标识研究在更严格的 ΔAcc_B 视角下也读作 ≈0.95——同一击杀的第二种视角)。没有点落在空白带 (0.004, 0.95) 内,因此数据仅将截断点固定在其中某处;90% 是保守选择,而非测量所得。
表 1:实验室内部语系一览。每个真实任务案例都筛出 R ≥ 90%,外部循环被跳过或从未构建;唯一 R < 90% 的实例是神谕对齐的合成对照。R 是恢复率 s/G(第3节 (https://arxiv.org/html/2606.29119#S3)),除非另有说明。† 直接廉价对照胜出外部循环的击杀(对照 0.906 > 拯救 0.805),非 s/G 比率。‡ Rscreen,针对无梯度离散目标的领域恰当结果比率(第7节 (https://arxiv.org/html/2606.29119#S7))。§ 唯一 R < 90% 且外部循环获胜的实例——但神谕对齐,非真实任务。

## 4 案例 1 — 一个单独报告的 MoE-生命周期项目:LOO-对齐适应度(已引用)

该案例(Kumaresan, 2026 (https://arxiv.org/html/2606.29119#bib.bib26))是一份单独的配套预印本,公开在 arXiv 上;我们引用其报告的结果,不重新开放它们。预注册主张:进化 MoE 生命周期中的留一法对齐适应度信号能改善外部循环选择,胜过静态混合专家模型。

在真实文本上,每个干净的主动轮换比较要么是损失,要么是与静态 MoE 基线在噪声范围内持平。唯一达到显著性的比较(代码域,+0.0625 nats,p=0.009)通过该项目自身的因子分解被分解:增益*定位*于静态路由器基底的改变(+0.0976 nats,p ≤ 0.002),而进化生命周期项贡献了*无显著增益*(−0.028 nats,p ≈ 0.05,n=3)。评估使用了确定性的批次处理,这缩小了方差估计,因此夸大了每个项的表观显著性;真实的不确定性比所报告的更宽,使得“无显著增益”成为*保守*解读(而路由器重写的显著性是一个上界)。我们不提出“生命周期损害了性能”的主张——该项与零无法区分。用筛选术语来说:一个静态(单次类)计算是前沿;R ≈ 1.0;门控触发。

## 5 案例 2 — 掩码拯救弧:可遗传性 → κ-稀疏性 → 掩码标识(本文)

单个项目预注册了两个连续的外部循环押注;两者都被项目自身度量上的一个廉价基线证伪。

### 5.1 可遗传性并未拯救(κ-稀疏性结果)

预注册主张:*可遗传的*稀疏可变性

相似文章

预算受限微预训练的分阶段因子筛选

arXiv cs.LG

本文提出了一种适用于预算受限微预训练的分阶段因子筛选工作流,表明短期的设计实验能够识别稳定的超参数惩罚方向,并支持“筛选-优化”策略。

优化模型以快速进行代码生成(8分钟阅读)

TLDR AI

Morph LLC描述了三种关键技术——基于编码输出训练投机模型、在廉价GPU上自动搜索内核、以及编写自定义互连——以大幅加速像Qwen和DeepSeek这样的开放模型在编码代理工作负载上的运行,实现了最高3倍的投机解码加速,并在7000美元的GPU上达到97-162 tok/s。