基于同族架构引导的LLM驱动神经网络生成:迁移与适应的解耦

arXiv cs.LG 论文

摘要

本文提出一种源引导协议,其中LLM利用更强的同族源模型为弱目标模型生成候选修改方案,在CIFAR-10和SVHN基准测试上实现了显著的精度提升,同时解耦了迁移效应与适应效应。

arXiv:2607.05704v1 公告类型:新 摘要:大型语言模型(LLM)可以生成神经网络修改,但无限制的生成往往无效甚至有害。本文研究一个更狭窄的场景:利用神经网络数据库中更强的同族源模型来改进弱目标模型。我们提出了一种源引导的候选生成协议,包括非源控制、源条件候选以及在同等评估预算下的无LLM hp_copy消融实验。该协议将有效性验证与准确率分开报告,并仅在提升目标模型性能时选择最佳有效候选。在CIFAR-10上,最强的源引导候选达到0.5049的准确率,而最佳非源候选为0.2398,优势为+0.2651,同时将原本为0.1254的弱目标提升至该水平;五轮检查将增益保持为0.7686对比0.4839。在SVHN AlexNet上使用DeepSeek-Coder-6.7B,源引导迁移达到0.7880对比0.2254,优势为+0.5626;重新运行一次达到0.8069对比0.2509,优势为+0.5560。直接复制源配方在SVHN AlexNet上得到0.1959,与原始目标匹配,而hp_transfer达到0.7880,表明LLM是在适应而非复制源配方。家族级分析显示,AlexNet的信号最清晰,在SVHN、Imagenette和CelebA-Gender上取得6/8胜,alt_nn1在CIFAR-10上取得8/10胜。
查看原文
查看缓存全文

缓存时间: 2026/07/08 04:44

# LLM驱动的同族架构引导神经网络生成:迁移与适应的分离
来源: https://arxiv.org/html/2607.05704
Kabir Dev Paul Baghel Radu Timofte Dmitry Ignatov 计算机视觉实验室, CAIDAS, 维尔茨堡大学, 德国

###### 摘要

大型语言模型(\(LLMs\))可以生成神经网络修改,但不受限制的生成往往无效甚至有害。本文研究一个更窄的场景:利用神经网络数据库中更强的同族源模型来改进弱目标模型。我们提出了一种源引导的候选生成协议,包括非源控制、源条件候选以及无LLM的hp_copy消融基线,所有比较均在相同评估预算下进行。该协议将有效性准确率分别报告,并且仅当候选模型能改进目标时才选择最佳有效候选。在CIFAR-10上,最强的源引导候选达到0.5049准确率,而最佳非源候选为0.2398,优势为+0.2651,同时将原始准确率仅为0.1254的弱目标提升至0.7686(五轮检查,对比非源的0.4839)。在SVHN AlexNet和DeepSeek-Coder-6.7B上,源引导迁移达到0.7880,对比非源的0.2254,优势为+0.5626;另一次重复实验达到0.8069对比0.2509,优势为+0.5560。直接复制源配方在SVHN AlexNet上仅得到0.1959,与原始目标相当,而hp_transfer达到0.7880,表明LLM是在适应而非复制源配方。家族级分析显示,AlexNet的正信号最为明确,在SVHN、Imagenette和CelebA-Gender上取得6/8的胜率,而alt_nn1在CIFAR-10上取得8/10的胜率。

## 1 引言

基于LLM的神经网络生成具有吸引力,因为它直接搜索可执行的模型代码和训练配方。无需设计手工编写的搜索空间,可以要求模型提出候选修改,然后训练结果。先前在ABrain/LEMUR生态系统中的工作探索了LLM用于架构生成、提示设计、超参数调优以及带有反馈记忆的迭代NAS[11 (https://arxiv.org/html/2607.05704#bib.bib1),5 (https://arxiv.org/html/2607.05704#bib.bib14),10 (https://arxiv.org/html/2607.05704#bib.bib4),8 (https://arxiv.org/html/2607.05704#bib.bib16)]。实际失败模式很明显:不受限制的生成常常产生无效或低质量的代码。

本文提出以下科学问题:

> 给定一个弱目标模型,在相同评估预算下,更强的同族源模型是否比非源基线帮助LLM生成更好的有效候选?

这个问题之所以有用,是因为它区分了两种不同的效应。弱模型可能仅仅因为LLM改变了学习率、批量大小或变换而改进——这是非源基线效应。源引导效应仅当访问强源模型能改善结果超出非源控制时才存在。

该方法被视为一种受控的候选生成算法。有效性、最佳有效准确率和平均有效准确率分别报告,这样代码生成可靠性和模型质量就不会混为一谈。

#### 贡献。

本文做出以下贡献:

- • 定义了一个源引导的弱目标候选生成协议,包括非源控制、源条件候选以及无LLM的hp_copy消融基线。
- • 提供了两个机制——配方迁移和配方适应——的证据,并通过hp_copy分解来刻画。
- • 报告了架构家族级别的胜率,显示源引导何时可靠工作以及何时不工作。

## 2 相关工作

本工作处于神经架构搜索、超参数优化、LLM代码生成和检索条件生成的交叉点。

#### 神经架构搜索与AutoML。

经典神经架构搜索(NAS)研究如何通过搜索空间、搜索策略和评估策略来自动化网络设计[6 (https://arxiv.org/html/2607.05704#bib.bib19)]。早期工作使用强化学习控制器生成架构[26 (https://arxiv.org/html/2607.05704#bib.bib20)],后来的方法使用进化搜索[19 (https://arxiv.org/html/2607.05704#bib.bib21)]、可微松弛[16 (https://arxiv.org/html/2607.05704#bib.bib22)]和复合模型缩放[22 (https://arxiv.org/html/2607.05704#bib.bib23)]。AutoML-Zero进一步将学习算法从原始操作中进化,而不仅仅是选择架构[20 (https://arxiv.org/html/2607.05704#bib.bib24)]。NAS方法论论文也强调可重复的搜索协议和受控比较[15 (https://arxiv.org/html/2607.05704#bib.bib25)]。本文让LLM提出候选代码/动作,但通过固定候选预算、验证规则和目标/源对来保持比较的科学性。

#### 超参数优化。

超参数优化是另一个密切相关的基线,因为本研究中的许多改进来自训练配方而非架构变化。Bergstra等人研究了贝叶斯和顺序方法进行超参数搜索[2 (https://arxiv.org/html/2607.05704#bib.bib26)],Hyperband将配置选择视为自适应资源分配[13 (https://arxiv.org/html/2607.05704#bib.bib27)],Optuna提供了实用的按需定义优化框架[1 (https://arxiv.org/html/2607.05704#bib.bib28)]。本文中的hp_default和hp_transfer分支可视为在相同黑箱HPO精神下评估的LLM生成超参数/变换候选。

#### LLM用于代码生成与修复。

基于代码训练的大型语言模型,如Codex,已经证明LLM可以从自然语言规范合成可执行的Python代码[4 (https://arxiv.org/html/2607.05704#bib.bib29)]。AlphaCode表明大规模采样加过滤可以解决编程竞赛任务[14 (https://arxiv.org/html/2607.05704#bib.bib30)]。自我细化及基于代理的反馈方法(如Self-Refine和Reflexion)表明,当模型输出被评估并反馈到后续尝试时,生成质量可以提高[17 (https://arxiv.org/html/2607.05704#bib.bib31),21 (https://arxiv.org/html/2607.05704#bib.bib32)]。本文使用相同的广义生成-验证思想,但验证目标是神经网络训练/评估,而非单元测试或编程竞赛输出。

#### 检索、提示与源条件。

少样本提示表明上下文中的示例可以在不更新参数的情况下引导LLM行为[3 (https://arxiv.org/html/2607.05704#bib.bib33)]。检索增强生成向提示添加非参数证据,使得生成可以依赖外部文档或记忆[12 (https://arxiv.org/html/2607.05704#bib.bib34)]。ReAct将语言模型推理与针对外部环境的动作结合起来[25 (https://arxiv.org/html/2607.05704#bib.bib35)]。本文的源引导设置是一个专门的检索问题,其中检索到的项是一个更强的神经网络,包含代码、变换、超参数和测量准确率。

#### LLM作为优化器与基于LLM的NAS。

最近的工作将LLM视为优化循环的组件。OPRO使用LLM从包含先前候选和分数的提示中提出候选解决方案[24 (https://arxiv.org/html/2607.05704#bib.bib36)]。EvoPrompt将LLM与进化算法连接用于离散提示优化[9 (https://arxiv.org/html/2607.05704#bib.bib37)]。LLMatic将LLM代码生成与质量多样性优化结合用于NAS[18 (https://arxiv.org/html/2607.05704#bib.bib38)]。这些系统与本文的精神最为接近。区别在于本文研究一个更窄的弱目标迁移问题:给定一个弱模型和一个更强的同族源模型,源条件候选生成是否产生与非源控制不同的结果?

#### ABrain/LEMUR背景。

实现直接建立在LLM基神经网络合成NNGPT[11 (https://arxiv.org/html/2607.05704#bib.bib1)]、基于提示的架构生成[5 (https://arxiv.org/html/2607.05704#bib.bib14)]、LLM基超参数调优[10 (https://arxiv.org/html/2607.05704#bib.bib4)]以及带反馈记忆的资源高效迭代NAS[8 (https://arxiv.org/html/2607.05704#bib.bib16)]之上。它还使用LEMUR神经网络数据集和元数据作为现有架构、训练配方和测量准确率的来源[7 (https://arxiv.org/html/2607.05704#bib.bib5),23 (https://arxiv.org/html/2607.05704#bib.bib6)]。与全代码生成相比,本工作将生成限制在受控合约内:超参数、变换代码、结构化JSON编辑或源引导的超参数/变换迁移。这使得有效性、修复策略和源引导优势更容易测量。

## 3 方法

### 3.1 问题设置

对于数据集DD,令TT为弱目标神经网络,测量准确率为a\(T\)a\(T\),令SS为更强的同族源模型,准确率为a\(S\)\>a\(T\)a\(S\)\>a\(T\)。每个模型包括Python架构代码、变换和超参数。目标是生成一个或多个候选T1′,...,Tn′T^\{\\prime\}\_\{1\},\\ldots,T^\{\\prime\}\_\{n\}并选择

T∗=arg⁡maxTi′∈V⁡a\(Ti′\),T^\{\*\}=\\arg\\max\_\{T^\{\\prime\}\_\{i\}\\in\\mathcal\{V\}\}a\(T^\{\\prime\}\_\{i\}\),\(1\)其中V\\mathcal\{V\}是能够解析、满足预期API、成功训练/评估并产生有效准确率的候选集。仅当a\(T∗\)\>a\(T\)a\(T^\{\*\}\)\>a\(T\)时,目标才得到改进。

目标/源配对有意采用弱到强的设置。实验测试一个高性能同族模型是否包含可迁移的证据,有助于修复或改进同一族的弱成员。

### 3.2 检索

当前实验中使用的检索规则简单且确定:对于弱目标族,从LEMUR数据库中选择一个更强的同族模型。这产生诸如弱AlexNet到强AlexNet、弱DarkNet到强DarkNet、或弱alt_nn1到强alt_nn1¹的模式。这种同族限制很重要,因为它在不需要LLM跨无关架构进行转换的情况下使源模型具有相关性。

¹在CIFAR-10实验中使用的alt_nn1族包含AlexNet风格的自定义CNN(5个Conv2d层、3个Linear层、SGD训练);archbest源保留了这种风格,而highsource源可能是结构不同的同族成员,如残差瓶颈网络。

### 3.3 候选动作空间

本文的总括术语是“候选生成”。每个LLM输出是一个候选动作,在相同预算下进行训练和评估。报告的协议使用四个分支:两个非源控制和两个源条件分支。这使算法足够简单以便复现,同时仍能测试检索到的源是否增加价值。

| 分支 | 源 | LLM | 架构 | 配方 |
|------|-----|-----|------|------|
| hp_default | 否 | 是 | 固定 | 改变 |
| baseline_edit | 否 | 是 | 改变 | 可选 |
| hp_transfer | 是 | 是 | 固定 | 改变 |
| analogical_edit | 是 | 是 | 改变 | 可选 |

表1:主实验中使用的固定四臂候选生成协议。“配方”指超参数和输入变换。表1 (https://arxiv.org/html/2607.05704#S3.T1)定义了主实验中使用的动作空间。四个分支是:

- •hp_default:仅使用目标的非源超参数/变换控制。
- •baseline_edit:仅使用目标的非源结构化编辑。
- •hp_transfer:将源超参数和变换迁移到目标上的源引导迁移。
- •analogical_edit:源条件结构化架构编辑。

在hp_transfer中,目标架构保持不变。提示中暴露源训练配方,并请求LLM使用与hp_default相同的输出合约生成目标候选配方。允许改变的字段包括学习率、动量、批量大小、支持的丢弃率以及输入变换。验证仅应用确定的兼容性修复,例如删除训练器不支持的超参数键,或用该数据集的标准变换替换无效变换。它从不将源架构复制到目标中,也从不使用测量准确率来重写或选择候选。

早期的筛选运行包括全代码生成、增量补丁、固定模板、安全/冒险的源条件编辑以及更宽的汇集模板。这些运行排除在主比较之外;表2 (https://arxiv.org/html/2607.05704#S3.T2)中的代表性筛选说明了表1 (https://arxiv.org/html/2607.05704#S3.T1)中使用的受约束动作格式的动机。

| 表示形式 | 有效 | 最佳准确率 | 作用 |
|----------|------|------------|------|
| 全代码 | 0/16 | – | 过于脆弱 |
| 增量补丁 | 14/16 | 0.5557 | 可评估但较弱 |
| 结构化编辑 | 16/16 | 0.6282 | 冻结协议基础 |

表2:历史CIFAR-10表示形式筛选。这些运行未平均到主要结果中;它们证明了从无约束的全代码生成转向受约束的编辑/动作空间是合理的。

### 3.4 验证与最小修复

主要结果使用最小确定性验证。非源和源引导分支都接受相同的清理:模式解析、删除不支持的超参数键以及数据集兼容变换保护。更广泛的语义修复、后备候选和基于准确率的重写被排除在报告的主比较之外。

### 3.5 算法

算法可以表述如下:

1. 1. 在数据集DD上选择一个弱目标模型TT。
2. 2. 检索最强或高性能的同族源模型SS。
3. 3. 生成非源基线候选,不向LLM暴露SS。
4. 4. 生成源引导候选,向LLM暴露SS及其训练配方。
5. 5. 在相同预算下训练并评估所有候选。
6. 6. 报告有效生成/评估率、最佳有效准确率、相对于原始目标的增益、以及相对于最佳非源候选的源引导优势。
7. 7. 选择最终模型时,仅当最佳候选优于原始目标时才接受;否则保留TT。

## 4 实验设置

### 4.1 指标

评估报告互补指标,而不是将每次运行压缩为一个分数:

- •有效评估计数:实际训练/评估的候选分支数量;
- •最佳有效准确率:某个组找到的最强已评估候选;
- •平均有效准确率:已评估候选的平均质量;
- •相对于原始的增益:最佳有效准确率减去目标准确率;
- •源引导优势:最佳源引导准确率减去最佳非源准确率,连同平均差异一并报告(如可用);
- •失败模式:失败是由于无输出、提取失败、无效架构、形状不匹配还是训练超时。

### 4.2 统计分析

准确率比较的统计单元是数据集–LLM–目标对。例如,使用DeepSeek-Coder-6.7B在SVHN上的AlexNet目标是一个对。仅当比较双方都至少有一个有效评估候选(一个或多个非源候选以及一个或多个源引导候选)时,该对才称为可比较。这防止无效生成被静默地视为低准确率模型,同时仍单独报告有效性。

对于有效生成率和有效评估率,我们报告95% Wilson置信区间。这是因为有效性是二进

相似文章

学习,快与慢:走向持续适应的LLMs

Hugging Face Daily Papers

一种针对LLMs的快慢学习框架,将固定的慢权重与优化的快上下文权重相结合,在持续学习场景中实现了高达3倍的样本效率提升,并减少了灾难性遗忘。