LEMUR 2:为AI解锁神经网络多样性

arXiv cs.LG 论文

摘要

LEMUR 2引入了一个大规模数据集,包含超过14,000种神经网络架构和750,000条训练记录,涵盖多模态任务,支持NAS、AutoML和部署分析。

arXiv:2607.06839v1 公告类型:新 摘要:现有的NAS基准测试(如NAS-Bench、NATS-Bench)仅覆盖了架构设计空间中狭窄、特定任务的区域,且缺乏跨领域或部署感知的评估。LEMUR 2引入了一个大规模、可扩展的框架,统一了生成、评估和部署流程,以解锁神经网络的多样性。它包含超过14,000种不同架构和750,000多条结构化训练记录,记录了模型性能、超参数和任务结果。这些模型通过基于AST的代码变异、遗传和强化学习演化、分形架构的生成以及大型语言模型(LLM)引导的合成产生。其中包括使用检索增强系统NN-RAG生成的深度模型,该系统从公共代码库中提取的900多个PyTorch模块中推导并使用了架构模式。LEMUR 2还采用NN-VR和NN-Lite流程,在异构移动和基于Unity的VR平台上进行自动部署和延迟基准测试,提供真实设备性能元数据。它涵盖多模态任务、图像描述、文本到图像合成和语言建模,支持架构可迁移性的跨领域分析。通过连接多样化的架构、任务和部署数据,LEMUR 2为LLM微调以及将不同架构起源与大规模、跨平台实证验证相结合提供了数据基础。该数据集为可重复、数据驱动的人工智能设计奠定了基础,推动了LLM驱动的AutoML和跨模态、跨硬件架构通用化的新兴范式。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:45

# LEMUR 2:解锁神经网络多样性以推动人工智能
来源:https://arxiv.org/html/2607.06839
Tolgay Atinc Uzun∗,Waleed Khalid,Saif U Din,Sai Revanth Mulukuledu,Akashdeep Singh,Chandini Vysyaraju,Raghuvir Duvvuri,Avi Goyal,Yashkumar Rajeshbhai Lukhi,Muhammad A\. Hussain,Krunal Jesani,Usha Shrestha,Yash Mittal,Roman Kochnev,Pritam Kadam,Mohsin Ikram,Harsh R\. Moradiya,Alice Arslanian,Dmitry Ignatov†,Radu Timofte
计算机视觉教席,维尔茨堡大学,德国
∗t\.atincuzun@gmail\.com,†dmytro\.ignatov@uni\-wuerzburg\.de
https://github.com/ABrain-One/NN-Dataset

###### 摘要

现有的NAS基准(例如NAS-Bench、NATS-Bench)仅覆盖架构设计空间中狭窄的、特定任务的区域,缺乏跨域或部署感知的评估。LEMUR 2引入了一个大规模、可扩展的框架,统一了生成、评估和部署流程,以解锁神经网络的多样性。它包含超过14,000种不同的架构和超过750,000条结构化训练记录,记录了模型性能、超参数和任务结果。这些模型是通过基于AST的代码变异、遗传算法和强化学习进化、分形架构生成以及由大语言模型(LLM)引导的合成产生的。这包括使用检索增强系统NN-RAG生成的深度模型,该系统从公共仓库中提取的900多个PyTorch模块中推导并使用架构模式。LEMUR 2还采用NN-VR和NN-Lite流水线,用于在异构移动设备和基于Unity的VR平台上进行自动部署和延迟基准测试,提供真实设备性能元数据。它涵盖多模态任务——图像描述、文本到图像合成和语言建模——支持架构可迁移性的跨域分析。通过连接多样化的架构、任务和部署数据,LEMUR 2为LLM微调以及将多样的架构起源与大规模、跨平台实证验证相结合提供了数据基础。该数据集为可重现和数据驱动的人工智能设计定义了新的基础,推动了LLM驱动的AutoML和跨模态与硬件的架构泛化这一新兴范式。

## 1引言

神经网络支撑着人工智能领域的众多突破,在计算机视觉和自然语言处理等领域取得了最先进的结果。然而,其日益增长的复杂性暴露了手工设计的局限性。为此,该领域正在转向一种以创建和利用大规模、可重用的神经网络模型集合为中心的新范式。这一转变的目标是用数据驱动的发现取代手工直觉,使研究人员能够从多样的模型语料库中识别潜在模式、结构规律性和可泛化的设计原则。此类以模型为中心的数据集现已成为基准测试、神经网络架构分析、元学习和自动机器学习的关键资源。

大多数公开可用的神经网络仓库都围绕单一的构建范式构建,通常是对固定的基于单元的搜索空间进行穷举或近乎穷举的枚举。这导致了方法上同构的集合,仅覆盖架构设计空间的狭窄区域,并且不易扩展到通过其他方式获得的模型。同时,这些仓库很少提供从架构规范到任务级评估和设备级部署的端到端路径,使得研究精度-延迟权衡或跨模态复用模型变得困难。

我们提出了多种策略,基于LEMUR[15 (https://arxiv.org/html/2607.06839#bib.bib17)]数据集及其配套流水线,以提高架构多样性和操作集成。为了生成更多模型,我们采用了程序化编辑、强化学习、基于进化的搜索、分形构建、检索增强块提取和LLM驱动的合成。在部署方面,我们提供NN-Lite和NN-VR,用于在资源受限的目标上,在共享协议下跨多个任务进行基准测试、测试和验证。统计数据可在项目仓库111GitHub仓库:https://github.com/ABrain-One/nn-dataset中找到。

### 1.1相关工作

在神经网络研究中,数据集是训练、评估和基准测试的支柱。图像、文本和特定领域语料库中存在大量数据集[31 (https://arxiv.org/html/2607.06839#bib.bib19)],提供大规模、有标签的数据集合。相比之下,系统捕获神经网络本身的结构、配置和由此产生的性能的资源则要少得多。

模型数据集最接近的工作来自神经架构搜索(NAS)社区。诸如NAS-Bench-101[50 (https://arxiv.org/html/2607.06839#bib.bib27)]及其扩展NAS-Bench-201[8 (https://arxiv.org/html/2607.06839#bib.bib26)]等基准,枚举了固定的小型卷积单元搜索空间,并存储了它们的训练和评估结果,以实现NAS算法的可重现比较。NATS-Bench[7 (https://arxiv.org/html/2607.06839#bib.bib25)]将此思想泛化到跨多个数据集的拓扑和大小空间,而TransNAS-Bench-101[9 (https://arxiv.org/html/2607.06839#bib.bib28)]将其扩展到多个视觉风格任务以研究可迁移性。NAS-Bench-NLP[24 (https://arxiv.org/html/2607.06839#bib.bib29)]超越了视觉,进入语言模型领域,HW-NAS-Bench[29 (https://arxiv.org/html/2607.06839#bib.bib30)]添加了硬件和延迟测量,JAHS-Bench-201[2 (https://arxiv.org/html/2607.06839#bib.bib31)]将架构与超参数结合起来进行联合优化。

AutoML框架与模型仓库AutoML框架如AutoKeras[22 (https://arxiv.org/html/2607.06839#bib.bib59)]和TPOT[34 (https://arxiv.org/html/2607.06839#bib.bib60)]提供了用于自动模型选择和超参数优化的工具,但不维护具有性能元数据的大规模、精选架构仓库。类似地,TensorFlow Hub[16 (https://arxiv.org/html/2607.06839#bib.bib63)]和PyTorch Hub[37 (https://arxiv.org/html/2607.06839#bib.bib64)]等模型动物园提供预训练模型,但缺乏跨任务和硬件的标准化评估,并且不支持系统性的架构生成或多样性分析。

### 1.2我们的贡献

本文介绍LEMUR 2,它是原始LEMUR[15 (https://arxiv.org/html/2607.06839#bib.bib17)]框架的扩展。LEMUR作为现有神经网络及其相关统计数据的仓库,受近期LLM在各领域应用进展的启发[25 (https://arxiv.org/html/2607.06839#bib.bib14),14 (https://arxiv.org/html/2607.06839#bib.bib61),43 (https://arxiv.org/html/2607.06839#bib.bib62)],LEMUR 2旨在包含利用现有数据自动创建新网络架构的生成系统[11 (https://arxiv.org/html/2607.06839#bib.bib15)],以及在边缘设备上进行测试[6 (https://arxiv.org/html/2607.06839#bib.bib16)]和在不同平台上部署的评估工具。

首先,使用几种不同的自动生成方法,数据集扩展到超过14,000个模型。这些方法包括遗传算法、基于强化学习的层掩码用于网络变异、模型源代码的抽象语法树(AST)编辑,以及基于分形的生成。为了促进动态收集,我们引入了NN-RAG,一个检索增强系统,从外部代码库中提取经过验证的、自包含的PyTorch[36 (https://arxiv.org/html/2607.06839#bib.bib13)]模块,创建一个包含900多个可重用组件的库。数据集还通过6,000个数据转换流水线的系统评估元数据得到了丰富,为最优数据预处理提供了指导。通过包含额外任务,如图像描述、文本到文本和文本到图像合成,展示了该框架的适用性。

其次,为了将理论指标与实际性能联系起来,我们添加了部署感知的元数据。我们构建了NN-Lite,一个自动流水线,用于在Android平台上转换、部署和基准测试PyTorch模型。该系统处理了超过7,500个模型,用它们的设备端推理延迟填充LEMUR 2数据库,这些实证测量在标准基准中常常缺失。通过NN-VR系统,我们将此部署分析扩展到沉浸式应用,该系统用于在Unity引擎中针对虚拟现实上下文自动转换和性能评估模型。

总的来说,这些贡献使LEMUR 2成为一项公共研究资源。它提供了一个大规模架构语料库、一套生成方法和多平台部署基准,支持自动化AI设计的研究。LEMUR数据集的实证价值,正如NNGPT项目所示,已得到证明,它成功应用于LLM引导的生成式合成、探索复杂架构结构,以及在多个计算机视觉任务中改善泛化能力[25 (https://arxiv.org/html/2607.06839#bib.bib14),13 (https://arxiv.org/html/2607.06839#bib.bib67),33 (https://arxiv.org/html/2607.06839#bib.bib20),45 (https://arxiv.org/html/2607.06839#bib.bib66),21 (https://arxiv.org/html/2607.06839#bib.bib68),48 (https://arxiv.org/html/2607.06839#bib.bib69),47 (https://arxiv.org/html/2607.06839#bib.bib70),17 (https://arxiv.org/html/2607.06839#bib.bib77)]。

表1:主要NAS基准的比较。#条目 表示基准发布的独特可查询模型规格数量(架构,或架构+超参数配置),每个都存储了训练或预测的指标。多任务 表示基准领域内是否包含多个数据集和/或多个任务。能力基准领域搜索空间#条目数据集任务评估多任务NAS-Bench-101[50 (https://arxiv.org/html/2607.06839#bib.bib27)]视觉单元表格423,624CIFAR-10图像分类训练否NAS-Bench-201[8 (https://arxiv.org/html/2607.06839#bib.bib26)]视觉单元表格15,625CIFAR-10, CIFAR-100, ImageNet16-120图像分类训练是NAS-Bench-301[46 (https://arxiv.org/html/2607.06839#bib.bib71)]视觉单元代理 (DARTS)约 60,000CIFAR-10图像分类预测否NATS-Bench[7 (https://arxiv.org/html/2607.06839#bib.bib25)]视觉拓扑+大小表格48,393CIFAR-10, CIFAR-100, ImageNet16-120图像分类训练是TransNAS-Bench[9 (https://arxiv.org/html/2607.06839#bib.bib28)]视觉单元+宏观表格7,352Taskonomy (子集)7个视觉任务训练是NAS-Bench-NLP[24 (https://arxiv.org/html/2607.06839#bib.bib29)]NLPRNN表格14,322PTB; WikiText-2 (子集)语言建模训练是NAS-Bench-Graph[38 (https://arxiv.org/html/2607.06839#bib.bib73)]图GNN表格26,206Cora, CiteSeer, PubMed
Coauthor-CS/Physics, Amazon-Photo/Computers
ogbn-arxiv, ogbn-proteins节点分类训练是NAS-Bench-ASR[32 (https://arxiv.org/html/2607.06839#bib.bib74)]音频ASR单元表格8,242TIMIT语音识别训否HW-NAS-Bench[29 (https://arxiv.org/html/2607.06839#bib.bib30)]硬件NB201 + FBNet (HW)15,625CIFAR-10, CIFAR-100, ImageNet16-120硬件成本 (延迟+能耗; 6种设备)训练+实测是NAS-Bench-1Shot1[51 (https://arxiv.org/html/2607.06839#bib.bib75)]方法单次表格子集399,048CIFAR-10图像分类训练否JAHS-Bench-201[2 (https://arxiv.org/html/2607.06839#bib.bib31)]HPO架构+超参数代理270,000CIFAR-10, Fashion-MNIST, Colorectal Histology图像分类+ HPO预测是LEMUR 2 (本文)通用开放代码 (LLM) > 14,000多个 (用户定义)多域训练是

标准视觉 (表格)NAS-Bench-101NAS-Bench-201NATS-Bench新领域&任务TransNAS-BenchNB-Video, NB-NLPNB-Graph, NB-ASR代理 &连续空间NAS-Bench-301JAHS-Bench-201硬件感知约束HW-NAS-Bench (延迟/边缘)方法&保真度NB-1Shot1NAS-Bench-ZeroLEMUR 2
图1:按主要区分维度组织的NAS基准分类。LEMUR 2 位于交叉点,提供了一个统一的生成框架,涵盖表格评估、方法抽象、代理建模、硬件感知和多域任务。

## 2方法论

我们将LEMUR[15 (https://arxiv.org/html/2607.06839#bib.bib17)]语料库扩展为一个模块化生成和集成框架,构建在原始实验管理器之上,用于任务执行和结果持久化。语料库访问和下游处理使用data接口,该接口将存储的记录作为固定模式的pandas DataFrame暴露出来,用于跨任务、数据集、指标、架构、轮次、精度、运行时间、参数计数和转换标识符进行统一过滤和聚合,而无需直接进行数据库查询。在此层上,自包含扩展模块生成候选模型定义或转换程序及其元数据,并将其提交给标准的LEMUR流水线进行评估。这些模块将基于LLM的自然语言引导生成与程序化生成器结合起来,后者能够更快、成本更低地产生有效变体,从而在共享报告格式下实现可扩展的异构扩展。

LEMUR 2的架构多样性来自于组合异构生成器和来源,因此语料库不集中在单一骨干家族上。对于通过对种子架构进行变异来操作的生成器,我们将其实例化到生成器支持的轻量级参考模板上,以实现高通量评估和对操作符效应的受控归因,同时仍然产生许多结构不同的变体。

### 2.1任务扩展

#### 2.1.1图像描述

NN-Caption是一个基于LEMUR构建的自动图像描述流水线,其中LLM以基线ResNet-LSTM描述器和LEMURNet接口(__init__,train_setup,learn,forward)的代码模板进行迭代提示,生成PyTorch编码器-解码器架构,该架构将卷积图像编码器与序列解码器(LSTM,GRU[5 (https://arxiv.org/html/2607.06839#bib.bib38)],Transformer)耦合。生成的代码被规范化,通过Python的抽象语法树验证,集成到LEMUR中,编译并在MS COCO[31 (https://arxiv.org/html/2607.06839#bib.bib19)]上进行训练,使用BLEU-4[35 (https://arxiv.org/html/2607.06839#bib.bib32)]评估描述质量;总的来说,NN-Caption为LEMUR 2贡献了357个描述架构。

#### 2.1.2文本到图像

LEMUR包含一个文本到图像流水线,涵盖三个生成族:扩散模型(UNet-D)[41 (https://arxiv.org/html/2607.06839#bib.bib21),18 (https://arxiv.org/html/2607.06839#bib.bib24),42 (https://arxiv.org/html/2607.06839#bib.bib39)],GAN[52 (https://arxiv.org/html/2607.06839#bib.bib22)],和CVAE-GAN[23 (https://arxiv.org/html/2607.06839#bib.bib23)],所有模型都在统一的训练和评估框架中以自然语言文本为条件。对于扩散模型,预训练的CLIP文本编码器[39 (https://arxiv.org/html/2607.06839#bib.bib42)]]提供嵌入,与时间步嵌入融合,并注入具有残差和注意力块的多尺度U-Net编码器-解码器,通过去噪扩散目标进行优化。GAN使用一个生成器,将文本表示与共

相似文章

LiquidAI/LFM2.5-VL-3B · Hugging Face

Reddit r/LocalLLaMA

LiquidAI releases LFM2.5-VL-3B, a 3B multimodal model for on-device deployment with improved OCR, grounding, and efficient inference, available in multiple formats including GGUF, ONNX, and MLX.

LiquidAI/LFM2.5-ColBERT-350M

Hugging Face Models Trending

LiquidAI 发布 LFM2.5-ColBERT-350M,这是一种后期交互多语言检索模型,同时还有一个密集双编码器变体,两者均基于 LFM2.5-350M-Base,支持 11 种语言,并设计为 RAG 管道的即插即用替代品。

LiquidAI/LFM2.5-Embedding-350M

Hugging Face Models Trending

Liquid AI 发布了 LFM2.5-Embedding-350M,这是一种密集双编码器,用于多语言检索,支持11种语言,可作为 RAG 流水线的直接替代方案。