代理式神经架构发现:AIRA-Compose与AIRA-Design
摘要
本文介绍了AIRA-Compose和AIRA-Design,这两个双重框架利用AI智能体自主发现超越标准Transformer且高效扩展的神经架构。
查看缓存全文
缓存时间: 2026/05/18 02:23
论文页面 - 神经架构的代理式发现:AIRA-Compose 与 AIRA-Design
来源:https://huggingface.co/papers/2605.15871
摘要
AI 智能体通过双重框架自主设计超越标准 Transformer 的基础模型,该框架同时优化架构搜索与机制实现,取得了卓越的性能与效率。
面向递归式自我改进,我们研究如何让 LLM 智能体(https://huggingface.co/papers?q=LLM%20agents)自主设计超越标准 Transformer 的基础模型(https://huggingface.co/papers?q=foundation%20models)。我们提出了一种双重框架方法:AIRA-Compose(https://huggingface.co/papers?q=AIRA-Compose)用于高层架构搜索(https://huggingface.co/papers?q=architecture%20search),AIRA-Design(https://huggingface.co/papers?q=AIRA-Design)用于低层机制实现(https://huggingface.co/papers?q=mechanistic%20implementation)。AIRA-Compose(https://huggingface.co/papers?q=AIRA-Compose)使用 11 个智能体在 24 小时预算内探索基本计算原语。这些智能体评估百万参数级别的候选方案,并将最优设计外推至 350M、1B 和 3B 规模。由此产生两个家族的 14 种架构:AIRAformer(基于 Transformer(https://huggingface.co/papers?q=Transformer-based))和 AIRAhybrid(Transformer-Mamba(https://huggingface.co/papers?q=Transformer-Mamba)混合)。在 1B 规模下预训练后,这些架构持续优于 Llama 3.2 和 Composer 寻找的基线模型。在下游任务(https://huggingface.co/papers?q=downstream%20tasks)中,AIRAformer-D 和 AIRAhybrid-D 相比 Llama 3.2 准确率分别提升 2.4% 和 3.8%。此外,AIRA-Compose(https://huggingface.co/papers?q=AIRA-Compose)找到了具有高效扩展前沿(https://huggingface.co/papers?q=scaling%20frontiers)的模型:AIRAformer-C 的扩展速度比 Llama 3.2 和 Composer 的最佳 Transformer 分别快 54% 和 71%,而 AIRAhybrid-C 比 Nemotron-2 快 23%,比 Composer 的最佳混合架构快 37%。AIRA-Design(https://huggingface.co/papers?q=AIRA-Design)则让 20 个智能体编写新颖的注意力机制(https://huggingface.co/papers?q=attention%20mechanisms)以应对长距离依赖,并编写高性能的训练脚本。在 Long Range Arena(https://huggingface.co/papers?q=Long%20Range%20Arena)基准测试中,智能体设计的架构在文档匹配和文本分类任务上分别达到了人类最先进水平的 2.3% 和 2.6% 以内。在 Autoresearch(https://huggingface.co/papers?q=Autoresearch)基准上,Greedy Opus 4.5 在固定时间预算下实现了 0.968 的验证集每字节比特数(https://huggingface.co/papers?q=bits-per-byte),超越了已发表的最小值。综合来看,这些框架表明 AI 智能体能够自主发现架构和算法优化,达到或超越手工设计的基线。这为发现下一代基础模型(https://huggingface.co/papers?q=foundation%20models)建立了一个强大的范式,标志着向递归式自我改进迈出了清晰的一步。
查看 arXiv 页面(https://arxiv.org/abs/2605.15871)查看 PDF(https://arxiv.org/pdf/2605.15871)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.15871)
在您的智能体中获取此论文:
hf papers read 2605\.15871
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接到此论文
请在模型的 README.md 中引用 arxiv.org/abs/2605.15871 以在此页面建立链接。
引用此论文的数据集0
没有数据集链接到此论文
请在数据集的 README.md 中引用 arxiv.org/abs/2605.15871 以在此页面建立链接。
引用此论文的 Space0
没有 Space 链接到此论文
请在 Space 的 README.md 中引用 arxiv.org/abs/2605.15871 以在此页面建立链接。
包含此论文的收藏集0
没有收藏集包含此论文
请将此论文添加到一个收藏集(https://huggingface.co/new-collection)中以在此页面建立链接。
相似文章
@dair_ai: Meta的新论文:Agentic Discovery of Neural Architectures。这是一个热门的新研究领域!请密切关注。
Meta的新论文介绍了一个智能体系统,它能在24小时的计算预算内自主发现神经架构,在350M、1B和3B规模上超越Llama 3.2。
用于自动神经算子发现的智能体AI科学社区
本文提出了一种由虚拟实验室组成的智能体AI科学社区,能够自主发现用于偏微分方程问题的神经算子架构。通过引用经济体系下的LLM规划器、数值工作者和评审者,该系统生成了高精度的混合架构,结果表明算子家族之间不存在普遍优胜者。
智能体神经架构搜索
介绍AgentNAS,一种利用大语言模型(LLM)生成初始架构并将其分解为槽位架构的机制,从而为传统神经架构搜索(NAS)定义任务特定的搜索空间,在17项任务中的11项上取得了最先进的结果。
两种不同规模的智能体AI:Nanbeige4.2-3B与Laguna S2.1(9分钟阅读)
比较了两个用于智能体工作负载的新AI模型:采用循环Transformer架构的紧凑型Nanbeige4.2-3B,以及大型混合专家模型Laguna S2.1,两者均在Hugging Face上发布。
@dair_ai: Very cool idea to have agents design complex systems by searching over the model structure itself. New research from Sa…
A tweet from DAIR AI highlights new research by Sakana AI introducing CEDAR, an LLM-agent method that designs, simulates, and refines complex system-dynamics models via Monte Carlo Tree Search over feedback structures, aiming to automate goal-directed design in artificial life.