神经进化竞技场:跨神经架构的更新与继承机制嵌套生态评估
摘要
这篇预印本介绍了Neuroevolution Arena,一个GPU加速的人工生命平台,通过嵌套生态评估协议,比较跨神经架构的进化与基于强化学习的更新机制。
arXiv:2608.10323v1 公告类型:新
摘要:竞争性人工生命系统在训练和生态评估下可能对训练好的控制器进行不同排序。我们提出了Neuroevolution Arena,一个GPU加速的空间生态学系统,由独立参数化的神经网络单元组成,并采用带审计追踪的嵌套评估协议。三种特定于实现的更新与继承机制(EvoEvo、EvoRL和RLRL)与两种神经架构交叉,每种条件下进行三次独立训练运行,共50,000代。18次运行中每次保存的一个精英控制器工件进入对齐运行的冻结评估设计,包含198个计算任务。成对效应在每个对齐训练运行块内平均了三个种子定义的生态情境(两个允许合作,一个允许攻击);独立水平保持为每种条件n = 3次运行。启用RL的机制在训练适应度记录上高于EvoEvo,而成对结果表明架构条件性的多数模式以及显著的工件依赖性。六路胜者因工件和情境而异,预指定的生存终点完全触底。我们贡献了一个嵌套协议,将训练运行工件与评估情境分开,并暴露而非掩盖它们的不同变异来源。
查看缓存全文
缓存时间: 2026/08/12 08:22
# 神经进化竞技场:跨神经架构的更新-继承体制的嵌套生态评估 来源:https://arxiv.org/html/2608.10323 ###### 摘要 竞争性人工生命系统在训练评估与生态评估下可能对受训控制器给出不同排名。我们提出 Neuroevolution Arena——一个由独立参数化神经网络细胞构成的 GPU 加速空间生态,以及一套带审计追踪的嵌套评估协议。三种实现特定的“更新-继承”体制——EvoEvo、EvoRL 与 RLRL——与两种神经架构交叉,在每种条件下进行三次独立训练运行,共经历 50,000 代。来自 18 次运行中的每一次均保存一个精英控制器工件,进入一个对齐运行冻结评估设计,共包含 198 个计算任务。配对效应在每次对齐训练运行块内平均了三个由种子定义的生态情境——两个允许合作、一个允许攻击;独立层级保持为每种条件 n = 3 次运行。启用 RL 的体制在记录的训练适应度上高于 EvoEvo,而配对结果则显示出由架构条件调节的多数模式以及显著的工件依赖性。六方胜者随工件和情境而变化,预指定的存活终点则完全触底。我们贡献了一套嵌套协议,将训练运行工件与评估情境分离,并暴露而非掩盖它们不同的变异来源。 预印本。本手稿尚未经过期刊同行评审。 关键词:人工生命;神经进化;强化学习;竞争生态;神经架构;评估方法论 ## 1 引言 生物进化会跨世代改变继承的结构,而终生学习则会在个体生命期内改变行为。Baldwin(1896)提出可塑性可以改变选择,Hinton 和 Nowlan(1987)则建模了一条计算路径,说明学习可以引导进化。这种关系促使我们将继承的和终生更新的神经组件放在一起研究,而不假设每种规定的组合都会实现鲍德温效应。在人工系统中,神经架构搜索通常是在固定基准上优化拓扑,强化学习(RL)在选定架构内优化策略,而神经进化则搜索继承的控制器。它们的效果通常被分开报告。我们转而提出的问题是:在共享人工生态中,性能排名是否随网络架构和实现特定的更新-继承体制(以下简称体制)共同变化?这个问题在竞争性生态设置中尤为重要,因为即使细胞网络权重固定不变,评估也是内生的。成功体现在诸如配对种群持久性、多方共存或排斥、以及种群崩溃后的恢复等结果中。在冻结评估期间,策略不会学习或进化,但种群组成、空间接触、繁殖和资源压力会继续变化,作为这些固定权重的后果。因此,基准优势并不必然意味着生态鲁棒性。比赛结构、保存的训练运行工件以及种子定义的生态情境都可能影响哪种策略看起来最强。这促使我们设计一种评估方案,覆盖所有可用的训练运行,将配对问题与多方问题分开,并保留情境重复在受训模型内的嵌套关系。 为研究这一问题,我们提出 Neuroevolution Arena——一个 GPU 加速的人工生命平台,其中多达 10,000 个细胞在环形网格上竞争,每个细胞配备一个独立的神经网络。与标准神经细胞自动机(NCA)(Mordvintsev 等,2020)不同,后者所有细胞共享单一的学习更新规则,我们的系统支持异质种群:细胞在网络架构以及应用于 W1 和 W2 的更新-继承规则上可能不同。EvoEvo 对两个层组都应用进化交叉和变异;EvoRL 将 W1 进化与 W2 上的终生 RL 结合;RLRL 则对两者都应用终生 RL,同时保留繁殖继承和选择。我们训练了一个重复的 3×2 体制-架构因子设计,并通过审计追踪的冻结竞争评估每个训练运行中保存的一个运行级控制器工件。配对效应在“对齐运行”设计中根据种群曲线下面积(AUC)进行估计:具有相同运行索引的工件相互竞争,三个种子定义的生态情境嵌套在该块内。六方和存活协议探测互补的生态属性,而不会合并为单一评分。 我们提出两个问题。 RQ1:在所测试系统中,体制和架构如何与记录的训练适应度和冻结生态结果联合关联? RQ2:这些结果如何随保存的训练运行工件、对手集合和种子定义的生态情境而变化? 本研究的贡献是方法论和实证层面的:该研究区分了独立训练重复与对保存工件的重复评估,将不解决的主要终点作为零结果报告,并识别出架构条件化的模式,而不会将任何条件推崇为普遍赢家。一个单独的、不匹配的训练时程数据集仅作为探索性附录保留,不回答任何一个主要研究问题。 ## 2 相关工作 本节处于四条研究脉络的交汇处:神经细胞自动机、神经进化、鲍德温效应和神经架构评估。我们依次回顾每一条脉络,重点关注推动本研究的概念背景和开放问题。 ### 2.1 神经细胞自动机 神经细胞自动机(NCA)用学习到的神经网络更新函数取代手工设计的细胞自动机规则(Langton, 1986)。Mordvintsev 等人(2020)证明,一个小型卷积网络可以学习局部更新规则,从单个种子细胞产生自组织、自修复的形态发生。这是一个有影响力的结果,表明复杂的全局模式可以从简单的学习局部规则中涌现。后续工作将 NCA 扩展到 3D 结构生成(Sudhakaran 等,2021)、可引导方向(Randazzo 等,2023)和纹理合成(Niklasson 等,2021)。这些系统的一个统一特征是所有细胞共享一组学习参数,通过时间反向传播进行端到端优化。这种权重共享约束促进了连贯的全局行为,但限制了表征生物生态系统的种群内多样性。 最近的工作开始将生态动力学引入 NCA 框架。Biomaker CA(Randazzo 和 Mordvintsev, 2023)支持类植物生物体,它们生长、通过突变繁殖,并在共享网格中竞争营养,利用元进化发现可行的形态发生程序。值得注意的是,Biomaker CA 允许不同生物体拥有不同的学习程序,在 NCA 范式中引入了一种异质性形式;然而,这种异质性主要在生物体级程序层面运作,而不是在单个种群内每个细胞独立神经参数层面。Petri Dish NCA(Zhang 等,2025)更进一步,允许多个独立参数化的 NCA 智能体在共享基质中共存,并通过持续的基于梯度的学习进行适应,证明即使智能体通过梯度下降优化,生态动力学也能涌现。相对于 Biomaker CA,这更强调共享基质内的参数粒度,但它仍将生态适应围绕基于梯度的优化,而不是在相同竞争环境中比较多种优化范式。 与此同时,Lenia(Chan, 2019)和 Flow-Lenia(Plantec 等,2025)等系统探索连续的 CA,它们产生丰富的涌现动力学——包括自我复制模式和类似进化的适应——不依赖神经网络,而是依靠参数化核函数和守恒定律。这些系统在生态直觉上密切相关,但它们通过不同的建模范式来处理:它们在连续细胞系统中研究涌现和适应,而不是具有学习更新规则的异质神经智能体。 这条脉络留下了几个相关问题。首先,尽管近期工作已将异质性引入生态 CA 系统,但对于每个细胞保持自己的神经网络权重且基质在个体层面异质的情况,关注较少。其次,现有差异也落在优化机制层面:许多系统主要依赖基于梯度的训练、元进化或单一的优化体制,关于进化和强化学习如何在相同竞争环境中相互作用的工作较少。第三,学习范式和网络架构通常被分开研究,而共享生态设置使得在同一环境中直接比较它们成为可能。更广泛地说,这些空白促使我们研究基于 NCA 的系统,其中每个细胞拥有独立的神经网络,并且在单个模拟中同时运行多种学习范式。 ### 2.2 神经进化 神经进化通过进化算法优化神经网络参数或拓扑。NEAT(Stanley 和 Miikkulainen, 2002)通过物种形成共同进化权重和拓扑,以保护结构创新。进化策略(Salimans 等,2017)表明,对固定拓扑网络的无梯度优化可以在标准基准上与 RL 匹敌,而深度遗传算法将基于种群的搜索扩展到大规模神经策略(Such 等,2017)。新颖性搜索进一步证明了当显式目标具有欺骗性时行为探索的价值(Lehman 和 Stanley, 2011)。权重无关神经网络(Gaier 和 Ha, 2019)表明,仅拓扑本身就能编码有用的归纳偏置。总之,这些研究确立了神经进化作为基于梯度的参数、拓扑或两者优化的灵活替代方案。 神经进化还支持通过变化对手而非固定目标定义的关系适应度。Sims(1994)在竞争任务中进化了形态和控制耦合的虚拟生物,Rosin 和 Belew(1997)开发了解决竞争性共同进化中病态问题的方法。Stanley 和 Miikkulainen(2004)后来在机器人决斗领域使用竞争性共同进化来研究控制器复杂化。开放式进化研究将持续新颖性视为核心评估挑战(Packard 等,2019),而 POET 将环境挑战生成与智能体优化和迁移配对(Wang 等,2019)。这些系统与本文研究的持久空间生态不同,但它们将对手和环境确立为评估情境的一部分,而不是固定测试集。即便如此,神经进化文献中的许多评估仍针对相对显式的目标,无论是在固定基准、结构化竞争任务还是具有明确成功标准的配对竞赛中。持久生态设置受到的关注相对较少,尽管那里的成功是由能量获取、繁殖、存活以及与其他不断变化种群的相互作用共同塑造的。因此,推动本研究的空白不仅仅是哪个优化器在预定任务上得分最高,而是替代优化体制如何在共享生态中持久生存和竞争,同时栖息并共同塑造同一生态。 ### 2.3 鲍德温效应 Baldwin(1896)提出,生物体终生学习的能力可以通过平滑适应度景观来引导进化进程,使原本无法达到的基因型通过选择变得可及。Hinton 和 Nowlan(1987)提供了第一个计算演示:在一个“大海捞针”式的适应度景观中,随机找到最优基因型的概率小得惊人,具有可学习等位基因的种群以远快于无学习种群的速度收敛到最优基因型。关键见解是,学习允许生物体在其一生中“发现”附近的适应度峰值,从而产生进化可以在世代中遵循的适应度梯度。 后续工作在不同条件下探索了鲍德温效应:适应度景观随时间变化的动态环境(Suzuki 和 Arita, 2004)、限制可学习内容的可塑性模型(Morgan 等,2020),以及允许遗传行为与习得行为之间的平衡本身被优化的进化学习率(Bull, 1999)。最近的研究兴趣复兴重新审视了原始的 Hinton-Nowlan 模型,证明效应的大小敏感地依赖于可塑性的性质和适应度景观结构(Fontanari 和 Santos, 2017)。然而,大多数鲍德温效应计算研究使用简单遗传算法,具有位串基因型,在充分混合的种群中、静态或缓慢变化的适应度景观下进行。 这些研究启发了本文检验的层分配,但它们并不暗示进化和终生更新之间规定好的分割就构成已证实的鲍德温效应。因此,本实验询问三种实现特定的更新-继承组合在竞争性空间生态下如何表现,并将鲍德温动力学视为需要单独因果消融的假设。在本研究中,鲍德温效应仅仅是区分进化的和终生更新的层组的一个动机。EvoRL 将进化交叉和变异分配给 W1,将终生 RL 分配给 W2。在 50K 交叉实验中,W2 权重更新在前 3% 被禁用,尽管奖励状态可以累积;W1 进化保持活跃,并且在开始后 W1 进化和 W2 RL 继续并发。这不是一个先完成的进化阶段随后再进入独立 RL 阶段。EvoEvo 对两个层组都应用进化。RLRL 对两个层组都应用终生 RL,但仍然包括繁殖、选择、父代权重平均和输出层重置。因此,这种比较测试了三种实现特定的更新-继承体制。
相似文章
EvoArena:追踪记忆演化以实现动态环境中鲁棒的LLM智能体
EvoArena引入了一个基准测试,用于评估LLM智能体在动态环境中的表现,该环境在终端、软件和社交领域具有渐进式更新;同时EvoMem提出了一种基于补丁的记忆范式,记录结构化的演化;实验表明,当前智能体在EvoArena上仅达到39.6%的准确率,而EvoMem在该基准测试上平均提升1.5%,并在GAIA和LoCoMo上也有所改进。
EVOM: 智能体元进化中的Actor-Critic架构强化学习方法
介绍了EVOM,一种基于LLM的设计智能体的智能体元进化框架,用于自动发现高性能的Actor-Critic架构,在连续控制任务上优于手动基线方法和先前方法。
通过进化程序性瓶颈解读神经组合优化
介绍进化程序性瓶颈(EPB),一种通过LLM驱动的进化将黑箱模型蒸馏为人类可读的程序组合以解读神经组合优化策略的框架。
进化策略作为强化学习的可扩展替代方案
OpenAI 提出进化策略(ES)作为一种可扩展的黑箱优化方法,可替代强化学习用于训练神经网络策略。进化策略通过将策略训练视为随机参数搜索来简化优化问题,该搜索基于奖励反馈反复采样并选择更优的参数配置。
GAE: 通过强化优化进行科学发现的图增强进化
GAE 引入了一个结合图神经网络、强化学习和 LLM 微调的框架,以克服进化程序搜索中的瓶颈,在复杂非线性振荡器系统的符号回归上实现了最先进的性能。