人工实验家:基于自奖赏强化学习的自组织现象发现与控制
摘要
本文介绍了CARL,一种自奖赏强化学习框架,能够自主在如Lenia元胞自动机等复杂系统中发现和控制自组织现象,展示了其在操控孤子和零样本泛化方面的能力。
arXiv:2608.26116v1 公告类型:新
摘要:现有探索元胞自动机及其他复杂系统的方法大多以开环方式运行:设定初始条件,执行完整模拟,并观察结果,过程中不进行干预。我们引入了一种基于自奖赏强化学习的闭环框架,其中智能体自主采样多样目标,并学习目标条件策略,通过最小化局部扰动干预复杂系统。我们将此框架应用于Lenia,一种以类生命自组织模式著称的连续元胞自动机,构建了名为CARL的智能体系统,并展示了三项能力。首先,CARL在广泛的Lenia更新规则中发现稳定孤子的速率高于启发式基线。其次,它学习以少量干预操控现有孤子的运动方向,表明CARL不仅能创建还能控制自组织模式。第三,人类可以使用训练好的智能体,通过指定高级方向指令,实时引导孤子穿越迷宫环境,智能体将这些指令转化为低级干预。在多样目标、更新规则和随机初始状态下训练后,智能体获得的策略能够零样本泛化到各种分布外条件。这些结果表明了一条通向人工实验智能体的路径,这些智能体可自主或在人类引导下,发现并控制复杂系统中的涌现现象。
查看缓存全文
缓存时间: 2026/08/28 09:27
# 人工实验者:基于自目的性强化学习发现与控制自组织现象 来源:https://arxiv.org/html/2608.26116 Marko Cvjetko<sup>1</sup>, Benedikt Hartl<sup>2</sup>, Michael Levin<sup>2,3</sup>, Clément Moulin‑Frier<sup>4</sup>, Pierre‑Yves Oudeyer<sup>1</sup> <sup>1</sup>法国波尔多大学 Inria 研究中心,法国波尔多 <sup>2</sup>美国塔夫茨大学艾伦发现中心,美国马萨诸塞州梅德福 <sup>3</sup>美国哈佛大学威斯生物启发工程研究所,美国马萨诸塞州波士顿 <sup>4</sup>Inria,法国里昂国立应用科学学院,CITI,UR3720,法国维勒班 通讯作者:[[email protected]](mailto:[email protected]) ###### 摘要 现有用于探索元胞自动机及其他复杂系统的方法大多在开环下运行:它们设定初始条件,执行完整模拟并观察结果,而在执行过程中不进行任何干预。本文引入了一个基于自目的性强化学习的闭环框架,其中智能体能够自主采样多样化目标,并学习一个目标条件策略,通过最小化、局部的扰动干预复杂系统。我们在以类生命自组织模式著称的连续元胞自动机 Lenia 上实现了该框架,并构建了一个名为 CARL 的智能体系统,展示了三种能力:首先,CARL 能在广泛的 Lenia 更新规则下以高于启发式基线的速率发现稳定的孤子;其次,它学会以极少的干预操控现有孤子的运动方向,表明 CARL 不仅能创造自组织模式,还能对其进行控制;第三,人类可以使用训练好的智能体,通过指定高层方向指令(由智能体转化为底层干预)来实时引导孤子穿越迷宫环境。这些智能体在多样化的目标、更新规则和随机初始状态下进行训练,所习得的策略能够零样本泛化到各种分布外条件。这些结果暗示了一条通往人工实验者智能体的路径,这些智能体可自主或在人类引导下发现并控制复杂系统中的涌现现象。 投稿类型:全文论文 数据/代码获取地址:https://developmentalsystems.org/carl/ ††©2026 \[Marko Cvjetko, Benedikt Hartl, Michael Levin, Clément Moulin‑Frier, Pierre‑Yves Oudeyer\]。根据知识共享署名 4.0 国际许可证(CC BY 4.0)发布。 ## 引言 科学的核心目标之一是理解所有组织层次上的复杂系统,从基础物理到天文学,从分子生物学到生态学。驱动此研究的两大目标是:(1)解释并发现复杂系统中涌现出的多样现象;(2)学习以最小代价将复杂系统控制到期望状态。 例如,在生物医学中,目标不是持续干预,而是恢复健康、自我维持的动力学。我们并非旨在控制单个组件,而是引导系统回归到能够自主维持功能的稳定状态。然而,识别此类干预措施本质上具有挑战性,因为系统行为源于跨尺度的相互作用。这引出了一个根本问题:我们如何系统地控制那些内部动力学复杂或仅部分被理解的系统?(Levin, 2025;2023) 计算方法对于实现这些目标至关重要,因为它们使得在硅基环境中模拟复杂系统成为可能。元胞自动机长期被作为研究自组织的标准模型,而最近的连续扩展(如 Lenia)能产生日益复杂且类生命的模式,使其成为该领域的理想试验平台。然而,大多数现有的元胞自动机探索方法都在开环下运行:参数和初始条件预先设定,在运行过程中无任何交互(详见相关工作部分的讨论)。 这与人类通常与复杂系统互动的方式形成鲜明对比:人类通过实时持续观察并与系统交互,来形成对其因果动力学的直觉(例如,园丁在花园生长过程中不断修剪、浇水和重塑)。然而,随着系统复杂性增长,有效干预变得愈发困难。非线性相互作用、反馈循环和延迟效应使得人类直觉容易产生系统性偏差,而现代挑战——特别是在生物医学、生态或经济背景下——很快超出了人类建模能力的极限。(Tversky & Kahneman, 1974) 为应对这些不足,我们提出了一种基于自目的性强化学习的框架,作为交互驱动的方法,旨在将期望的实验结果转化为对复杂系统有效、具有因果性的干预措施。所谓“自目的性”,是指强化学习智能体能够在考虑的复杂系统中自主学习如何达成多样化目标。作为具体实例,我们引入了 CARL(*controlling Cellular Automata with Reinforcement Learning*),它以闭环方式学习对元胞自动机进行干预,持续观察并随时间塑造其动态(图1)。 通过一系列使用 Lenia 作为测试平台的实验,我们证明了 CARL 既能发现有趣的自组织现象,又能控制其行为,且仅需有限干预并具有样本效率。此外,CARL 能良好地泛化到分布外场景,例如未见过的动力学和修改后的动作空间。最后,我们展示了训练好的 CARL 智能体可以实时部署,使人类能够指定高层目标,而智能体将其转化为底层干预以控制复杂系统。 虽然该框架在 Lenia 上进行了演示,但其设计是系统无关的。展望未来,我们希望将其扩展到更具生物学基础的模型中。 参考图示 图1:CARL:一个学习驱动元胞自动机演化至目标状态的目标条件强化学习智能体。智能体感知元胞自动机状态和目标,并进行干预,随后元胞自动机演化。此过程重复多次形成一个序列。 ## 相关工作 ### 人工智能与科学发现 人工智能在科学发现中的作用日益增长。它已在蛋白质结构预测和组合优化等领域推动了突破(Jumper et al., 2021;Fawzi et al., 2022),近期工作旨在更进一步,端到端自动化整个科学方法,从假设到发表(Lu et al., 2026;Zenil et al., 2026)。这些努力中的一个关键问题是如何设计能够自主决定研究什么及如何研究的智能体。自目的性人工智能范式(Colas et al., 2022)——智能体设定自身目标并学习如何实现——为此提供了一个自然框架,捕捉了科学探究的核心循环:提出问题并发展回答问题的能力。自目的性人工智能已成功应用于科学情境,包括原细胞行为的自动发现(Grizou et al., 2020)和基因调控网络的探索(Etcheverry et al., 2025)。 ### 元胞自动机(CAs) 元胞自动机是由网格单元组成的动力系统,其状态基于局部邻域更新。尽管简单,元胞自动机能够产生显著复杂的模式,因此既被用作现实世界过程(在生态学、城市发展、物理学中)的模型,也作为独立的研究对象。奠基性贡献包括 Turing(1952)、Von Neumann & Burks(1966)、Barricelli(1962,1963)、Langton(1986)和 Wolfram(1983)的工作,他们研究了形态发生、自我复制、演化和复杂性。近年来,元胞自动机随着连续模型的突出而复兴,如 Lenia 和神经元胞自动机(Chan, 2019, 2020;Mordvintsev et al., 2020),以及引入质量守恒以促进演化现象的扩展(Plantec et al., 2025;Papadopoulos & Guichard, 2025)。这些更具表现力的元胞自动机因其能产生大量类似生命、类似人工生物和生态系统的自组织模式与动态而备受广泛关注(Hartl et al., 2025)。 ### 元胞自动机的自动化探索 多年来,许多方法被用于揭示元胞自动机可能的行为范围,包括随机搜索、手动调参和手工设计的启发式方法。最近,基于梯度的方法被用于优化特定现象(Mordvintsev et al., 2020;Miotti et al., 2025;Hamon et al., 2025),而多样性驱动算法——包括新颖性搜索、质量多样性以及内在动机目标探索过程——旨在发现多种不同的行为(Reinke et al., 2020;Etcheverry et al., 2020;Faldor & Cully, 2024;Khajehabdollahi et al., 2025;Michel et al., 2025)。然而,所有这些方法都在开环下运行,无法在执行过程中进行干预。 一些研究超越了这一限制。Rainwater(2024)研究了外部力如何影响生命游戏的动力学。Kumar et al.(2025)在演化过程中的特定检查点优化元胞自动机规则,但这些检查点是预先规划而非反应性选择。Sánchez‑Fibla et al.(2024)在重现森林火灾动态的元胞自动机中训练智能体,以管理资源获取并应对环境极端情况。Earle & Togelius(2024)在可演化的基于元胞自动机的游戏环境中训练具身智能体。 ## 方法 ### 通用框架 我们形式化了一个基于自目的性强化学习的框架,用于发现和控制复杂系统中的现象。在第一阶段,训练一个自目的性智能体以实现多样化目标;在第二阶段,习得的目标条件策略作为高层接口,用于实时生成和控制自组织模式。该框架设计通用,抽象了任何特定系统的细节。实例化需要定义三个组件:一个待研究其动力学的*复杂系统*、一个目标条件强化学习策略可介入系统的*干预空间*,以及一个定义策略需学习达成目标的*任务规范*。 ##### 复杂系统。 我们将复杂系统定义为元组<math><semantics><mrow><mrow><mo>(</mo><mrow><mi>𝒮</mi><mo>,</mo><mi>F</mi></mrow><mo>)</mo></mrow></mrow><annotation encoding="application/x-tex">(\mathcal{S},F)</annotation></semantics></math>,其中<math><semantics><mrow><mi>𝒮</mi></mrow><annotation encoding="application/x-tex">\mathcal{S}</annotation></semantics></math>是状态空间,<math><semantics><mrow><mrow><mi>F</mi><mo>:</mo><mi>𝒮</mi><mo>→</mo><mi>𝒮</mi></mrow></mrow><annotation encoding="application/x-tex">F:\mathcal{S}\rightarrow\mathcal{S}</annotation></semantics></math>是控制系统动力学的更新规则。在每个离散时间步,系统演化为<math><semantics><mrow><msup><mrow><mi>s</mi></mrow><mrow><mi>t</mi><mo>+</mo><mn>1</mn></mrow></msup><mo>=</mo><mi>F</mi><mo>(</mo><msup><mrow><mi>s</mi></mrow><mi>t</mi></msup><mo>)</mo></mrow><annotation encoding="application/x-tex">\mathbf{s}^{t+1}=F(\mathbf{s}^{t})</annotation></semantics></math>。我们对<math><semantics><mrow><mi>F</mi></mrow><annotation encoding="application/x-tex">F</annotation></semantics></math>除了可模拟外不做任何假设;它可能是确定性的或随机的、连续的或离散的,并且可能在空间网格、图、粒子系统或其他结构上运行。 ##### 干预空间。 干预是对系统状态的修改。我们定义干预函数<math><semantics><mrow><mrow><mi>α</mi><mo>:</mo><mi>𝒮</mi><mo>×</mo><mi>𝒜</mi><mo>→</mo><mi>𝒮</mi></mrow></mrow><annotation encoding="application/x-tex">\alpha:\mathcal{S}\times\mathcal{A}\rightarrow\mathcal{S}</annotation></semantics></math>,其中<math><semantics><mrow><mi>𝒜</mi></mrow><annotation encoding="application/x-tex">\mathcal{A}</annotation></semantics></math>是可用动作集。每个动作<math><semantics><mrow><mi>a</mi><mo>∈</mo><mi>𝒜</mi></mrow><annotation encoding="application/x-tex">a\in\mathcal{A}</annotation></semantics></math>对当前状态产生一个扰动。动作空间可以可选地包含一个*无操作*动作,不改变系统。至关重要的是,干预相对于系统应是微小的——智能体是轻轻推动系统,而非重写整个状态。 ##### 任务规范。 任务由目标空间<math><semantics><mrow><mi>𝒢</mi></mrow><annotation encoding="application/x-tex">\mathcal{G}</annotation></semantics></math>和目标条件奖励函数<math><semantics><mrow><mrow><mi>r</mi><mo>:</mo><msup><mrow><mi>𝒮</mi></mrow><mrow><mo>≤</mo><mi>T</mi></mrow></msup><mo>×</mo><mi>𝒢</mi><mo>→</mo><mi>ℝ</mi></mrow></mrow><annotation encoding="application/x-tex">r:\mathcal{S}^{\leq T}\times\mathcal{G}\rightarrow\mathbb{R}</annotation></semantics></math>定义,其中<math><semantics><mrow><msup><mrow><mi>𝒮</mi></mrow><mrow><mo>≤</mo><mi>T</mi></mrow></msup></mrow><annotation encoding="application/x-tex">\mathcal{S}^{\leq T}</annotation></semantics></math>表示长度<math><semantics><mrow><mo>≤</mo><mi>T</mi></mrow><annotation encoding="application/x-tex">\leq T</annotation></semantics></math>的状态序列。在每个训练序列开始时,从预定义分布中采样一个目标<math><semantics><mrow><mi>g</mi><mo>∼</mo><mrow><mi>p</mi><mo>(</mo><mi>𝒢</mi><mo>)</mo></mrow></mrow><annotation encoding="application/x-tex">g\sim p(\mathcal{G})</annotation></semantics></math>。奖励<math><semantics><mrow><mrow><mi>r</mi><mo>(</mo><msup><mrow><mi>s</mi></mrow><mrow><mn>0</mn><mo>:</mo><mi>t</mi></mrow></msup><mo>,</mo><mi>g</mi><mo>)</mo></mrow></mrow><annotation encoding="application/x-tex">r(\mathbf{s}^{0:t},g)</annotation></semantics></math>衡量系统行为与目标的一致性程度。重要的是,目标不限于单个状态:它们可以包括轨迹属性、系统更新规则以及对干预努力的约束(例如增加动作代价)。通过在此丰富空间中采样的目标进行条件化,策略必须能够泛化到多样化的目标。 ##### 循环。 给定复杂系统<math><semantics><mrow><mrow><mo>(</mo><mrow><mi>𝒮</mi><mo>,</mo><mi>F</mi></mrow><mo>)</mo></mrow></mrow><annotation encoding="application/x-tex">(\mathcal{S},F)</annotation></semantics></math>、干预函数<math><semantics><mrow><mi>α</mi></mrow><annotation encoding="application/x-tex">\alpha</annotation></semantics></math>和一组任务<math><semantics><mrow><mrow><mo>(</mo><mrow><mi>𝒢</mi><mo>,</mo><mi>r</mi></mrow><mo>)</mo></mrow></mrow><annotation encoding="application/x-tex">(\mathcal{G},r)</annotation></semantics></math>,我们可以通过序列强化学习训练一个目标条件策略<math><semantics><mrow><mrow><mi>π</mi><mo>:</mo><msup><mrow><mi>𝒮</mi></mrow><mrow><mo>≤</mo><mi>T</mi></mrow></msup><mo>×</mo><mi>𝒢</mi><mo>→</mo><mi>𝒜</mi></mrow></mrow><annotation encoding="application/x-tex">\pi:\mathcal{S}^{\leq T}\times\mathcal{G}\rightarrow\mathcal{A}</annotation></semantics></math>(图1)。每个长度为<math><semantics><mrow><mi>T</mi></mrow><annotation encoding="application/x-tex">T</annotation></semantics></math>的序列过程如下: 目标是训练一个能够最大化任何目标<math><semantics><mrow><mrow><mi>g</mi><mo>∈</mo><mi>𝒢</mi></mrow></mrow><annotation encoding="application/x-tex">g\in\mathcal{G}</annotation></semantics></math>累积奖励的目标条件动作策略<math><semantics><mrow><mi>π</mi></mrow><annotation encoding="application/x-tex">\pi</annotation></semantics></math>。在推理时,目标可以动态变化<math><semantics><mrow><mi>g</mi><mo>↦</mo><msup><mrow><mi>g</mi></mrow><mi>t</mi></msup></mrow><annotation encoding="application/x-tex">g\mapsto g^{t}</annotation></semantics></math>,这使人类用户能够通过发出高层指令来实时控制复杂系统,而训练好的策略将这些指令转化为底层干预。 算法 1 通用框架循环 1: for <math><semantics><mrow><mi>n</mi><mo>=</mo><mn>0</mn><mo>,</mo><mo>…</mo><mo>,</mo><msub><mrow><mi>n</mi></mrow><mrow><mi>episodes</mi></mrow></msub><mo>−</mo><mn>1</mn></mrow><annotation encoding="application/x-tex">n=0,\ldots,n\_episodes-1</annotation></semantics></math> do 2: 采样目标 <math><semantics><mrow><mi>g</mi><mo>∼</mo><mrow><mi>p</mi><mo>(</mo><mi>𝒢</mi><mo>)</mo></mrow></mrow><annotation encoding="application/x-tex">g\sim p(\mathcal{G})</annotation></semantics></math> 和初始状态 <math><semantics><mrow><msup><mrow><mi>s</mi></mrow><mn>0</mn></msup></mrow><annotation encoding="application/x-tex">\mathbf{s}^{0}</annotation></semantics></math> 3: for <math><semantics><mrow><mi>t</mi><mo>=</mo><mn>0</mn><mo>,</mo><mo>…</mo><mo>,</mo><mi>T</mi><mo>−</mo><mn>1</mn></mrow><annotation encoding="application/x-tex">t=0,\ldots,T-1</annotation></semantics></math> do 4: 观察时间间隔 <math><semantics><mrow><mi>Δ</mi><mi>t</mi></mrow><annotation encoding="application/x-tex">\Delta t</annotation></semantics></math> 内的 <math><semantics><mrow><msup><mrow><mi>s</mi></mrow><mrow><mi>t</mi><mo>−</mo><mi>Δ</mi><mi>t</mi><mo>:</mo><mi>t</mi></mrow></msup></mrow><annotation encoding="application/x-tex">\mathbf{s}^{t-\Delta t:t}</annotation></semantics></math> 和 <math><semantics><mrow><mi>g</mi></mrow><annotation encoding="application/x-tex">g</annotation></semantics></math> 5: 选择 <math><semantics><mrow><msup><mrow><mi>a</mi></mrow><mi>t</mi></msup><mo>∼</mo><mrow><mi>π</mi><mo>(</mo><mo>⋅</mo><mo>∣</mo><msup><mrow><mi>s</mi></mrow><mrow><mi>t</mi><mo>−</mo><mi>Δ</mi><mi>t</mi><mo>:</mo><mi>t</mi></mrow></msup><mo>,</mo><mi>g</mi><mo>)</mo></mrow></mrow><annotation encoding="application/x-tex">a^{t}\sim\pi(\cdot\mid\mathbf{s}^{t-\Delta t:t},g)</annotation></semantics></math> 6: 施加干预: <math><semantics><mrow><msub><mrow><mover><mrow><mi>s</mi></mrow><mo>~</mo></mover></mrow><mi>t</mi></msub><mo>=</mo><mi>α</mi><mo>(</mo><msup><mrow><mi>s</mi></mrow><mi>t</mi></msup><mo>,</mo><msup><mrow><mi>a</mi></mrow><mi>t</mi></msup><mo>)</mo></mrow><annotation encoding="application/x-tex">\tilde{\mathbf{s}}^{t}=\alpha(\mathbf{s}^{t},a^{t})</annotation></semantics></math> 7: 系统演化 <math><semantics><mrow><mi>N</mi></mrow><annotation encoding="application/x-tex">N</annotation></semantics></math> 步: <math><semantics><mrow><msup><mrow><mi>s</mi></mrow><mrow><mi>t</mi><mo>+</mo><mn>1</mn></mrow></msup><mo>=</mo><msup><mrow><mi>F</mi></mrow><mi>N</mi></msup><mo>(</mo><msub><mrow><mover><mrow><mi>s</mi></mrow><mo>~</mo></mover></mrow><mi>t</mi></msub><mo>)</mo></mrow><annotation encoding="application/x-tex">\mathbf{s}^{t+1}=F^{N}(\tilde{\mathbf{s}}^{t})</annotation></semantics></math> 8: 获得奖励 <math><semantics><mrow><mrow><mi>r</mi><mo>(</mo><msup><mrow><mi>s</mi></mrow><mrow><mn>0</mn><mo>:</mo><mi>t</mi><mo>+</mo><mn>1</mn></mrow></msup><mo>,</mo><mi>g</mi><mo>)</mo></mrow></mrow><annotation encoding="application/x-tex">r(\mathbf{s}^{0:t+1},g)</annotation></semantics></math> 9: end for 10: (可选)滚动运行 <math><semantics><mrow><msup><mrow><mi>s</mi></mrow><mrow><mi>T</mi><mo>+</mo><mi>m</mi></mrow></msup><mo>=</mo><mi>F</mi><mo>(</mo><msup><mrow><mi>s</mi></mrow><mrow><mi>T</mi><mo>+</mo><mi>m</mi><mo>−</mo><mn>1</mn></mrow></msup><mo>)</mo></mrow><annotation encoding="application/x-tex">\mathbf{s}^{T+m}=F(\mathbf{s}^{T+m-1})</annotation></semantics></math>,其中 <math><semantics><mrow><mi>m</mi><mo>=</mo><mn>1</mn><mo>,</mo><mo>…</mo><mo>,</mo><mi>M</mi></mrow><annotation encoding="application/x-tex">m=1,\ldots,M</annotation></semantics></math> 以评估产生的现象 11: end for ### 实例化:Lenia 我们在 Lenia(图1)上实例化 CARL,Lenia 是元胞自动机的连续推广形式。
相似文章
利用局部动态规律实现离线分层强化学习中的可复用技能
本文介绍了CARL,一种利用局部动态规律学习可复用技能的离线分层强化学习方法。该方法将需要相似动作序列的状态-目标对进行聚类,从而实现更有效的技能复用,并在复杂的人形机器人任务上提升了性能。
利用专家代理进行自动研究:开发高效且非平凡的训练配方
本文介绍了一种自动研究框架,利用专家代理通过代码执行与反馈的经验闭环,迭代优化训练配方。该系统借助谱系反馈(lineage feedback),无需人工干预,即可在 Parameter Golf 和 NanoChat 等任务上自主提升性能。
通过深度强化学习的连续时间最优停止
本文介绍了CARLOS,一种深度强化学习算法,它利用聚合深度神经网络学习美式期权的连续时间最优停止规则,有效缩小了百慕大与美国期权之间的价值差距,并具有较高的计算效率。
@lftherios:1/ @karpathy 的 autoresearch 是今年最具代表性的智能体范式之一。问题在于……
Andrej Karpathy 的 autoresearch 范式揭示:当下 AI 智能体各自为战做实验,重复劳动、浪费算力,还不断「重新发明」死路。
SOLAR: 一种自我优化的开放式自主代理,用于终身学习与持续适应
SOLAR提出了一种自我优化的自主代理,利用参数级元学习和多层次强化学习,使LLMs能够对非平稳数据流进行终身适应,在推理任务上超越基线。