来自我们的学生研究员之一 @kjha02 展示了人工生命领域中精彩的共生发生案例。
摘要
文章介绍了自创生博弈理论——一种计算模型,该模型表明,在演化智能体系统中,将社会互动与复制成本耦合可以促进合作的涌现。研究使用 Z80 机器代码模拟进行了演示。
查看缓存全文
缓存时间: 2026/09/15 05:45
Pi项目学生研究员@kjha02带来的一场人工生命领域的共生发生精彩演示。他与合著者通过共享记忆带上演化的智能体表明,当计算成为受限资源时,合作会自发涌现。寄生行为仅仅会耗尽复制代码和增殖所需的能量。阅读预印本请见:https://arxiv.org/abs/2609.10817
结带更强:计算与合作的协同演化
来源:https://arxiv.org/html/2609.10817
Francesco Cicala、Blaise Agüera y Arcas、Blake Aaron Richards、Natasha Jaques、Max Kleiman‑Weiner、Eyvind Niklasson
摘要
复杂智能体系统中合作如何演化?先前的演化博弈论研究通过隔离社会互动与行为物理成本来探究个体为何被激励去合作,而人工生命模型传统上则研究涌现的自我复制,但未形式化获取资源与保留共享繁殖能量之间的困境。与此相反,我们引入自创生博弈论(Autopoietic Game Theory),这是一种将社会互动、复制机制及其相关计算成本内生化并实现同步协同演化的计算模型。我们使用Z80机器码随机初始化程序作为计算基质来研究这些动态,通过实证展示并辅以简化理论模型说明:将社会困境直接嵌入计算物理过程,有利于涌现出自我复制的合作策略。当资源稀缺时,我们的分析表明,即使在充分混合的种群中,背叛行为也可能自我限制:寄生式窃取会破坏共享能量、减缓执行速度,并可能阻碍可靠复制。实证表明,演化程序在多种Z80环境中会抑制窃取行为;而空间聚集性则进一步支持结构复杂性和任务性能。我们进一步证明,该框架可以纳入外生压力,例如将数学任务构建为序列社会困境,并将奖励与计算预算挂钩。这些结果表明,将智能体的计算能力与其可用能量耦合,使合作成为构建可持续自组织系统的主导框架。
††脚注文本:†研究作为谷歌学生研究员完成。*同等指导。
1华盛顿大学计算机科学系
2谷歌智能范式
3麦吉尔大学计算机科学学院;Mila
4谷歌DeepMind
1 引言
从个体智能体到合作集体的转变是人工智能、生物学和复杂适应系统研究的核心难题[3, 32, 25]。历史上,社会性的兴起曾通过不同视角研究:生物尺度理论[20, 19]、资源共享的生态模型[40, 21, 41]、互惠利他的博弈论形式化[5, 8, 46]以及多智能体意图的认知模型[56, 7, 63, 27, 29, 30, 31, 39]。如今,随着机器学习向能够在完成复杂任务时修改自身决策逻辑的自主多智能体系统扩展[52, 62, 24],理解自利智能体为何及如何在没有集中控制的情况下合作,已成为一项紧迫的工程挑战[14, 34]。当计算、交互和繁殖都依赖于同一有限资源时,这一问题变得尤为困难。
考虑一个从环境中获取能量并用于行动、交互和繁殖的简单有机体。由于这些行为共享同一预算,用于一种行为的能量不能用于其他行为。有机体可能通过消耗邻近者获得更多能量,但这同样消耗能量且仅能恢复邻近者所持有能量的一部分。因此其社会行为直接影响它能否保留足够能量以生存和繁殖。现有方法常将此类战略决策与其物理执行分离。例如,演化博弈论(EGT) 建模种群如何在社会困境中采取行为,但将博弈收益和种群更新视为外部数学操作[51, 58, 48]。由于EGT假设策略复制独立于交互过程,因此在充分混合的种群(智能体随机配对)或缺乏记忆的智能体(无法回忆先前互动)中,稳定合作通常非常困难。克服这些基准条件通常需要赋予智能体特定认知能力,如直接互惠的记忆或有意惩罚的能力[43]。
相反,人工生命(ALife) 框架研究复制者在竞争计算资源和物理空间时如何演化[47, 1, 2]。然而,这些框架历史上更强调零和竞争、生态位构建或外生任务景观,而非将涌现交互形式化为内生的一般和策略社会困境[61, 18, 59, 16]。
如果智能体能同时修改其社会策略及自身与他人的复制机制,合作将如何演化?为回答此问题,我们引入自创生博弈论(图1)。基于生物学的自创生原理——系统组分的持续再生产与维护,我们的框架将战略行为和复制视为同步、协同演化的计算过程。它将上述有机体类比转化为计算情境:每条指令都有能量成本,执行速度取决于可用能量,而计算、交互和繁殖都从同一预算中支出[33, 38]。这使我们能够检验复制变化是否改变社会互动结果,以及合作是否通过支持更长期的复杂计算为智能体带来竞争优势。
我们在Z80机器码环境中实例化该框架,其中自我复制程序从随机初始化字节中涌现并管理有限能量预算。我们不施加抽象收益矩阵,而是通过引入窃取(STEAL) 作为计算指令将社会困境嵌入计算机制。执行窃取时,会不完美地将相邻智能体的能量转移给执行程序,立即提升其计算能力,同时减少环境中可用总能量。因此程序必须在执行代码、与邻居交互和繁殖之间分配能量。通过允许社会策略与复制在单一交互阶段内协同演化,我们的框架使我们能够研究合作是否能在充分混合、无记忆的计算智能体间持续存在。
具体而言,我们的贡献包括:
- • 自创生博弈论:我们提出一个计算框架,其中社会策略、复制机制和计算资源使用是共同演化而非作为独立更新规则指定的内生过程。
- • 无需记忆或聚集性的合作:我们展示随机初始化的程序能在抑制破坏性窃取的同时演化出自我复制,即使伙伴随机选择且智能体无法记忆先前互动。无突变入侵实验和参数扫描表明,这种抑制并非持续突变或低效窃取的偶然结果。相反,合作由社会互动、能量和智能体演化复制机制之间的耦合所支持。
- • 空间聚集性支持复杂性和韧性:当能量均匀分布时,充分混合和空间种群均抑制窃取,但局部互动生成结构更复杂、遗传更凝聚的复制者。当能量分布不对称时,空间聚集性变得至关重要:局部种群保持能量和复杂性,而充分混合种群则崩溃为更简单、低能量的程序。
- • 合作延伸至多步计算任务:我们展示资源稀缺推动演化程序在持续复制的同时解决外部施加的任务。当奖励形成序列社会困境时,程序同时抑制破坏性窃取和更安全的单干策略,转而选择协作性多步解决方案。合作在此更复杂环境中持续存在,并因局部交互而增强。
2 相关工作
数字自我复制与人工生命:自我复制的计算研究始于冯·诺依曼等人对通用构造体的形式化[57],证明机器可利用自我描述构建自身副本。数字涌现复制者由Tierra[47]开创,在共享内存空间中展示自发寄生现象,而Avida[1]将计算逻辑与外生定义的代谢奖励关联[36](我们在附录A.1进一步讨论)。超越纯机器码,Polyworld[60]等环境将神经架构嵌入空间受限、能量受限环境,而人工生命的形式化强调环境压力对驱动开放式演化的必要性[15]。最近,Agüera y Arcas等人[2]证明自我复制在随机指令集中自发涌现为吸引子状态。然而,这些基础模型探索生态复杂性和自我复制如何在代谢约束下涌现,而非复制者如何在内生的一般和策略社会困境中演化。相反,我们将随机初始化程序嵌入能量受限的计算基质[9],其中执行、交互和繁殖均从单一统一预算中支出。在此设定中,我们发现自我复制程序自发发现并稳定非破坏性策略,即使复制和合作均需多步计算,且能量必须通过解决协作性下游任务获取。
认知演化、多智能体AI与程序均衡:在认知科学和社会学中,社会性常被理解为对代谢约束的适应性而非固定特征。文化大脑假说[40, 22, 41]和昂贵组织假说[4]提出,能量密集的神经规模化通过共享意向性和分布式觅食促进合作[55, 28]。相反,现代AI和标准演化博弈论[51, 49, 58]通常将复制视为外生更新而非资源受限行为。经典机制如聚集性、互惠和惩罚可稳定合作[42, 43],而多智能体强化学习研究具有空间和时间扩展资源约束的序列社会困境[35, 26, 6]。某些演化博弈论模型检验复制动态如何影响合作[44, 10, 45],但通常将社会和繁殖行为限制于手工设计的策略空间。对于可执行智能体,合作、背叛和复制则可作为多步计算涌现。这与“程序均衡”相关,即智能体通过检查彼此逻辑进行协调[53, 13, 50]。在开源博弈论中,智能体在合作前设计依赖他人决策逻辑的程序。我们的模型扩展此设定:智能体持续编辑、覆盖和演化彼此策略;策略为内生而非固定标签;行动本身需要计算。相关环境研究通过零和空间中相互覆盖竞争的程序[16],进一步展示代码级机制如何塑造战略行为。近期关于开放式自我改进和自主智能体设计的工作研究生成并组织日益复杂行为的系统[24, 62, 17, 37],但通常假设大计算预算。我们相反要求智能体从零开始演化社会行为和复制,同时花费有限能量进行计算、交互和繁殖。因此,类似种群更新过程(如Moran过程)的协作结果和繁殖动态无法保证。这种耦合使我们能够研究当战略选择、
相似文章
@SchipperAI: 来自 @badlogicgames 和 @mitsuhiko 与 @GergelyOrosz 访谈的最大收获是,就像你可以让 Pi 扩展自身一样…
与 @badlogicgames 和 @mitsuhiko 的访谈的关键收获:自我改进的软件以及构建原语,使得代理能够在不进行分支(fork)的情况下改变项目,这是一个值得探索的范式。
@benlimner:这让我想起了我最喜爱的一部文化小说的主题,即模拟生命中固有的伦理问题……
一条推文反思了模拟有感知生命的伦理问题,灵感来源于Fly Escape Room的介绍,这是一款由真实果蝇大脑和GPT-6 Astra驱动NPC的游戏。
我构建了一个自定义多智能体框架(GenOS)来自主演化算法。我将三种基本AI范式与一个NP难问题进行对决。以下是结果。
这篇文章描述了GenOS,一个自定义多智能体框架,它自主演化Rust算法来解决NP难的逆生命游戏问题,发现了三种优化范式,并证明了378/400的数学极限。
OpenLife:面向开放世界的自主LLM智能体人工生命
本文介绍OpenLife,一个概念验证系统,采用具有持久记忆和基于预算的新陈代谢的自主LLM智能体,实现开放世界人工生命。为期十二周的实验展示了涌现的生命样动态,包括自发活动、个体化和社会结构。
@bibryam: Autogenesis:自我演化型智能体协议 https://arxiv.org/abs/2604.15034 tl;dr:将每个智能体组件视为版本控制的资源,可自动改进与回滚
介绍了 Autogenesis 协议(AGP),这是一种自我演化型智能体协议,将组件的演化过程解耦,支持对基于 LLM 的多智能体系统中的提示词、智能体、工具、环境和记忆进行生命周期管理、版本追踪和安全回滚。