Flawed in Nature, Perfect through Evolution

arXiv cs.LG 论文

摘要

本文介绍了‘Flawed in Nature, Perfect through Evolution’,这是一种机制,其中一群变异的AI模型在变化环境中集体提升性能,通过定理证明并在合成任务上验证。

arXiv:2609.00129v1 Announce Type: new 摘要:当人工智能(AI)和机器学习(ML)模型所训练的问题发生漂移时,其性能会下降。这是现实世界问题中一个近乎普遍的特征,这些问题往往不可预测地变化。生物进化通过自然选择作用于可遗传变异,克服了这一障碍,从而实现了智能。AI/ML技术早已采用了各种形式的自然选择,但由于优化自然驱动收敛,保持模型多样性一直具有挑战性。在这里,我们表明,一群AI/ML模型通过故意使其模型系数偏离最优值而发生变异,可以通过作为对非平稳性的统计对冲,在变化环境中可靠且可持续地提升性能。我们将此机制称为‘Flawed in Nature, Perfect through Evolution’,反映了集体性能提升是以个体性能为代价的。我们通过四个定理证明,在一般条件下,由此产生的遗憾减少是有保证的,将‘Flawed-in-Nature’机制确立为AI/ML系统的可泛化设计原则。我们在合成线性回归任务上验证了这些结果,表明变异群体在约$\sim80\%$的环境变化中提供了最佳模型,并且推理合成成功地将这种个体优势转化为集体优势。当变异漂移率与环境漂移率匹配时,该机制被证明是最有效的。我们概述了一个简单的自适应控制器,通过调整变异漂移率以匹配环境的未知漂移率,实现实际应用。‘Flawed-in-Nature’机制与生物进化的密切类比表明,它可能是有机发现更接近模拟生物智能的AI形式的关键缺失成分。
查看原文
查看缓存全文

缓存时间: 2026/09/02 06:10

# 自然缺陷,演化完美
来源:https://arxiv.org/html/2609.00129 \\monthyeardate2026年8月31日

###### 摘要
当人工智能(AI)和机器学习(ML)模型所解决的问题发生漂移时,其性能会下降。这是现实世界问题的一个近乎普遍的特征,这些问题通常不可预测地变化。生物进化通过自然选择作用于可遗传的变异,克服了这一障碍,从而实现了智能。AI/ML技术早就包含了某种形式的自然选择,但随着优化自然驱动收敛,维持模型多样性一直是一个挑战。在这里我们展示,一个AI/ML模型群体,通过故意对其模型系数进行远离最优状态的突变,可以可靠且可持续地在变化环境中提升性能,因为其作用类似于针对非平稳性的统计对冲。我们将此机制称为“自然缺陷,演化完美”,这反映了集体性能的提升是以牺牲个体性能为代价的。我们通过四个定理证明,在一般条件下,由此产生的遗憾减少是有保障的,从而将“自然缺陷”机制确立为AI/ML系统的一个可泛化的设计原则。我们在合成线性回归任务上验证了这些结果,表明突变群体在约80%的环境变化中能够提供最佳模型,并且推理综合成功地将这一个体优势转化为集体优势。该机制在突变漂移率与环境漂移率匹配时被证明是最有效的。我们概述了一个简单、自适应的控制器,通过调整突变漂移率以匹配未知的环境漂移率,使其能够应用于实际场景。“自然缺陷”机制与生物进化的紧密类比表明,它可能是有机发现更接近模仿生物智能的AI形式所缺失的关键成分。

自然缺陷,演化完美
J\. M\. Diederik Kruijssen
https://orcid.org/0000-0002-8804-0212
Allora Foundation

## 1 引言
人工智能(AI)和机器学习(ML)领域试图生成那些未通过自然过程产生的智能形式。评估这些领域的成就通常需要以不一定与自然智能挂钩的方式来形式化智能的概念。人们已经提出了许多关于智能的定义,其中最著名的可能是Legg & Hutter (2007) (https://arxiv.org/html/2609.00129#bib.bib25) 的定义,他们将智能定义为在广泛环境中实现目标的能力。虽然Legg-Hutter智能由于其对所有可能环境的无界求和而无法直接计算,但它为更广泛地思考(机器)智能的本质提供了一个有用的概念起点。在现实环境中实现目标的一个关键要求是能够泛化到不熟悉的情况。这需要具体的能力,如原创性、创造力、远见卓识以及许多其他能力。每一种品质都通过使智能体能够适应其(可能未知的)环境,从而为其智能做出贡献。基于Transformer的模型在自然语言处理和计算机视觉(Vaswani et al., 2017 (https://arxiv.org/html/2609.00129#bib.bib35), 例如)中的近期成功,重新引发了关于智能本质的辩论,将GPT、Claude、Gemini和其他前沿模型的成就誉为真正智能甚至意识的标志。Searle (1980) (https://arxiv.org/html/2609.00129#bib.bib31) “中文房间”论证的回响依然存在,因为令人印象深刻的输出并不一定意味着真正适应了新情况。大型语言模型(LLMs)能够生成通常与人类生成内容无法区分的文本,但从根本上仍受限于其训练数据。因此,在变化环境下的原创性、创造力和远见卓识对单一化的AI模型构成了根本性挑战。在本文中,我们证明这种挑战对于任何单一模型在形式上是不可约的,但可以通过一个刻意多样化的模型群体来克服。可以说,智能的出现已经在自然中得到了解决。只要我们这个物种可以被视为智能的,那么我们的标准就是我们定义智能的唯一实际参照点。因此,很自然地会问自然是如何产生智能的,并尝试在人工系统中复制这些过程。进化(Darwin, 1859 (https://arxiv.org/html/2609.00129#bib.bib7))是智能的基础。它依赖于自然选择和可遗传变异这两个基本机制。自然选择提供了评估性能(最初是“适应度”)和淘汰表现不佳个体所需的反馈回路。在AI中,自然选择的形式通常通过集成方法或去中心化学习(Breiman, 1996 (https://arxiv.org/html/2609.00129#bib.bib2);Dietterich, 2000 (https://arxiv.org/html/2609.00129#bib.bib8);Rao et al., 2021 (https://arxiv.org/html/2609.00129#bib.bib29);Kruijssen et al., 2024a (https://arxiv.org/html/2609.00129#bib.bib21), 例如)来实现。然而,可遗传变异在现代AI系统中并非自然存在。可遗传变异的挑战在于,许多AI或ML模型是单一的、整体的实体,本质上无法产生变异。即使考虑一个模型群体(或集群),它们优化给定训练数据损失函数的集体目标意味着一种收敛压力,这种压力限制了变异,而不是促进变异。这种收敛与生命的进化有某些相似之处,其中仅考虑自然选择也会随着时间的推移增加种群的同质性。自然通过两种机制来增强变异以解决这个问题:基因重组和突变。前者通过有性繁殖实现,它结合了两个个体的遗传物质。它不太适用于人工系统,因为模型通常不通过参数组合产生后代(尽管存在有趣的例外,例如Stanley & Miikkulainen 2002 (https://arxiv.org/html/2609.00129#bib.bib33);Wortsman et al. 2022 (https://arxiv.org/html/2609.00129#bib.bib36))。然而,突变过程是向模型群体引入变异的一种自然方式。对于单一的、整体的模型,突变不是建设性的。毕竟,它扰动模型远离训练所达到的最优状态。这意味着任何形式的突变本质上都对模型性能有害。然而,当考虑一个模型群体时,目标就从单一实体的最优性转变为在整个群体中实现最优性。任何单一模型可能都有缺陷,但由突变诱导的多样性提高了群体的集体适应度,甚至可能达到突变模型群体优于原始优化模型群体的程度。这是本文提出的核心思想,我们将其命名为“自然缺陷,演化完美”(或简称“自然缺陷”)。与生命进化的相似之处是显而易见且刻意的。类似的想法已经应用于集成方法,这些方法通常通过超参数的随机扰动(Jaderberg et al., 2017 (https://arxiv.org/html/2609.00129#bib.bib18), 例如)、随机初始化(Lakshminarayanan et al., 2017 (https://arxiv.org/html/2609.00129#bib.bib24))、随机特征子采样(Breiman, 2001 (https://arxiv.org/html/2609.00129#bib.bib3))、独立的微调运行(Wortsman et al., 2022 (https://arxiv.org/html/2609.00129#bib.bib36), 例如)或推理时噪声(Srivastava et al., 2014 (https://arxiv.org/html/2609.00129#bib.bib32);Gal & Ghahramani, 2016 (https://arxiv.org/html/2609.00129#bib.bib12), 例如)来生成模型多样性。类似地,进化计算技术通常采用突变在静态环境中搜索最优解,其中群体多样性是达到收敛的一种过渡方式,而不是一个持久目标(Stanley & Miikkulainen, 2002 (https://arxiv.org/html/2609.00129#bib.bib33);Salimans et al., 2017 (https://arxiv.org/html/2609.00129#bib.bib30), 例如)。持续学习方法(Kirkpatrick et al., 2017 (https://arxiv.org/html/2609.00129#bib.bib20);Zenke et al., 2017 (https://arxiv.org/html/2609.00129#bib.bib38), 例如)则相反,它们解决的是在变化环境中的学习问题。它们通过更新单个模型来实现这一点,同时通过权重整合来缓解先前学到知识的丧失(灾难性遗忘)。“自然缺陷”机制采取了根本不同的方法。它不是让一个模型去适应变化的环境,而是维护一个刻意多样化的模型群体,并依赖事后选择最佳性能的成员。以前的工作都没有试图通过故意、累积的参数突变来系统性地产生可遗传的(即持久的)变异,同时在非平稳性下提供性能改进的理论保证。本文的目标就是证明这种改进。突变的益处预期特别适用于不可预测变化的环境中(在文献中通常称为“概念漂移”,例如Gama et al. 2014 (https://arxiv.org/html/2609.00129#bib.bib13))。这是“自然缺陷”机制与之前关于集成方法、进化计算和持续学习的工作之间的根本区别。就像在自然界中一样,我们预期偏离最优状态主要作为针对非平稳性的统计对冲是有利的。本文的结构如下。在§2 (https://arxiv.org/html/2609.00129#S2)中,我们定义了“自然缺陷”机制,并通过证明一组四个定理来证明其可行性,这些定理系统性地量化了在静态和变化环境中单个模型和模型群体的预期性能。在§3 (https://arxiv.org/html/2609.00129#S3)中,我们描述了如何通过一个简单的推理综合层(该层聚合突变模型群体的输出)在实践中实现“自然缺陷”机制。在§4 (https://arxiv.org/html/2609.00129#S4)中,我们通过在合成线性回归问题上的数值实验验证了理论预测。在§5 (https://arxiv.org/html/2609.00129#S5)中,我们讨论了实验的局限性、使“自然缺陷”机制能够应用于具有未知漂移的真实环境的自学习控制器概述,以及对AI/ML模型进行突变对群体智能未来的影响。我们在§6 (https://arxiv.org/html/2609.00129#S6)中总结了主要发现及其更广泛的意义。

## 2 单一模型优化与群体优化存在根本差异
在本节中,我们展示了在静态环境中应用时,模型多样性是不必要的。“自然缺陷”机制的附加值涉及一个实际相关的情况:环境不可预测地变化,这将随机的参数突变转变为持久的战略优势。我们通过证明一组围绕以下中心假设的定理来证明其可行性:
1. 1. 静态环境中的单个模型实现了经验风险最小化(ERM)并收敛到风险最小化器。
2. 2. 变化环境中的单个模型会累积线性遗憾,从而变得过时。
3. 3. 鉴于只能访问过去的观察值,变化环境中的单个模型在信息论上仍然是最优的,因此其多余损失是不可约的。
4. 4. 变化环境中的突变模型群体实现的严格小于任何单个模型的遗憾,从而突破了约束个体模型的线性遗憾界。
这些假设表明,“自然缺陷”机制引入了一种模型群体多样性,一旦环境发生漂移,这种多样性就变得有利。该机制的关键要素在图1 (https://arxiv.org/html/2609.00129#S2.F1)中进行了说明。

图1:“自然缺陷”机制示意图。当条件不可预测地变化时,在过去数据上训练的模型变得过时,因为环境已经漂移,而模型无法适应。因此,单个模型在每次意外变化时都会遇到错误,这是重新训练无法避免的,从而导致其准确性存在根本限制。向模型参数中引入随机变化(“突变”)会使任何单个模型的预期准确性变差,却为群体带来了关键优势:随之而来的模型多样性意味着一些突变模型将很好地适应新出现的情况。按最近准确性加权模型输出,确保了最适应的模型变体主导聚合预测。这带来了任何单个模型都无法维持的更高准确度水平,并且是通过一种伤害个体但有益于集体的随机模型分化形式实现的。

### 2.1 静态环境中单个模型的经验风险最小化
“自然缺陷”机制的核心假设是,对模型参数的持续突变会产生一种模型群体多样性,一旦环境发生漂移,这种多样性就变得有利。我们通过首先建立一个精确的基准来量化该优势,该基准描述了在没有此类漂移时可达到的最佳性能。这通过证明在标准正则条件下,当特征和目标的联合分布是时不变的,ERM会在一个固定的假设类中收敛到风险最小化器来完成。

#### 2.1.1 记号和基本定义
设\((X,Y)\)为取值于\(\mathbb{R}^d \times \mathbb{R}\)且服从固定概率测度\(\mathcal{D}\)分布的随机变量。记\((x_i, y_i)_{i \geq 1}\)为来自\(\mathcal{D}\)的独立同分布(i.i.d.)样本。除非另有说明,基础的概率空间在记号中省略,即概率和期望指的是\(\mathcal{D}\)。形式上,我们有:
\[
(X,Y) \sim \mathcal{D}, \quad Y = f(X) + \epsilon, \quad \mathbb{E}[\epsilon \mid X] = 0, \tag{1}
\]
其中\(f\)是真实回归函数,\(\epsilon\)代表不可约误差。在平方损失下,不可约贝叶斯风险等于\(\mathrm{Var}(\epsilon)\)。学习算法表示从假设类中抽取的函数,假设类代表一组候选预测器\(\mathcal{H} = \{h_{\theta} : \mathbb{R}^d \to \mathbb{R} \mid \theta \in \Theta\}\),其中\(\Theta\)是涵盖所有可能模型配置的参数空间。没有施加特定的参数形式。贯穿全文,我们假设\(\mathcal{H}\)是可测且可分的。然后我们定义一个可测损失函数\(\ell: \mathbb{R} \times \mathbb{R} \to \mathbb{R}_{\geq 0}\),满足\(\sup_{\hat{y}, y} \ell(\hat{y}, y) \leq B < \infty\),其中\(B \geq 0\)。\( ^{1} \) 技术上,二阶矩有限就足够了(Pollard, 1984 (https://arxiv.org/html/2609.00129#bib.bib28), 例如)。

相似文章

@rohanpaul_ai: 来自剑桥大学、英伟达及其他顶尖实验室的新论文教会AI智能体和AI评判者共同改进,使任何一方都不会……

X AI KOLs Following

来自剑桥大学、英伟达及其他实验室的一篇新论文介绍了Red Queen Gödel机器,这是一种让AI智能体及其评估者共同进化以防止停滞的方法。该方法通过允许评判者在安全交接点改进来避免固定基准,从而在编程和论文写作任务中取得更好的性能。

Anthropic研究人员首次展示了自我改进AI的潜力

TechCrunch AI

Anthropic研究人员发表了一篇论文,介绍了一种自动化系统,该系统能够通过使用其他AI模型训练模型来可靠地提高AI对齐性,显示出在递归自我改进方面的潜力,并在某些场景中超越了人类研究人员。