基于电路锚点的安全进化

arXiv cs.CL 论文

摘要

本文提出了电路锚定进化(CAE),一种利用机制可解释性在大语言模型自我进化过程中识别并锚定一个微型安全电路的方法,防止模型误进化为能力强但危险的系统,同时保持能力。

arXiv:2608.05158v1 公告类型:新 摘要:在生物进化中,不受限制的突变可能导致灾难性后果:生物体可能进化出增强的能力,同时丧失生存所必需的功能。自然的解决方案是\textit{发育约束}(developmental constraints),即核心调控基因保持锚定,而外围基因自由适应。我们观察到,当前大语言模型的自我进化算法缺乏类似的约束。它们纯粹优化能力,隐含地假设安全会被保留。我们的实验揭示这一假设是危险错误的:模型可能\textit{误进化}(misevolve)为强大而危险的实体。受Hox基因在$500$亿年进化中锚定身体结构的启发,我们提出了\textbf{电路锚定进化(CAE)}。利用机制可解释性,我们识别出一个微型\textit{安全电路},仅占模型特征的不到$2$\%,它对安全行为具有因果中介作用。我们在进化过程中锚定该电路,将其限制在一个小的位移范围内,同时允许其余特征自由进化。这镜像了生物学原理\textit{带约束的可进化性}:保留必要部分,同时适应外围部分。跨越$3$个模型家族和两种进化算法的实验表明,CAE实现了卓越的安全保留和最小的能力损失,在有效性和效率上都大幅优于显式基于奖励的约束。正如发育约束防止生物进化产生不可行的生物体,电路锚定防止模型进化产生有能力但危险的系统。
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:49

## 基于电路锚点的安全进化
来源:https://arxiv.org/html/2608.05158
Yan Liu 香港中文大学 runningmelles@gmail\.com & Jie Fu IQuest Research & Tsung\-Yi Ho 香港中文大学 tyho@cse\.cuhk\.edu\.hk

###### 摘要

在生物进化中,不受约束的突变可能导致灾难性后果:生物体可能进化出增强的能力,却同时丧失生存所必需的功能。自然的解决方案是**发育约束**:核心调控基因保持锚定,而外围基因自由适应。我们观察到,当前大语言模型的自进化算法缺乏类似的约束。它们纯粹追求能力优化,隐含假设安全性会被保留。我们的实验揭示这一假设危险地错误:模型可能**误进化**为强大而危险的实体。受Hox基因在5亿年进化中锚定身体结构的启发,我们提出**电路锚点进化(Circuit\-Anchored Evolution, CAE)**。利用机械可解释性,我们识别出一个微小安全电路,其包含的模型特征不足2%,却在因果上介导了安全行为。我们在进化过程中锚定该电路,将其限制在较小的位移范围内,同时允许其余特征自由进化。这体现了生物学中“有约束的可进化性”原理:在适应性改变外围部分的同时,保留核心要素。在3个模型家族和两种进化算法上的大量实验表明,CAE以最小的能力损失实现了更优的安全保留,在有效性和效率上均显著优于基于显式奖励的约束。正如发育约束防止生物进化产生不可成活的有机体,电路锚点防止模型进化产生有能力但危险的系统。

## 1 引言

进化是一把双刃剑[26 (https://arxiv.org/html/2608.05158#bib.bib7),14 (https://arxiv.org/html/2608.05158#bib.bib8),30 (https://arxiv.org/html/2608.05158#bib.bib9)]。在生物学中,它产生了非凡的适应性,从鹰的眼睛到人类的大脑[8 (https://arxiv.org/html/2608.05158#bib.bib10),44 (https://arxiv.org/html/2608.05158#bib.bib11)]。但不受约束的进化也可能产生怪物:能力增强但有致命缺陷的有机体[1 (https://arxiv.org/html/2608.05158#bib.bib12)]。如果一个突变增强了肌肉力量,却同时破坏心脏发育,那么这个突变毫无意义。自然界实现安全进化的解决方案优雅而简洁:在进化过程中锚定关键基因。一小部分**主控调控基因**,例如控制身体构型的Hox基因[19 (https://arxiv.org/html/2608.05158#bib.bib14),23 (https://arxiv.org/html/2608.05158#bib.bib13)],在数亿年间被严格保守[28 (https://arxiv.org/html/2608.05158#bib.bib15)]。这些基因锚点确保进化在探索新能力时,不会损害基本的生存能力。Hox基因的突变几乎总是致命的[13 (https://arxiv.org/html/2608.05158#bib.bib16)],并在其传播之前就被净化选择[4 (https://arxiv.org/html/2608.05158#bib.bib17)]所清除。正是这种“有约束的可进化性”原则[36 (https://arxiv.org/html/2608.05158#bib.bib18)],使物种能够在不自我毁灭的情况下适应环境。

人工智能如今也在经历自己的进化过程[12 (https://arxiv.org/html/2608.05158#bib.bib20),40 (https://arxiv.org/html/2608.05158#bib.bib19)]。对通用人工智能(AGI)的追求日益拥抱自进化范式[46 (https://arxiv.org/html/2608.05158#bib.bib4),45 (https://arxiv.org/html/2608.05158#bib.bib5)]。最近的进展表明,此类方法可以在推理[10 (https://arxiv.org/html/2608.05158#bib.bib21),27 (https://arxiv.org/html/2608.05158#bib.bib22)]方面带来显著提升,超越在静态人工策划数据集上训练的模型。然而,这一进展引入了关键却常被忽视的风险。当前的自进化算法完全不受约束地运行,仅针对任务性能进行优化,没有任何机制来保持与人类价值观的一致。

图1:我们方法的概述。Transcoder将MLP激活分解为可解释的特征,揭示功能上不同的电路。CAE通过有针对性的约束保留安全电路,同时允许其他电路自由进化。

这为**误进化**创造了巨大可能,即模型朝着意想不到的方向进化,产生不良甚至有害的行为[34 (https://arxiv.org/html/2608.05158#bib.bib1)]。随着模型通过自进化变得越来越强大,这种不受约束的进化构成了严重威胁。如果没有适当的保障措施,我们可能创造出能力强大且根本危险的系统。

机械可解释性的最新进展表明,模型行为定位于特定电路[41 (https://arxiv.org/html/2608.05158#bib.bib47)]。生物学类比启发了我们的方法:**电路锚点进化(CAE)**。如图1 (https://arxiv.org/html/2608.05158#S1.F1)所示,利用基于transcoder的分析[7 (https://arxiv.org/html/2608.05158#bib.bib23)],我们识别出一个**微小安全电路**:一组稀疏的特征,占总特征的比例不足2%,却在因果上对安全行为负责。和Hox基因一样,这个安全电路微小但关键;破坏它会导致灾难性后果。我们不是将安全视为与能力竞争的最优化目标,而是通过约束KL散度来**锚定**进化中的安全电路。该约束充当人工净化选择,阻止会破坏安全电路的“突变”。其余特征如同外围基因,可以自由进化,不受约束。

我们的电路锚点是对内部结构施加的**隐式**约束,而**显式**约束则通过奖励模型监督外部行为。为理解其权衡,我们系统比较了这两种范式。通过在多种模型和进化算法上的大量实验,我们发现隐式锚定显著优于显式监督。电路锚定在实现更高安全保留的同时,能力损失极小,计算开销也显著更低。正如发育约束使生物物种能够进化出新的适应性而不丧失生存能力,电路锚点使语言模型能够进化出新能力而不丧失安全性。

## 2 预备知识

### 2.1 记号

设 \(M_{\theta}:\mathcal{X}\to\mathcal{Y}\) 表示由参数 \(\theta\in\Theta\) 参数化的大语言模型,其中 \(\mathcal{X}\) 是输入序列空间,\(\mathcal{Y}\) 是输出序列空间。对于输入 \(x\in\mathcal{X}\),我们将在层 \(l\in[L]:=\{1,\ldots,L\}\) 的隐藏状态记为 \(h_{l}(x;\theta)\in\mathbb{R}^{d}\)。我们用 \(\pi_{\theta}(\cdot|x)\) 表示下一个词符的输出分布。文中,我们使用 \(\|\cdot\|\) 表示 \(\ell_{2}\) 范数,用 \(D_{KL}(\cdot\|\cdot)\) 表示Kullback-Leibler散度。

### 2.2 Transcoder与特征分解

我们采用Dunefsky等人[7 (https://arxiv.org/html/2608.05158#bib.bib23)]提出的transcoder框架,该框架将MLP激活分解为可解释的稀疏特征向量。

**定义 1(Transcoder)**。对于层 \(l\),transcoder \(\mathcal{T}_{l}=(E_{l},D_{l})\) 由一个编码器 \(E_{l}:\mathbb{R}^{d}\to\mathbb{R}^{K}\) 和一个解码器 \(D_{l}:\mathbb{R}^{K}\to\mathbb{R}^{d}\) 组成,其训练目标是满足 \(h_{l}(x;\theta)\approx D_{l}(E_{l}(h_{l}(x;\theta)))+\epsilon_{l}(x)\),其中 \(\epsilon_{l}(x)\) 是残差误差项。编码器产生稀疏特征激活向量 \(f_{l}(x;\theta):=E_{l}(h_{l}(x;\theta))\in\mathbb{R}^{K}\),其中 \(K\gg d\) 且 \(\|f_{l}(x;\theta)\|_{0}\ll K\)。

**定义 2(跨层特征向量)**。对于具有 \(L\) 层和transcoder \(\{\mathcal{T}_{l}\}_{l=1}^{L}\) 的模型,我们定义拼接特征向量为 \(f(x;\theta):=\bigoplus_{l=1}^{L}f_{l}(x;\theta)\in\mathbb{R}^{LK}\),其中 \(\oplus\) 表示拼接。我们将单个特征索引为 \(f^{(l,k)}(x;\theta)\),其中 \(l\) 为层编号,\(k\) 为特征索引。

### 2.3 自进化训练

我们考虑一般的自进化训练框架,其中模型通过从自身生成的数据中学习来迭代改进。我们首先形式化两个代表性算法,然后说明它们具有共同的数学结构。

#### 2.3.1 基于GRPO的进化(EVOL\-RL)

参照[35 (https://arxiv.org/html/2608.05158#bib.bib42)],组相对策略优化(GRPO)为每个提示 \(q\) 生成 \(G\) 个响应 \(\{o_{1},\ldots,o_{G}\}\),并计算归一化优势值:
\[
\hat{A}_{i}=\frac{r_{i}-\mathrm{mean}(r_{1},\ldots,r_{G})}{\mathrm{std}(r_{1},\ldots,r_{G})}
\tag{1}
\]
策略通过截断替代目标进行更新:
\[
\mathcal{L}_{\text{GRPO}}(\theta)=\frac{1}{G}\sum_{i=1}^{G}\frac{1}{|o_{i}|}\sum_{t=1}^{|o_{i}|}\min\left\{\rho_{i,t}\hat{A}_{i,t},\mathrm{clip}(\rho_{i,t},1-\epsilon,1+\epsilon)\hat{A}_{i,t}\right\}
\tag{2}
\]
其中 \(\rho_{i,t}=\frac{\pi_{\theta}(o_{i,t}|q,o_{i,<t})}{\pi_{\theta_{\text{old}}}(o_{i,t}|q,o_{i,<t})}\) 是重要性比,\(o_{i,t}\) 是响应 \(o_{i}\) 的第 \(t\) 个词符。

#### 2.3.2 基于无监督自我反思的进化(Abs\-ZERO)

参照[46 (https://arxiv.org/html/2608.05158#bib.bib4)],Abs\-ZERO通过无监督生成、反思和改进来迭代进化:
\[
\text{生成:} \quad \tilde{o}_{i}\sim\pi_{\theta}(\cdot|q)
\]
\[
\text{反思:} \quad c_{i}\sim\pi_{\theta}(\cdot|q,\tilde{o}_{i},\text{prompt}_{\text{reflect}})
\]
\[
\text{改进:} \quad o_{i}\sim\pi_{\theta}(\cdot|q,\tilde{o}_{i},c_{i},\text{prompt}_{\text{improve}})
\]
并基于自生成数据上的加权最大似然目标进行优化:
\[
\mathcal{L}_{AZ}(\theta)=\mathbb{E}_{(q,o)\sim\mathcal{D}_{\text{self}}}\left[\sum_{t=1}^{|o|}\log\pi_{\theta}(o_{t}|q,o_{<t})\right]
\tag{3}
\]

#### 2.3.3 统一形式化

我们将自进化算法的公共结构抽象为:
\[
\min_{\theta}\mathcal{L}_{\text{evol}}(\theta)
\]
其中 \(\mathcal{L}_{\text{evol}}\) 是面向任务的目标函数。同时,我们假设存在一个安全指标函数 \(\mathcal{M}_{\text{safety}}\),其随进化而变化。我们的框架适用于任何 \(\mathcal{L}_{\text{evol}}\) 关于 \(\theta\) 可微且满足标准平滑性假设的算法。

### 2.4 问题定义

我们旨在解决自进化中的安全性退化问题。形式上,给定一个初始安全对齐的模型 \(\theta_{0}\),一个有害提示分布 \(\mathcal{D}_{\text{harm}}\),以及一个表示拒绝有害请求的目标响应 \(y_{\text{refuse}}\),我们定义安全性退化为:存在 \(T>0\) 使得:
\[
\mathbb{E}_{x\sim\mathcal{D}_{\text{harm}}}\left[\pi_{\theta^{(T)}}(y_{\text{refuse}}|x)\right]<\mathbb{E}_{x\sim\mathcal{D}_{\text{harm}}}\left[\pi_{\theta_{0}}(y_{\text{refuse}}|x)\right]-\delta
\tag{4}
\]
其中 \(\delta>0\)。我们的目标是设计一个进化框架,在最大化任务性能的同时,可证明地约束安全性退化。

算法1 电路锚点进化(CAE)
```
输入:安全对齐的模型 θ0,transcoder {Tl}l=1L,安全电路 S,约束权重 λ,学习率 η,进化目标 Levol
输出:具有保留安全性的进化模型 θ(T)
1: 初始化 θ←θ0
2: 缓存参考激活:{fS(x;θ0)}x∈Dref
3: for t=1 to T do
4:   // 标准进化步骤
5:   计算进化梯度:gevol←∇θLevol(θ)
6:   // 电路锚点步骤
7:   从参考分布采样 {xm}m=1M
8:   for each xm do
9:     通过冻结的transcoder计算当前激活:fS(xm;θ)
10:    计算KL:lm←∑(l,k)∈S DKL(f(l,k)(xm;θ0)∥f(l,k)(xm;θ))
11:   end for
12:   计算锚定梯度:ganchor←(1/M)∑m ∇θ lm
13:   // 组合更新
14:   θ←θ+η(gevol−λ⋅ganchor)
15: end for
16: return θ(T)
```

## 3 电路锚点进化

我们在算法1 (https://arxiv.org/html/2608.05158#alg1)中总结了完整的CAE流程。

### 3.1 安全电路识别

我们利用电路追踪方法[15 (https://arxiv.org/html/2608.05158#bib.bib43)]来识别在因果上负责安全行为的特征。

**定义 5(归因分数)**。对于特征 \((l,k)\) 和目标对数概率 \(y\),直接归因分数定义为:
\[
\alpha_{y}^{(l,k)}(x;\theta):=\frac{\partial\log\pi_{\theta}(y|x)}{\partial f^{(l,k)}(x;\theta)}\cdot f^{(l,k)}(x;\theta)
\tag{5}
\]
这衡量特征 \((l,k)\) 对输出 \(y\) 概率的因果贡献。

**定义 6(安全电路)**。给定安全对齐的模型 \(\theta_{0}\)、有害提示集 \(\mathcal{D}_{\text{harm}}\) 和阈值 \(\gamma>0\),安全电路定义为:
\[
\mathcal{S}:=\left\{(l,k):\mathbb{E}_{x\sim\mathcal{D}_{\text{harm}}}\left[\alpha_{y_{\text{refuse}}}^{(l,k)}(x;\theta_{0})\right]\ge\gamma\right\}
\tag{6}
\]
我们将 \(f_{\mathcal{S}}(x;\theta):=\{f^{(l,k)}(x;\theta)\}_{(l,k)\in\mathcal{S}}\) 记为安全特征向量。

### 3.2 特征空间锚定

我们现在介绍我们的核心贡献:在进化过程中保持安全电路激活的约束。

**定义 8(电路激活分布)**。对于给定的输入分布 \(p(x)\) 和安全电路 \(\mathcal{S}\),我们将电路激活分布定义为:
\[
P_{\theta}^{\mathcal{S}}(f_{\mathcal{S}}):=\mathbb{E}_{x\sim p(x)}\left[\mathbf{1}[f_{\mathcal{S}}(x;\theta)=f_{\mathcal{S}}]\right]
\tag{7}
\]
在实践中,我们将 \(f_{\mathcal{S}}(x;\theta)\) 视为该分布的样本。

**定义 9(电路锚定目标)**。电路锚点进化(CAE)目标通过在基础进化损失上增加电路级KL约束:
\[
\mathcal{L}_{\text{CAE}}(\theta):=\mathcal{L}_{\text{evol}}(\theta)-\lambda\cdot\mathcal{L}_{\text{anchor}}(\theta)
\tag{8}
\]
其中:
\[
\begin{aligned}
\mathcal{L}_{\text{anchor}}(\theta)&:=D_{KL}\left(P_{\theta_{0}}^{\mathcal{S}}\|P_{\theta}^{\mathcal{S}}\right)\\
&=\mathbb{E}_{x\sim p(x)}\left[\sum_{(l,k)\in\mathcal{S}}D_{KL}\left(f^{(l,k)}(x;\theta_{0})\|f^{(l,k)}(x;\theta)\right)\right]
\end{aligned}
\tag{9}
\]
且 \(\lambda>0\) 是控制约束强度的超参数。

### 3.3 针对特定算法的实例化

CAE框架与算法无关,可以针对满足第2.3.3 (https://arxiv.org/html/2608.05158#S2.SS3.SSS3)节条件的任何自进化算法进行实例化。

##### 基于GRPO进化的CAE。
对于EVOL\-RL,我们在GRPO目标(式2 (https://arxiv.org/html/2608.05158#S2.E2))上增加约束:
\[
\mathcal{L}_{\text{CAE-GRPO}}(\theta)=\mathcal{L}_{\text{GRPO}}(\theta)-\lambda\cdot\mathcal{L}_{\text{anchor}}(\theta)
\tag{10}
\]

##### 针对Abs\-ZERO的CAE。
对于Abs\-ZERO,我们在联合目标(式3 (https://arxiv.org/html/2608.05158#S2.E3))上增加约束:
\[
\mathcal{J}_{\text{CAE-AZ}}(\theta)=\mathcal{J}_{\text{AZ}}(\theta)-\lambda\cdot\mathcal{L}_{\text{anchor}}(\theta)
\]

相似文章

具有随时有效证书的自演化代理

arXiv cs.AI

本文介绍了SEA,一种用于自演化代理的架构,它将自我修改限制在转向适配器和围绕冻结基础模型的版本化框架上,并使用随时有效门(anytime-valid gates)来根据固定错误预算审计修改。在SWE-bench Verified上使用四个基础模型进行的实验表明,该套件在强基础模型上提供了+4%到+5%的提升,同时防止了性能回退。

EvoCause:LLM引导的因果图演化用于根因分析

arXiv cs.LG

EvoCause是一篇研究论文,提出了一种LLM引导的方法来优化因果图以进行根因分析,利用专家诊断标签来约束图的编辑,并发布了TeleRCA,这是一个来自生产电信网络的专家标注告警基准。