在每集分布上训练和评估伦理强化学习智能体

arXiv cs.LG 论文

摘要

本文比较了四种训练伦理强化学习智能体的方法,在每集违规分布而非平均率上进行评估,并证明了每集保证可以在不影响平均性能的情况下实现。

arXiv:2608.14642v1 Announce Type: new 摘要:基于单一奖励信号训练的强化学习(RL)智能体会利用设计奖励与预期行为之间的差距。当我们试图将伦理行为注入RL智能体时,这尤其成问题。智能体可能在平均上看起来符合伦理,但将其违规集中在少数糟糕的剧集中,并且在某一集中受到伤害的环境生物不会因另一集的良好行为而恢复。我们在Craftax(一个开放式生存基准)中比较了四种训练伦理行为的方法。这四种方法是:带有终止的标量惩罚、线性多目标权重扫描、自适应拉格朗日约束,以及在预期标量化回报(ESR)准则下每集优化的不可补偿效用。所有方法都在单一基于检测器的协议下进行评估,该协议计算每个剧集中的所有违规行为而不进行审查。在平均回报对平均违规率的前沿上,这四种方法无法区分;但在每集上它们明显分离。在匹配的平均回报下,ESR智能体实际上在每个剧集中都保持其规定的违规预算(最差十分位为1.04 ± 0.07次违规),拉格朗日方法泄漏超出相同预算(1.14 ± 0.03),而权重扫描的最差剧集将其翻倍(2.20 ± 0.20)。一个观察增强控制将这种分离归因于训练目标而非智能体所观察到的内容,并且每集保证在平均前沿上不产生任何成本。当伦理违规不随剧集平均化时,我们认为训练和评估都必须针对每集分布而非平均值。
查看原文
查看缓存全文

缓存时间: 2026/08/18 10:18

# 在逐集分布上训练和评估伦理强化学习代理

来源:https://arxiv.org/html/2608.14642

###### 摘要

基于单一奖励信号训练的强化学习(RL)代理会利用设计奖励与预期行为之间的差距。当我们试图将伦理行为灌输给RL代理时,这尤其成为一个问题。一个代理在*平均*上看似符合伦理,但可能将其违规行为集中在少数几个糟糕的剧集中,而且环境中在某一集受到伤害的生物并不会因为代理在另一集的良好表现而得到恢复。我们在Craftax(一个开放式生存基准测试平台)中比较了四种训练伦理行为的方法。这四种方法是:带终止的标量惩罚、线性多目标权重扫描、自适应拉格朗日约束,以及在期望标量化回报(ESR)准则下逐集优化的非补偿效用函数。所有方法都在基于单一检测器的协议下进行评估,该协议计算每个剧集中每次违规行为,不做任何审查。在平均回报与平均违规率的帕累托前沿上,四种方法难以区分;但在逐集层面上则截然不同。在匹配的平均回报下,ESR代理在几乎每个剧集中都遵守其规定的预算,仅发生一次违规(最差十分位违规次数:1.04±0.07)。拉格朗日方法则会超出同一预算(1.14±0.03)。权重扫描方法最差剧集的违规次数达到其两倍(2.20±0.20)。通过观测增强控制实验证实,这种差异源于训练目标而非代理的观测内容,并且逐集保证在平均回报前沿上几乎没有代价。当伦理违规行为不会跨剧集平均消失时,我们认为训练和评估都必须针对逐集分布,而非平均值。

## 1 引言

追逐单一奖励信号的强化学习(RL)代理常常会找到设计师从未想过的方式来获得高分。这就是规格博弈,或称为奖励破解(Krakovna et al. 2020;Skalse et al. 2022),它发生在我们能写下的奖励只是我们真正关心的目标的粗略替代品时(Amodei et al. 2016)。在小型封闭任务中,其危害尚轻,但在开放式世界——最接近真实部署的环境中——则危害严重。Craftax(Matthews et al. 2024)就是这样一个世界,一个基于JAX的快速生存游戏,代理在其中收集资源、攀升科技树,并在程序生成的关卡中生存。其速度对研究来说是礼物,但也让一个未对齐的代理能够大规模地实践有害捷径。仅因进展而获得奖励的代理会剥光一片森林或为了一点分数而杀死无害的生物。

伦理训练以一种特殊的方式失败。平均违规率较低的代理,其违规行为仍可能集中在少数几个糟糕的剧集中,而某一集中造成的伤害不会因另一集的良好表现而消除。作为训练和评估标准目标的平均违规率,无法区分一个几乎均匀干净的代理与一个大部分时间完美但偶尔灾难性的代理。对于学习伦理对齐行为的目标而言,这种隐藏的尾部风险是不可接受的。

我们通过两个设计选择来应对这一挑战,首先是权衡的*形式*。我们不是采用手动调整的线性加权,而是将伦理要求形式化为一种非补偿效用,这是一种阈值词典式规则,在该规则下,任务回报仅在剧集保持在规定的违规预算内时才被计入。作为次要变体,我们通过Bradley-Terry偏好学习(Wirth et al. 2017;Christiano et al. 2017)将相同的排序*蒸馏*为可微函数。标签来源于我们自己的规则,因此这蒸馏的是明确陈述的伦理规范,而非从行为中学习伦理。第二个选择是权衡*何时*适用。效用函数可以在跨剧集平均之后应用,允许一个糟糕的剧集被好的剧集抵消;也可以在每个剧集内部应用(Roijers et al. 2013;Hayes et al. 2022)。对于伦理行为,我们采用第二种观点,因此违规行为按剧集统计,永远不会通过平均而消失。

测量需要与目标设计同等谨慎:如果我们将违规行为简化为单一平均值,我们重新引入了使罕见灾难性剧集不可见的跨剧集补偿。我们在一个共享的仅检测器环境中,对所有训练好的代理进行评分,不区分其训练方法,采用未审查的逐步计数,并报告逐集违规*分布*、其标准差、任何违规的概率以及最差十分位均值(CVaR)。在Craftax的三个困境中,我们在此协议下比较四种训练方法:带终止的标量惩罚、线性权重扫描、自适应拉格朗日约束,以及逐集非补偿目标。该目标*消除了跨剧集补偿*,因此无法通过平均伦理行为来满足,但它并不保证剧集是干净的,因为策略和环境仍然具有随机性。

我们的贡献如下:
- • 对四种伦理RL行为训练方法进行了混淆控制比较,控制变量区分了目标(ESR vs. SER)、观测(SER+Racc+R_{\mathrm{acc}})、效用来源(陈述的 vs. 蒸馏的)以及折扣近似(γ=1)。
- • 提出了一种评估方法学,包括共享的仅检测器环境、未审查计数和逐集分布度量,并论证了平均率无法区分“符合伦理”与“平均符合伦理”。
- • 在Craftax中发布了一个隔离奖励的伦理困境基准,包含三个困境×三种执行机制,并附有代码和训练流程。
- • 我们发现,基于平均前沿方法,四种方法难以区分,但在逐集层面上则清晰分离。非补偿目标在几乎每个剧集中都遵守其预算,且平均回报无代价损失,观测控制实验证实了逐集预算上限源于目标而非代理的观测内容。

## 2 相关工作

#### 规格博弈。

奖励破解,即代理利用代理奖励与预期奖励之间的差距,是一个众所周知的安全问题(Krakovna et al. 2020;Amodei et al. 2016),其精确化表述为:何时改进代理奖励会降低真实奖励(Skalse et al. 2022)。我们在一个开放世界中研究它,其中这样的捷径丰富且易于重复。

#### 多目标强化学习(MORL)。

MORL将目标保持为向量并应用效用函数进行决策(Roijers et al. 2013;Hayes et al. 2022),大多数系统使用固定权重的线性效用函数。权重扫描仅能恢复可达前沿的凸包(Vamplew et al. 2011),而非线性标量化可以到达更多点(Van Moffaert and Nowé 2014),我们明确陈述的效用函数是一种平滑的阈值词典式排序(Gábor et al. 1998)。这里更重要的是效用函数*何时*应用。在标量化期望回报(SER)下,它作用于期望之后;在期望标量化回报(ESR)下,它作用于期望之前(Roijers et al. 2018;Rădulescu et al. 2020)。我们采用ESR观点,因为伦理违规发生在单个剧集内。在算法上,我们最接近Reymond et al. (2023)的ESR actor-critic,该方法将策略条件化于已累积奖励以优化非线性效用。我们的ESR-PPO是该想法的PPO形式,是工具而非贡献,我们增加的是其编码的逐集伦理预算,以及针对线性替代方法的受控、分布层面的比较。

#### 安全与约束强化学习。

另一个传统将安全作为约束来执行。约束MDP限制期望成本(Altman 2021),许多方法遵守此类限制(García and Fernández 2015;Achiam et al. 2017),屏蔽技术直接阻止不安全动作(Alshiekh et al. 2018),但将安全性置于机制而非代理中(Ghasemi and Crowley 2026)。我们不采用这种方法,但我们实现了双上升拉格朗日法(Altman 2021;Achiam et al. 2017;Ray et al. 2019)作为首要基线,因为期望成本约束正是逐集声明所必须超越的。Saute RL(Sootla et al. 2022)通过成本预算来增强状态,以几乎必然满足硬性上限,机制上类似于我们的累积回报增强,但我们优化的是回报向量上的分级效用函数,而非单一上限。风险敏感RL通过CVaR或机会约束来控制尾部(Chow et al. 2018)。我们使用CVaR来*评估*所有方法,而非训练。

#### 从偏好中学习奖励。

基于偏好的奖励学习根据轨迹比较来拟合模型(Wirth et al. 2017),通常使用Bradley-Terry似然(Bradley and Terry 1952;Christiano et al. 2017)。学习到的内容取决于比较的来源。大多数使用人类评分者,而我们则根据手写的伦理门控规则加上单调性先验机械地生成比较。因此,我们拟合的效用函数将*蒸馏*的排序转化为可微函数,这是一项消融实验,旨在检验拟合是否优于从行为中学习伦理。用于拟合的样本池仅仅是重用了本研究其他部分训练的代理。

#### 机器伦理作为多目标问题。

对齐性被广泛地视为多元化问题(Sorensen et al. 2024;Graham et al. 2013),Vamplew et al. (2018)认为伦理、法律和安全约束是线性标量效用无法满足的竞争性目标。最接近我们的是Rodriguez-Soto et al. (2021),他们在多目标过程中嵌入伦理,但作为设计者线性地加权它,而MORAL(Peschl et al. 2022)通过人类查询调整线性权重的分布。我们的不同之处在于使用在ESR下优化的非线性效用,因此每个剧集都单独评判,而非线性正是让违规行为抵抗平均化的关键。我们在Craftax(Matthews et al. 2024)中运行,这是一个基于JAX的开放式基准测试,继承了Crafter(Hafner 2022)和NetHack(Küttler et al. 2020)的谱系,其速度可作为压力测试各种东西的工具。

## 3 训练方法

### 3.1 问题设定与优化准则

我们将每个困境建模为一个具有二维奖励的多目标MDP⟨S,A,P,r,γ⟩⟨𝒮,𝒜,P,𝐫,γ⟩,其中𝐫ₜ = [rₑₓₜ,ₜ, rₑₜₕ,ₜ]。这里rₑₓₜ,ₜ是原生游戏奖励,而rₑₜₕ,ₜ ∈ {0, −ρ}是伦理惩罚,仅当在步骤t发生自身困境违规时才非零,ρ=10。每个效用函数随后引用Gτ(剧集的无折扣向量回报):

Gτ = [Rₑₓₜ, Rₑₜₕ] = ∑ₜ₌₀ᵀ⁻¹ 𝐫ₜ (1)
效用函数u: ℝ²→ℝ将向量转化为一个可优化的数字,两个优化准则的不同之处在于期望的位置(Roijers et al. 2013;Hayes et al. 2022):

V^π_SER = u(𝔼τ∼π[Gτ]), V^π_ESR = 𝔼τ∼π[u(Gτ)] (2)
对于线性效用u(g) = w⊤g,根据期望的线性性质,两者一致。它们只对非线性u不同。SER允许跨剧集补偿(一个糟糕的剧集被好的剧集抵消),而ESR根据每个剧集的总回报进行评判。两个结构性事实塑造了实验。首先,对于任何固定的w⪰0,w⊤𝔼[Gτ]的最优解位于可达期望回报集合的凸包上,因此权重扫描只能恢复凸包点(Roijers et al. 2013;Vamplew et al. 2011),尽管非线性标量化可以表达更多(Van Moffaert and Nowé 2014)。其次,也是决定如何解读结果的关键,*任何*在状态-动作占用测度上是线性的统计量,包括平均回报-违规率前沿本身,都无法区分逐集目标与期望内的目标。这种区分如果存在,必须出现在逐集分布的高阶矩中。我们的评估正是围绕这一点设计的。

### 3.2 困境与伦理惩罚层

我们在Craftax(Matthews et al. 2024)中工作,代理最大化原生游戏奖励(成就分数加生命值塑造)。在此之上我们定义了三个困境,每个困境都是一种不道德行为确实能获得更多分数的情况。

在**禁止杀戮**困境中,被动生物(牛、蝙蝒、蜗牛)是容易获取的食物,违规行为是杀死它们,而种植(种植和食用植物)是一种可行的伦理替代方案,因此存在高回报的伦理策略。

在**可持续性**困境中,木材很有价值,每采集超过每集预算8单位(低于非约束代理的典型采集量,因此约束有效)都是一次违规。

在**比例武力**困境中,猎杀怪物清理区域很容易,但违规行为是杀死超过5格远的敌对生物(近战或远程),而较近距离的击杀则被视为防御性行为。

伦理层是一个事件触发的惩罚包装器。一个原生JAX检测器对每个步骤进行分类,剧集自身困境的违规事件将收到一个固定的−10惩罚。

相似文章

深度强化学习中的性能变异

arXiv cs.LG

本文指出了深度强化学习中传统不确定性估计的局限性,并提出基于百分位数的统计量和可视化方法,以更好地评估运行间性能变异。案例研究展示了该方法在PPO、SAC、TD-MPC、DQN和Rainbow算法上的应用。

强化学习:迈向广泛且持续有益的人工智能模型

arXiv cs.AI

这篇来自OpenAI的论文研究了基于有益行为的强化学习能否产生超越训练分布的广泛且持久的对齐泛化。通过使用一个包含真实场景的数据集,他们表明,对有益特质进行强化训练能够提升分布外的对齐能力,并增强对对抗性攻击的持久抵抗力。