面向风险感知AutoRL的高效异方差贝叶斯优化

arXiv cs.LG 论文

摘要

提出ERAHBO,一种用于强化学习中风险感知超参数优化的高效异方差贝叶斯优化方法,通过自适应重采样相比固定预算方法提高了样本效率。

arXiv:2607.26680v1 Announce Type: new 摘要:强化学习(RL)在广泛复杂任务中取得了显著成功。然而,RL结果可能高度随机,预期性能和变异性通常依赖于超参数(HP)配置。我们提出高效且风险厌恶的异方差贝叶斯优化(ERAHBO),这是一种贝叶斯优化方法,将学习结果的均值和方差建模为HP配置的函数。ERAHBO旨在识别能够实现高平均回报同时减少训练运行间变异性的HP配置,并通过自适应重采样(而非每个HP的固定预算)提高HP优化的样本效率。跨多种RL算法和环境的实证评估表明,ERAHBO通常优于风险中性和风险厌恶基线,为风险厌恶回报提供了改进的样本效率。
查看原文
查看缓存全文

缓存时间: 2026/07/30 10:00

# 高效异方差贝叶斯优化用于风险感知自动化强化学习 来源: https://arxiv.org/html/2607.26680

# 高效异方差贝叶斯优化用于风险感知自动化强化学习

Mingxuan Che, Tsung-Yuan Tseng, Theresa Eimer, Marius Lindauer, Alexander von Rohr

**关键词:** 贝叶斯优化, 强化学习, 自动化强化学习

**摘要**  
强化学习 (RL) 的学习结果可能具有高度的随机性,且期望性能与变异性往往很大程度上取决于超参数 (HP) 配置。这使得超参数优化 (HPO) 变得脆弱:结果的变异性转化为 HPO 后训练失败的实际风险。  
我们通过均值-方差目标函数提出风险感知 HPO,称为高效且风险规避的异方差贝叶斯优化 (ERAHBO)。它对均值和方差同时建模,并通过自适应重采样(而非每个 HP 配置的固定复制预算)来提高样本效率。我们证明,这种自适应策略在广泛的 RL 环境中提升了效率和 HPO 性能。此外,我们还提供了一个 RL 学习结果的离线数据集,该数据集将 HP 配置映射到每个 HP 配置 50 次重复运行后的训练后策略回报,以评估风险感知 HPO 方法。

**贡献**  
1. 我们提出了高效且风险规避的异方差贝叶斯优化 (ERAHBO),这是 RAHBO (makarova2021risk) 的一种自适应重采样形式,提高了 RL 中 HPO 的实际样本效率。我们提供了次线性遗憾保证,并与常见的贝叶斯优化 (BO) 基线进行了实证比较。  
   **背景:** 为了将风险纳入优化过程,我们需要重复评估每个超参数配置。RAHBO 为每个配置设置了固定的评估次数,这在强化学习这种运行时密集的领域中计算成本高昂。  
2. 我们提供了一个 RL 学习结果数据集,将超参数映射到 50 次运行的训练后策略回报,从而能够对风险感知超参数优化方法进行可重复的基准测试。  
   **背景:** 最近的 HPO 性能数据集(如 HPO-RL-Bench (shala-automl24a) 和 ARLBench (becktepe2024arlbench))包含每个配置的重复评估,但每个超参数配置的种子数(最多十个)可能不足以可靠地估计整个超参数空间中的异方差方差。我们的数据集通过为每个配置提供 50 个种子来解决这一问题。

###### 摘要  
强化学习 (RL) 在广泛的复杂任务中取得了显著成功。然而,RL 结果可能高度随机,且期望性能与变异性往往取决于超参数 (HP) 配置。我们提出了高效且风险规避的异方差贝叶斯优化 (ERAHBO),这是一种贝叶斯优化方法,它对学习结果的均值和方差作为 HP 配置的函数进行建模。ERAHBO 旨在识别能在训练运行间实现高平均回报同时降低变异性的 HP 配置,并通过自适应重采样(而非每个 HP 的固定预算)提高 HP 优化的样本效率。跨多种 RL 算法和环境的实证评估表明,ERAHBO 通常优于风险中性和风险规避的基线,为风险规避回报提供了更好的样本效率。

## 1 引言  
强化学习 (RL) 算法的性能通常高度依赖于超参数 (HP) 的选择 (berkenkamp2016safe; islam2017reproducibility; henderson-aaai18a; zhang-aistats21a; eimer-icml23a; obandoceron-rlj24)。此外,在大多数 RL 实验中,固有的随机性源于如随机任务行为、探索性选择或硬件非确定性 (zhuang2022randomness)。最近的研究表明,即使是非常好的 HP 配置也可能导致学习结果的高度随机性 (dierkes-ewrl25)。自动化强化学习 (AutoRL) 旨在通过自动化超参数设置等方式使 RL 开箱即用地可靠工作。然而,RL 训练的随机性使得自动超参数优化变得脆弱:在 HPO 期间表现最佳的配置可能在后续运行中无法重现其性能,而高方差的 HP 配置可能以不可忽略的概率产生较差的策略,需要昂贵的重新训练。在实践中,我们希望 HPO 返回的配置能在运行间可靠地实现强性能,以支持可重复且经济高效的 RL 实验。因此,一个重要研究问题是如何高效地提取能一贯带来良好性能(即在重复训练运行间具有高平均回报和低变异性)的 HP 配置。

贝叶斯优化 (BO) 是一种样本高效的、基于模型的 HPO 方法,非常适合昂贵的黑盒目标函数,并广泛用作手动调优和搜索启发式方法的自动化替代方案 (bischl-dmkd23a)。然而,经典的 BO 方法通常优化目标函数的均值,在 RL 中通常是期望的最终回报。这忽略了每个超参数配置在运行间的训练稳定性,即其风险。将这一概念纳入 HPO 的一种自然方法是使用风险感知的贝叶斯优化方法,这些方法显式地对平均性能和与输入相关的结果变异性进行建模,并优化一个风险敏感的目标函数。特别地,风险规避异方差贝叶斯优化 (RAHBO; makarova2021risk) 提供了一种原则性的顺序 BO 方法,该方法为回报的均值和方差分别维护代理模型,并使用风险感知的采集函数。因此,RAHBO 可用于风险感知的 HP 调优。然而,在其原始形式中,方差模型的估计依赖于每个 HP 配置的静态评估次数(重复数),这在 RL 中每次运行计算成本高昂的情况下可能效率低下。

我们提出了一种新颖的自适应复制策略用于 RAHBO,该策略决定何时获取更多配置的样本。关键思想是将运行分配给最重要的地方:那些在风险感知目标下前景看好但由于不确定性仍然模糊的配置,而不是在每个地方都花费统一的复制预算(见图 1 (https://arxiv.org/html/2607.26680#S2.F1))。我们提出的方法是一种高效的风险规避异方差贝叶斯优化 (ERAHBO) 算法,专为 RL 中常见的高方差和同时高计算负载而设计。为了支持 AutoRL 中风险的研究,我们整理了一个新的 RL 学习结果数据集,涵盖不同的算法和环境,从而能够系统分析 RL 超参数中的异方差性,并对风险感知 HPO 方法进行基准测试。

## 2 问题形式化  
参照图标题  
图 1: ERHABO 中的自适应重采样。左图:示例目标,两个不同噪声水平的极大值,以及 MV 目标(虚线)。中间图:三个配置后 MV 目标的上、下置信界(虚线)以及当前最优 LCB(蓝点划线);下一个查询点 \(x_t\)(通过 UCB 选取)由绿色竖线表示。右图:在 \(x_t\) 处再取两个样本后,UCB 低于当前最优 LCB,因此 ERHABO 无需重采样。

我们考虑一个折扣马尔可夫决策过程 (MDP)。一个(随机)策略 \(\pi(a \mid s)\) 诱导出轨迹上的分布 \(\tau \sim \pi(\tau)\)。固定策略 \(\pi\) 的性能为其期望折扣回报 \(J(\pi):=\mathbb{E}_{a \sim \pi}\Big[\sum_{t=0}^{\infty} \gamma^t r(s_t, a_t)\Big]\),其中 \(\gamma \in (0,1)\) 是折扣因子,\(r(s,a)\) 是奖励函数。在 RL 的 HPO 中,决策变量是学习算法 \(\mathcal{A}\) 的超参数配置 \(x \in \mathcal{X} \subset \mathbb{R}^d\),结果是用 \(x\) 运行 \(\mathcal{A}\) 产生的训练后策略。由于 RL 训练本质上是随机的(例如随机初始化、探索以及训练过程中遇到的随机性),用固定配置 \(x\) 运行 \(\mathcal{A}\) 会诱导出学习策略上的分布。我们将学习结果建模为 \(\pi \sim \mathcal{A}(\pi; x)\)。

关键地,我们考虑的随机性是训练引起的*学习结果* \(\pi\)(以及因此 \(J(\pi)\))的随机性。我们将风险感知 HPO 形式化为最大化期望学习结果,同时惩罚学习结果间的变异性:
\[
x^* \in \underset{x \in \mathcal{X}}{\mathrm{argmax}} \ \mathbb{E}_{\pi \sim \mathcal{A}(\pi; x)}\big[J(\pi)\big] - \alpha \mathbb{V}ar_{\pi \sim \mathcal{A}(\pi; x)}\big[J(\pi)\big],
\tag{1}
\]
其中 \(\alpha \ge 0\) 定义了均值与方差之间的权衡。为简化符号,定义平均性能
\[
f(x) := \mathbb{E}_{\pi \sim \mathcal{A}(\pi; x)}\big[J(\pi)\big].
\tag{2}
\]

在贝叶斯优化 (BO) 中,我们考虑具有未知目标函数 \(f: \mathcal{X} \to \mathbb{R}\) 的顺序交互问题。在每个 BO 轮次 \(t\),算法选择 \(x_t \in \mathcal{X}\),运行一次训练得到 \(\pi_t \sim \mathcal{A}(\pi; x_t)\),并观察学习结果的一个实现
\[
y_t := J(\pi_t) = f(x_t) + \xi(x_t),
\tag{3}
\]
其中 \(\xi(x_t)\) 是零均值噪声项,捕捉学习算法 \(\mathcal{A}\) 在使用超参数 \(x_t\) 训练时的随机性(即使用相同 HP \(x_t\) 独立执行 RL 训练之间的变异性),且在不同轮次 \(t\) 之间独立。在下文中,当指代一般 \(x\) 或含义从上下文明确时,我们省略下标 \(t\)。因此,
\[
\mathbb{V}ar\!\left[\xi(x)\right] = \mathbb{V}ar_{\pi \sim \mathcal{A}(\pi; x)}\big[J(\pi)\big].
\tag{4}
\]

遵循 makarova2021risk,我们假设 \(f\) 属于由核 \(\kappa(\cdot, \cdot)\) 诱导的再生核希尔伯特空间 (RKHS) \(\mathcal{H}_\kappa\),且 \(\kappa(x, x') \le 1\) 对所有 \(x, x' \in \mathcal{X}\) 成立,并且 \(\|f\|_\kappa \le \mathcal{B}_f\) 对于某个 \(\mathcal{B}_f > 0\)。我们进一步假设 \(\xi(x)\) 是次高斯的,具有(可能依赖于输入的)方差代理 \(\rho^2(x)\),且一致有界为 \(\rho(x) \in [\underline{\rho}, \overline{\rho}]\),其中 \(\overline{\rho} \ge \underline{\rho} > 0\)。遵循 sani2012risk, makarova2021risk 和 dai2023batch,具有方差代理 \(\rho^2(x)\) 的均值-方差目标函数为
\[
\mathrm{MV}(x) = f(x) - \alpha \rho^2(x),
\tag{5}
\]
其中固定的 \(\alpha \ge 0\) 表示用户定义的风险规避程度。我们寻求一个评估序列 \(\{x_t\}_{t=1}^T\),使其在 \(T\) 个 BO 轮次内获得风险规避目标 \(\mathrm{MV}(x)\) 的高值。由于每个轮次 \(t\) 使用 \(x_t\) 收集 \(k_t\) 个独立样本(训练运行),我们通过样本计数累积遗憾来评估性能:
\[
R_T := \sum_{t=1}^T k_t \Big( \mathrm{MV}(x^*) - \mathrm{MV}(x_t) \Big), \quad \text{其中} \quad x^* \in \arg \max_{x \in \mathcal{X}} \mathrm{MV}(x).
\tag{6}
\]

## 3 相关工作  
本节简要概述用于超参数优化 (HPO) 的贝叶斯优化 (BO),重点放在具有随机性和配置相关结果的设置上,然后将这些想法与 RL 的 HPO 联系起来,在 RL 中训练变异性通常很大。

网格搜索和随机搜索是 HPO 的简单基线,但当 HP 空间的维度增长时,它们变得低效 (bergstra-jmlr12a)。贝叶斯优化 (garnett-book23a) 通过拟合代理模型并顺序选择评估点 (bergstra-nips11a; snoek-nips12a-replace; springenberg-nips16a),提高了昂贵黑盒目标函数的样本效率。它是许多广泛使用的 HPO 方法的基石 (akiba-kdd19a; lindauer-jmlr22a; song2024vizier)。

RL 训练中显著的运行间变异性已在先前工作中被记录 (henderson-aaai18a; obandoceron-rlj24),并促使系统且高效的 HPO 方法的发展。RL 的 HPO 是一个新兴领域(参见 parkerholder-jair22a 的概述),但由于高昂的计算开销和随机学习结果 (agarwal2021deep; eimer-icml23a)(这些结果源于训练不稳定性 (dierkes-ewrl25)),提出了挑战。在这种背景下,仅优化期望性能(通常通过少量训练运行近似 (parkerholder-neurips20a; wan-automl22a))可能无法捕捉运行间的可靠性。我们的目标是提供一种目标函数和优化策略,能够更好地定位 RL 中可靠的 HP 配置。

许多经典的 BO 方法假设同方差噪声,而错误的噪声假设会降低 BO 性能。异方差高斯过程模型显式地捕捉依赖于输入的噪声 (binois2018practical; binois2019replication),但仅对方差建模并不能阻止 BO 选择那些学习结果具有不希望的高变异性的配置。为了解决这个问题,风险感知 BO 方法优化那些显式权衡平均性能与变异性的目标函数。先前的工作考虑了用于异方差 BO 的均值-方差目标函数 (makarova2021risk; dai2023batch)。特别是,RAHBO (makarova2021risk) 使用每个配置的固定评估预算来估计变异性,这效率低下,因为它将大量资源分配给评估表现不佳的配置。dai2023batch 解决了批次设置中的自适应评估问题。在本文中,我们评估了 RAHBO 用于 RL 问题的 HPO,并用一种自适应评估策略扩展了它,该策略加速了许多 HPO 任务上的优化过程。

## 4 方法  
本节描述我们在异方差训练结果下进行风险感知 HPO 的方法。我们首先介绍 RAHBO (makarova2021risk) 的基本建模和采集组件,然后提出 ERAHBO,一种自适应重采样策略,并给出相应的次线性遗憾界。

### 4.1 RAHBO:风险规避异方差贝叶斯优化  
我们简要总结我们所基于的风险规避异方差贝叶斯优化 (RAHBO) (makarova2021risk) 的组件。RAHBO 的关键思想是将性能 \(f\) 和方差代理 \(\rho^2\) 分别建模为独立的高斯过程 (GP),从而为高斯过程上置信界 (GP-UCB) 算法 (srinivas-icml10a) 的风险规避变体推导置信界。RAHBO 通过重复评估一个配置来获得均值和方差估计,以条件化 GP。在第 \(t\) 次迭代中,它选择一个配置 \(x_t\) 并执行固定数量 \(k\) 的独立评估,得到观测值 \(\{y_t^i\}_{i=1}^k\)。

相似文章

面向强化学习后训练的跨轮次自适应展开优化

arXiv cs.LG

本文提出了CERO,一种用于LLM强化学习后训练的跨轮次自适应展开优化方法。该方法利用贝叶斯后验方差,在提示和轮次之间分配固定的展开预算,以最大化样本效率,实现了理论遗憾界,并在数学推理任务上优于GRPO。

HOBA: 面向自适应在线广告的分层在线策略竞价代理

arXiv cs.AI

HOBA提出了一种用于在线广告的分层强化学习框架,该框架利用大型语言模型进行超参数推断,使用SARSA代理进行专家模型选择,并通过动态专家池执行出价,在大规模A/B测试中实现了+3.6%的提升。