Infra-Bayesian 强化学习智能体在最坏情况鲁棒性方面优于经典 RL
摘要
本文展示了首个 infra-Bayesian 强化学习智能体的实现,证明其在最坏情况遗憾上优于经典 RL,并能最优地处理纽科姆问题,为模型误设定下的鲁棒性迈出了一步。
arXiv:2605.23146v1 公告类型:新
摘要:经典强化学习假设智能体与一个固定环境交互,该环境的行为不依赖于智能体的策略。这一假设在不可实现的环境中失效,例如其他行为者可能预测智能体行为的情况,包括对 AI 安全至关重要的环境,其中智能体与预测器、人类、其他 AI 智能体和机构交互。在此类环境中,智能体的模型类无法捕捉其运行的世界。在这种误设定下,经典贝叶斯方法可能会产生自信但错误的后验、不可靠的决策以及无界遗憾,因为可实现性无法成立。Infra-Bayesianism 是一种决策理论框架,通过区分普通概率不确定性(其中先验可以合理选择)和 Knightian 不确定性(其中没有构建此类先验的基础)来解决这些失效。它通过基于最坏情况结果评估行动,而非基于后验期望或加权平均。我们首次提出了一个用于有限结果无状态决策问题的 infra-Bayesian 强化学习架构的概念验证实现。我们的智能体维护一组不精确的假设,使用 infra-Bayesian 条件化更新它们,并通过最大化最坏情况期望值来选择行动。我们将此 infra-Bayesian 极大极小决策过程的实现应用于具有 Knightian 不确定性的环境,并证明了与经典强化学习智能体相比,其最坏情况遗憾更低。我们还研究了纽科姆问题,并显示 infra-Bayesian 智能体选择了最优策略,优于经典决策理论智能体。我们的结果为在模型误设定和策略依赖不确定性下保持鲁棒的强化学习智能体迈出了一步。
查看缓存全文
缓存时间: 2026/05/25 09:01
# 贝叶斯强化学习智能体在最坏情况鲁棒性上优于经典强化学习
来源:https://arxiv.org/html/2605.23146
Manish Aryal 普渡大学 aryalm@purdue\.edu & Faiyaz Azam¹¹footnotemark:1 卡内基梅隆大学 fazam@andrew\.cmu\.edu & Agnivo Banerjee¹¹footnotemark:1 WorldQuant University agnivo\.stem\.iiserk@gmail\.com & Sai Sidhanth Manoharan Jayanthi¹¹footnotemark:1 加州大学伯克利分校 sidmanoharan\_2512@berkeley\.edu & Allegra Laro¹¹footnotemark:1 独立研究员 allegralaro@gmail\.com & Clément Legentilhomme¹¹footnotemark:1 艾克斯-马赛大学 lgtclem@gmail\.com & Andrew Lin¹¹footnotemark:1 麻省理工学院 a\_lin@mit\.edu & Florian Lorkowski¹¹footnotemark:1 苏黎世大学 florian@lorkow\.ski & Radman Rakhshandehroo¹¹footnotemark:1 不列颠哥伦比亚大学 rdmnr@student\.ubc\.ca & Patric Rommel¹¹footnotemark:1 斯图加特大学 patric\.rommel@itp1\.uni\-stuttgart\.de & Emanuel Ruzak¹¹footnotemark:1 布宜诺斯艾利斯大学 eruzak@dc\.uba\.ar & Nathan Theng¹¹footnotemark:1 加州州立大学弗雷斯诺分校 theng\_nathan@mail\.fresnostate\.edu & Paul Yushin Rapoport 芝加哥大学 pyrapoport@uchicago\.edu
所有作者贡献相等,并应被视为共同第一作者;排序按字母顺序,Paul Rapoport 除外,他是本项目的导师。
通讯作者:pyrapoport@uchicago\.edu。所有资金和后勤支持由 Kairos 和 SPAR 项目提供。
(2026年5月6日)
###### 摘要
经典强化学习假设智能体与一个固定环境交互,该环境的行为不依赖于智能体的策略。这一假设在不可实现(non-realizable)的设定中会失效,因为其他行为者可能预料到智能体的行为——尤其是那些对人工智能安全至关重要的环境,其中任何给定的智能体都会与预测者、人类和其他AI智能体以及机构进行交互。在这样的环境中,智能体的模型类无法捕捉其运行的真实世界。在这种错误设定(misspecification)下,由于可实现性无法成立,经典贝叶斯方法会产生自信的错误后验、不可靠的决策以及无界的遗憾。Infra-Bayesianism 是一种决策理论框架,它通过区分普通概率不确定性(其中先验可以合理选择)与奈特不确定性(没有理由构造这样的先验)来解决这些失败。Infra-Bayesianism 通过评估行动在环境中的最坏结果,而不是基于后验期望或加权平均,来实现这一目标。
我们首次提出了一个用于有限结果无状态决策问题的 infra-Bayesian 强化学习架构的概念验证实现。我们的智能体维护一组不精确的假设,使用 infra-Bayesian 更新规则进行更新,并通过最大化最坏情况下的期望值来选择行动。我们将这种 infra-Bayesian 最大最小决策过程应用于一个具有奈特不确定性的环境,并证明了与经典强化学习智能体相比,它具有更低的最坏情况遗憾。我们还研究了 Newcomb 问题,并表明 infra-Bayesian 智能体选择了最优策略,优于经典决策理论智能体。我们的结果为强化学习智能体在模型错误设定和策略依赖不确定性下保持鲁棒性迈出了一步。
## 1 引言
强化学习通常在假设智能体与一个固定环境交互的框架下进行分析:该环境是一个马尔可夫决策过程、一个部分可观察马尔可夫决策过程,或者这些模型上的贝叶斯后验。这一假设在数学上很方便,并促成了大量的收敛性和遗憾保证。然而,它并不适用于智能体被嵌入到过于复杂而无法被智能体表示的环境中,或环境包含其他行为者的情况,这些行为者对智能体的行为进行建模,并因此对智能体的策略做出响应,而不仅仅是响应其实际执行的动作。举例包括:自动驾驶汽车的驾驶风格被人类驾驶员预料到、推荐系统的用户根据系统的已知行为进行调整、以及诸如 Newcomb 问题之类的决策理论问题。在这些设定中,环境不仅仅是未知的;从智能体的角度来看,它可能是策略依赖的并且是不可实现的(Bell 等人,2021 (https://arxiv.org/html/2605.23146#bib.bib9))。
经典贝叶斯强化学习通过对可能的环境设置先验,为处理普通不确定性提供了原则性的方法。然而,其最有力的保证依赖于“可实现性”或“事实的颗粒”假设:真实环境,或一个足够精确的模型,必须位于智能体的假设类中。这一假设对于开放式的部署来说是不合理的。现实世界包含智能体自身以及其他具有相当或更高复杂性的系统,因此没有可处理的假设类能够包含对环境的完整描述。在这种错误设定下,贝叶斯智能体会变得自信地错误,而基于价值的强化学习智能体可能无法收敛到最优策略(Gelb, 2025b (https://arxiv.org/html/2605.23146#bib.bib10))。
Infra-Bayesianism 的开发就是为了解决这个问题,它用不精确的、以最坏情况评估的假设取代精确的贝叶斯假设。与其仅通过世界上的概率分布来表示不确定性,IB 智能体可以表示关于可能世界的“奈特不确定性”,并通过下期望来评估行动:即针对假设类中最坏的可接受成员所保证的值。然后,它选择最大化这个最坏情况期望值的行动。这种最大最小结构具有安全相关性,因为它将智能体的目标转化为一个下界保证,而不是一个平均情况的预测。IB 还提供了一种针对这些对象的更新规则,旨在跨序列观察保持动态一致性(Diffractor and Kosoy, 2020 (https://arxiv.org/html/2605.23146#bib.bib5); Appel, 2020 (https://arxiv.org/html/2605.23146#bib.bib11))。
更广泛地说,IB 属于智能体基础和安全对齐研究议程的一部分,该议程寻求对嵌入式智能体进行数学上精确的建模。从这个角度来看,不可实现性不是一个边缘情况,而是运行在真实世界中的高级智能体的核心特征:智能体本身就是它试图建模的环境的一部分。
尽管在 IB 及其在人工智能对齐的学习理论议程中的作用方面有大量的理论工作,但将其数学对象转化为具体的强化学习智能体的工作相对较少。这留下了 IB 的正式承诺(在不可实现性、奈特不确定性和策略依赖环境下的鲁棒推理)与实际中智能体如何表示、更新和规划之间的差距。在本文中,我们提出了一个概念验证的 IB 强化学习架构。实现层面的对象不是 MDP 上的后验分布,而是一个有限的外在仿射评估器集合,其下包络定义了智能体的价值估计。这种表示允许智能体执行可处理的下期望评估,区分经典概率混合和奈特不确定性,并应用动态一致的 IB 风格更新,而无需枚举完整的历中树。
我们的贡献如下:
1. 1.我们基于 a-measure 和 下分布 (infradistribution) 构建了一个有限结果的 infra-Bayesian 强化学习架构,包括经典混合和奈特混合、下期望评估以及 IB 风格的更新。
2. 2.我们展示了该架构在退化的情形下恢复普通的贝叶斯行为,即每个下分布只有一个最小点,且所有不确定性都是经典的。
3. 3.我们通过实验证明,在具有奈特不确定性的环境中,IB 智能体在最坏情况性能方面优于贝叶斯智能体。
4. 4.我们展示了 IB 决策理论在简单的策略依赖环境中获得了最优奖励,而经典决策理论未能全面建模因果结构。
## 2 背景
### 2.1 经典与贝叶斯强化学习
在强化学习中,智能体重复选择动作并从环境中接收观察。通常的形式是马尔可夫决策过程,它将环境建模为一组状态,智能体通过从一组动作中选择动作在这些状态间转换,并在每次转换时获得奖励。智能体的目标是优化其策略,以最大化未来动作的累积期望奖励。最大化奖励等价于最小化“遗憾”,即最优策略可获得的期望奖励与实际获得的奖励之间的差异。
经典贝叶斯强化学习对环境设置先验,并通过贝叶斯规则更新,这在可实现设定中是合适的,即智能体的假设类包含真实情况,并且是许多标准收敛论证的基础(Sutton and Barto, 2018 (https://arxiv.org/html/2605.23146#bib.bib12); Ghavamzadeh 等人, 2015 (https://arxiv.org/html/2605.23146#bib.bib13))。这一假设对于嵌入式或开放世界智能体来说并不合适,因为任何计算上可行的假设类都不能包含精确的环境。在这种不可实现设定中,贝叶斯更新仍然产生一个后验,但这个后验不必收敛到对决策有用的模型。这是学习理论议程中 IB 的核心动机之一(Gelb, 2025b (https://arxiv.org/html/2605.23146#bib.bib10); Kosoy and Kosoy, 2023 (https://arxiv.org/html/2605.23146#bib.bib7))。
### 2.2 不可实现性与策略依赖环境
这项工作的核心动机在于,强化学习中的困难不仅仅是由于统计不确定性。它们还包括模型错误设定、奈特不确定性,以及环境行为依赖于智能体策略(而非仅依赖于其实际执行的动作)的情况。
策略依赖性对于嵌入式智能体尤其重要。在普通强化学习中,环境通常被建模为对当前状态和动作做出响应。然而,在策略依赖环境中,奖励或转移可能直接依赖于智能体的策略。当其他智能体、预测者、市场、用户或机构形成对智能体行为的期望并据此做出响应时,就可能发生这种情况。
类似 Newcomb 的决策过程对这些环境进行了形式化,允许奖励或转移依赖于策略本身。Bell 等人表明,在这种环境中,基于价值的强化学习智能体只能收敛到可证实的策略,并且可能根本不能收敛到最优策略(Bell 等人, 2021 (https://arxiv.org/html/2605.23146#bib.bib9))。这表明,策略依赖环境需要超越固定 MDP 中普通价值学习的决策理论处理。
### 2.3 Newcomb 问题简述
Newcomb 问题(以物理学家 William Newcomb 命名)是一个经典的决策理论困境(Nozick, 1969 (https://arxiv.org/html/2605.23146#bib.bib17))。在这个问题中,智能体面前有一个透明盒子和一个不透明盒子,可以选择只拿走不透明盒子(单箱选择),或者两个盒子都拿走(双箱选择)。智能体可以看到透明盒子里有一千美元。不透明盒子里要么什么都没有,要么有一百万美元,这取决于一个已经做出的预测。关键在于,这个预测是关于智能体选择的:当且仅当智能体被预测为只拿不透明盒子时,不透明盒子里才有一百万美元。这个预测非常准确,但不一定完美。情景的所有方面智能体都已知。这个情景引发了一个困境,因为在其中,支配原则与期望效用最大化原则相冲突。特别是,遵循因果或证据决策理论的智能体会得出不同的结论,并且两者都无法准确捕捉环境的因果结构。
### 2.4 Infra-Bayesianism 高层概览
Infra-Bayesianism 通过允许假设包含奈特不确定性来推广贝叶斯推理。IB 智能体不是仅通过可能世界上的概率分布来表示不确定性,而是可以表示一组可接受的评估器。然后,智能体通过其下期望来评估一个策略:即在最不利的可接受评估器下保证的值。
这个区别很重要。贝叶斯智能体使用后验概率对假设进行平均。IB 智能体也可以表示那些不应被平均掉的模糊性。在这个意义上,IB 将普通概率不确定性与奈特不确定性分开。由此产生的决策规则是最大最小原则:选择在可接受值中最坏情况最好的策略。
这种下界视角在安全驱动的设定中尤其相关。当智能体的模型类可能被错误设定,或环境可能对智能体的策略做出响应时,平均情况的后验价值可能是错误的最优化对象。IB 反而为使用部分信息和最坏情况保证进行推理提供了一种形式化方法。
### 2.5 仿射测度与下分布
本文中使用的基本实现层面对象是仿射测度,或 a-measure。在我们考虑的有有限非有符号设定中,一个 a-measure 是一个对
a = (λμ, b), (1)
其中 μ 是可能的观察历史集上的概率测度,λ ≥ 0 是一个尺度因子,b ≥ 0 是一个偏移量。给定一个历史上有界回报函数 f,a-measure 按以下方式评估 f:
a(f) = λ E_μ[f] + b. (2)
概率成分 μ 表示历史集上的普通随机不确定性。尺度 λ 决定了分配给该成分的权重。偏移量 b 记录了与环境交互历史中因观察而被排除的分支相关联的价值。直观上,当一个观察排除了某些分支时,IB 并不简单地删除与这些分支相关的价值。相反,它们的贡献被转入仿射偏移量,这有助于保持事前和事后评估之间的动态一致性。
一个下分布 Ψ 对于我们有限的目地来说,可以看作一组仿射评估器。它的下期望是:
Ē_Ψ[f] = inf_{a ∈ Ψ} a(f). (3)
因此,一个策略通过下分布中最坏的可接受 a-measure 来评估。用奖励最大化的语言来说,智能体选择最大化这个下期望的策略。
### 2.6 经典混合与奈特不确定性
IB 区分经典概率不确定性与奈特不确定性。经典不确定性由混合表示。如果 Ψ_i 是下分布,w_i 是先验权重,那么它们的经典混合是:
∑_i w_i Ψ_i = { ∑_i w_i a_i : a_i ∈ Ψ_i }, ∑_i w_i = 1, (4)
这对应于可以使用先验权重进行平均的不确定性,如贝叶斯推理中那样。
奈特不确定性则不同。它表示仍然暴露于外部下确界而非被平均掉的模糊性。一个单点下分布恢复了普通的概率评估。一个非单点下分布表示多个可接受评估器上的模糊性,其中策略的价值是通过取内部评估器集合上的下确界来计算的。相似文章
通过分位数贝叶斯风险MDP实现在线强化学习中鲁棒性与探索的动态权衡
本文提出了一种用于在线强化学习的分位数贝叶斯风险感知MDP框架,该框架能够随时间自适应地平衡鲁棒性与探索,提供了理论遗憾界并展示了强大的实证性能。
面向小规模语言模型智能体的稳健强化学习
本文系统研究了面向小规模语言模型智能体(70-500M参数)的强化学习不稳定性问题,识别出三种失效模式,并提出了稳健技术,包括合并并重新初始化适配器方法及安全机制;该方法实现了稳定收敛并提升了胜率。
基于后验混合贝叶斯信念的正则化离线策略优化
本文介绍了后验混合贝叶斯信念(PhyB),这是一个将贝叶斯强化学习中的期望重新表述为动力学模型的凸组合的框架,从而能够实现具有有界目标差异和最新性能的高效正则化离线策略优化。
动态不确定性下的风险量化:面向安全序列决策的基于信念的鲁棒性
本文提出RATTL,一个使用Wasserstein距离基于贝叶斯信念不确定性调整智能体谨慎程度的框架,用于安全序列决策,适用于基于LLM的系统。
面向小规模语言模型智能体的鲁棒强化学习
本文系统性地研究了使用PPO对小型语言模型(7000万至5亿参数)进行强化学习时的失败模式,识别出静默LoRA参数冻结、数值溢出和灾难性策略崩溃等问题,并提出了一种鲁棒系统,采用合并并重新初始化适配器、float32精度和安全机制。该方法收敛稳定,且使用更少的数据即超越基线。