Building2Building:面向可泛化真实世界强化学习的大规模基准
摘要
介绍Building2Building(B2B),这是一个基于EnergyPlus构建、与Gymnasium兼容的大规模基准,用于研究强化学习中在真实HVAC控制环境下的泛化与迁移。
arXiv:2607.16534v1 公告类型:新
摘要:强化学习(RL)在控制领域取得了显著成果,但学习到的策略对动态变化、动作空间、观测空间或目标的鲁棒性较差,这是实际部署中的一个关键限制。现有基准在多样性和复杂性方面存在局限,使得严格研究RL中的迁移学习、多任务学习和元学习变得困难。我们提出Building2Building(B2B),这是一个基于最先进的建筑模拟器EnergyPlus构建的大规模真实供暖、通风和空调(HVAC)控制环境套件。B2B完全兼容Gymnasium接口,并配备参数化建筑生成器,能够系统生成具有异构观测和动作空间的各种建筑配置。基于该套件,我们定义了针对RL中关键开放挑战的基准任务,包括目标适应、动态适应、动作空间转移和跨域迁移。通过提供大规模、多样化且基于物理的测试平台以及标准化评估协议,B2B能够系统研究连续控制中的泛化和迁移。除了推进RL泛化研究,这一新基准还具有重要的社会意义,因为它能够大规模改进建筑中能耗最高的系统之一——HVAC控制。
查看缓存全文
缓存时间: 2026/07/21 06:49
# 建筑到建筑:面向可泛化真实世界强化学习的大规模基准
来源:https://arxiv.org/html/2607.16534
###### 摘要
强化学习(RL)在控制领域取得了显著成果,但学得的策略在动力学、动作空间、观测空间或目标发生变化时仍然脆弱,这是实际部署中的关键限制。现有基准在多样性和复杂性上存在局限,难以严格研究RL中的迁移学习、多任务学习和元学习。我们提出Building2Building(B2B),一套基于EnergyPlus(业界领先的建筑模拟器)构建的大规模真实暖通空调(HVAC)控制环境套件。B2B完全兼容Gymnasium接口,并配备参数化建筑生成器,能够系统生成具有异构观测和动作空间的多样化建筑配置。基于该套件,我们定义了一系列基准任务,针对RL中尚未解决的关键挑战,包括目标适应、动力学适应、动作空间偏移和跨领域迁移。通过提供大规模、多样化且物理真实的标准评估协议测试平台,B2B能够系统研究连续控制中的泛化与迁移问题。除了推动RL泛化研究的前沿进展,这一新基准还具有重要的社会意义——它能够支持大规模改进HVAC控制,这是建筑中能源消耗最大的系统之一。
## 1 引言
强化学习(RL)在多种控制问题上表现优异。然而,在大多数情况下,这些成果是通过在单一目标任务上训练策略获得的。尽管在受控环境中有效,但这种范式限制了RL系统在新环境中的运行能力或适应相关任务的能力。适应能力是现实部署的关键特征,而让RL智能体能够在不同环境中泛化与适应,仍然是一个主要未解决的挑战。
研究RL中的泛化问题需要模拟环境,这些环境能向智能体提供多种任务,包括变化的动力学、观测空间、动作空间以及目标。现有基准如Meta-World (mclean2025) 和 RLBench (stephen2020) 提供了有用的测试平台,但主要局限于机器人领域。此外,它们引入的变化通常仅限于动力学参数(例如摩擦)或任务目标(如导航的目标位置或物体放置)。因此,这些基准在环境结构上的多样性有限,并且很少包含异构的观测和动作空间。由于这一限制,许多研究跨领域适应或迁移的RL工作依赖于自定义的实验设置。这些环境通常是为特定方法设计的,难以复现,从而使得不同方法之间的比较变得困难。因此,向可泛化RL智能体迈进的过程仍然分散。
在本文中,我们提出了一个新的研究RL泛化的领域:建筑的供暖、通风和空调(HVAC)控制。建筑在布局、材料、气候暴露、HVAC配置以及平衡能源节约与舒适度的目标上表现出巨大的多样性。同时,它们共享基于热力学和能量守恒的通用物理原理。这种多样化的动力学、异构控制接口以及共享物理原理的结合,使HVAC控制成为研究泛化的理想领域。
我们介绍Building2Building(B2B),这是一套基于EnergyPlus(业界领先的建筑能源模拟器 (energyplus))构建的大规模RL环境套件。EnergyPlus提供了建筑热行为的高保真物理建模。模拟器的准确性在zhang2019等工作中得到强调,这些工作表明在标定的EnergyPlus模拟中训练的RL策略可以直接部署到真实建筑中。
我们的环境套件包含一个建筑生成器,可基于北美多个地理位置的基准原型生成几乎无限数量的环境。这些环境暴露了低层HVAC执行器(如风机和风门),从而创建了多种具有挑战性的控制问题,具有异构的观测和动作空间,以及反映不同舒适-能源权衡的目标。这些模型通过专用的处理管道自动转换为兼容Gymnasium的RL环境。
利用该生成器,我们构建了一个包含6000个环境的数据集,涵盖多种建筑类型、气候和HVAC系统配置。我们进一步提出了定义明确且可复现的基准问题,这些问题隔离了RL中的不同变化来源:目标适应、动力学变化、动作空间偏移和跨领域泛化。
通过提供大量且多样化的真实控制环境集合,B2B能够对RL中的泛化方法进行系统和大规模的评估。同时,它支持智能HVAC控制的研究,并有助于弥合基础RL研究与能源管理系统实际部署之间的差距。HVAC控制代表了一项重要的社会挑战。建筑约占全球总能源消耗的三分之一,而仅HVAC系统就几乎占了其中一半。因此,改进HVAC控制可以减少能源消耗、降低运营成本,并直接贡献于气候减缓 (iea_outlook2022)。
## 2 相关工作
### 2.1 RL泛化的环境与基准
现有关注RL泛化的基准总结于表̃1,关于RL中泛化问题的不同方法在附录̃A中进一步讨论。大多数基准集中于视频游戏或机器人任务(如运动控制和操作)。因此,它们只覆盖了有限的应用领域。这些问题在过去十年中已被广泛研究。虽然它们带来了重要的算法进展,但目前仍不清楚这些改进能否泛化到它们被评估的特定领域之外。正如liao2021所强调的,在相同基准上反复评估算法可能导致对基准本身的过拟合,而不是RL通用能力的真正进步。这促使我们需要涵盖不同应用并提供大量任务多样性的新环境。
### 2.2 HVAC控制
现有关于RL用于HVAC的文献大多遵循一个常见模式:选择单个建筑,连接到模拟器,并证明智能体能够在保持热舒适的同时降低能耗。调查显示,这类研究已成为常见做法 (sierla2022; slsayed2024)。HVAC系统的最优控制得益于丰富的文献,Xu2025提出利用专家知识来提高在线方法的样本效率。然而,将在线方法扩展到单个案例研究之外仍然困难。每座新建筑都需要自己的数字孪生体,配备为模拟配置的传感器、执行器和动力学,并且在一个建筑中训练的策略很少能迁移到其他建筑。
现有环境总结于表̃6(附录̃C),反映了这一局限性。诸如 Sinergym (campoy2025)、Energym (scharnhorst2021)、BOPTEST (blum2021) 和 CityLearn (nweye2024) 等平台加速了研究,但总共只提供了几十个建筑模型。即使在这有限的集合中,在一个环境中训练的策略常常无法泛化到其他环境 (manjavacas2024)。迁移学习方法,如跨建筑微调 (kadamala2024; xu2020; coraci2024) 或使用超网络的持续学习 (bekal2025),提供了渐进式改进,但仍然受限于缺乏大规模基准。实地研究报告了类似的挑战:一项对一百多个部署的回顾发现节能效果不一致,并且对集成成本的报告有限 (habbazi2025)。
相比之下,B2B使得大规模研究RL用于HVAC控制成为可能。这种能力为HVAC控制开启了一种新的训练范式。与其为每个单独的建筑设计一个高度详细的数字孪生体,不如在一组包含目标建筑的建筑分布上训练策略。跨多个环境进行训练减少了对每个建筑进行高精度建模的需求,并允许策略在不同环境之间复用经验,从而减少了为每座建筑从头训练新控制器的需要。
表1:用于研究强化学习泛化的主要基准。
## 3 Building2Building套件
### 3.1 环境生成
为了获取一组具有代表性的多样化真实建筑环境,我们依赖于两个互补的建筑模型来源,它们产生大量异构环境,总结于表̃2。
- • 一个由住宅建筑生成器生成的数据集 (larochelle_martin2026)。该生成器产生代表魁北克住宅建筑存量统计特征的单户住宅。
- • 一个基于ASRHAE 90.1参考商业建筑的参数化建筑模型生成器,覆盖北美16个不同地点。该生成器遵循Building Technology Assessment Platform (btap2022) 使用的方法,并采样建筑尺寸、窗墙比、保温水平和空气渗透率。为确保物理一致性,生成器强制执行符合ASRHAE标准的气候相关参数界限。
表2:基准套件中包含的基础环境。
### 3.2 控制接口
B2B暴露了低层HVAC执行器,并原生处理以下系统:
1. 1. 单元式HVAC系统。这些系统使用专用单元(如热泵或屋顶组合式空调机组)对单个热区进行调节。对于这些系统,智能体控制送风温度(SAT)和送风流量。
2. 2. 用于多区调节的中央空气回路系统。这些系统使用集中供暖和制冷设备,通过服务多个区域的空气回路分配调节后的空气。智能体控制中央SAT、室外空气混合器、每个区域的风门开度,以及通过恒温器设定点控制区域级再热盘管。
3. 3. 踢脚线加热和仅供暖系统。这些系统仅提供供暖,并通过区域恒温器控制。
在每个时间步,智能体可以获取以下观测:天气数据(室外气温°C和湿度%)、日历信息(时刻、星期几、一年中的第几天)、室内区域气温(°C),以及每个模拟时间步的HVAC能耗(Wh/m²/时间步)。请注意,能耗按建筑面积归一化,以使其不受建筑尺寸变化的影响。
### 3.3 控制任务与奖励函数
为了研究热舒适与能效之间的不同权衡,我们提出以下奖励函数,定义了一组由节能和舒适参数化的控制任务:
rt = -1/(Z τ_T) ∑_{z=1}^{Z} (T_z(t) - T_z^{target}(t))^2 - (w_E / τ_E) E_HVAC(t), (1)
其中T_z是区域温度,T_z^{target}是区域目标温度,Z表示区域数量,E_HVAC是每平方米的HVAC能耗。请注意,目标温度T_z^{target}可能根据居住安排随时间变化。
许多广泛使用的RL算法使用奖励的加权和来处理多个目标 (hayes2022practical)。求和中的每个项的尺度定义了目标的重要性,权重需要根据期望的权衡进行调整。选择合适的权重很困难,性能对其高度敏感 (lin2019pareto)。对于能耗等目标,其尺度取决于HVAC设备和建筑类型,权重是环境相关的,并且通常需要手动调整 (togashi2025reward)。使用单一权重集在数千个环境中定义相同的权衡极其困难,甚至不可能,权重需要针对每个环境进行调整 (vanhasselt2016learning; hessel2018)。为了更好地处理每个奖励项的尺度,我们引入了依赖于建筑类型和基线策略性能的归一化常数τ_T和τ_E。使用这种归一化公式,每个项在不同环境中的数量级保持一致,并且可以使用单一权重w_E来定义跨环境的舒适-节能权衡。关于奖励公式和归一化常数的更多细节见附录̃E。
### 3.4 结构化环境表示
开发迁移和多任务RL算法的一个主要障碍是缺乏描述异质环境集合的标准方式。Gymnasium的标准API通过其观测和动作空间呈现环境,允许编写通用的训练算法和模型架构。然而,对于表示动作和观测空间不同但仍然构成一个紧密族的环境家族,并不存在等效的标准。如果没有动作和观测空间的标准表示,每个跨领域迁移算法都会定义自己特定于应用领域的接口。为了促进跨领域迁移研究,B2B引入了一种结构化表示,为异构环境提供了共同的抽象。
B2B并非重新发明环境接口,而是对其进行了扩展:每个环境仍然是一个标准的Gymnasium环境,而其“形态”被表示为一对在观测空间、动作空间和分解的结构化形式之间的转换过程。分解将每个空间分为两部分:一个由环境集合共享的“公共”部分,以及一个携带环境集合中不同环境可变信息的“形态图”。与通常的环境两空间表示不同,这里跟踪了三类数据:观测、动作和“属性”。“属性”在环境的生命周期内固定,描述环境的领域而非其当前状态。属性扮演着上下文MDP (hallak2015) 中上下文的角色:它们标识智能体当前面对的是家族中的哪个成员。
家族所有成员共享的词汇被收集在一个“形态宇宙”中。形式上,形态宇宙U具有以下结构:
1. 1. 一个公共属性空间C_c,一个公共观测空间S_c和一个公共动作空间A_c。
2. 2. 一个有限的节点类型集合T。相似文章
OpenAI Gym Beta
OpenAI 发布了 OpenAI Gym 公开测试版,这是一个用于开发和比较强化学习算法的工具包,包含不断增长的环境套件和可复现研究的平台。该工具包旨在标准化强化学习基准,并为研究社区提供多样化、易于使用的环境。
深度强化学习中的安全探索基准测试
OpenAI 提议将约束强化学习标准化作为安全探索的形式化框架,并推出 Safety Gym——一个用于评估高维连续控制任务中安全深度强化学习算法的基准测试套件,这些任务包含安全约束。
必须快速学习:强化学习泛化能力的新基准
OpenAI 推出了一个基于音速小子(Sonic the Hedgehog)的新型强化学习基准,用于测量 RL 智能体的迁移学习和小样本学习性能,同时包括基线算法的评估。
衡量模拟到现实的差距:为AIoT系统中的强化学习设计一个经济实惠的真实世界基准平台
本文介绍了一个为AIoT系统中的强化学习设计的经济实惠的真实世界基准平台,利用视频游戏来衡量模拟到现实的差距,并展示了将模拟训练出的智能体迁移到现实世界时性能显著下降的现象。
Safety Gym
OpenAI 推出 Safety Gym,这是一个新的基准环境和工具包,用于研究受约束的强化学习和安全探索。该平台包含多个机器人和任务,旨在通过成本函数与奖励函数一起量化和衡量安全探索。