面向热带商业建筑HVAC控制的情境化质量多样性进化强化学习

arXiv cs.LG 论文

摘要

本文提出了CQD-ERL,一种面向热带商业建筑HVAC系统的情境化质量多样性进化强化学习控制器,并以ASHRAE指南36基线进行了评估。它通过安全屏蔽的多策略存档方法应对热带气候的独特挑战。

arXiv:2608.11324v1 公告类型:新 摘要:本文提出了一种情境化质量多样性进化强化学习控制器CQD-ERL,用于热带水冷冷水机组及其相关空气侧的监督控制。该控制器并非收敛于单一的标量化策略,而是维护一个产品存档,其中包含由数据驱动的运行情境(即每日天气和负荷模式的聚类)以及情境不变的行为描述符联合索引的专业策略集合,该存档由共享一个回放缓冲区的无梯度进化算子和软演员-评论家策略梯度算子共同填充。每个动作在执行前都经过确定性安全屏蔽的过滤。该控制器在一个代表新加坡商业建筑潜在负荷、冷却塔逼近度和湿度约束的两层降阶环境中进行训练,并在完整的年度回测中与ASHRAE指南36基线进行了评估。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:34

# 面向热带商业建筑HVAC控制的情境化质量-多样性进化强化学习

来源:https://arxiv.org/html/2608.11324
Tran Le Vu 隶属机构:南洋理工大学能源研究所 隶属机构:#06-04, Cleantech One, 1 Cleantech Loop 隶属机构:新加坡 637141 邮箱:[[email protected]](mailto:[email protected])

###### 摘要

本文提出了一种情境化质量-多样性进化强化学习控制器 CQD-ERL,用于热带水冷式冷水机组及其相关空气侧的监督控制。该控制器并非收敛于单一标量化策略,而是维护一个产品归档(product archive),其中包含按数据驱动的运行情境、每日天气与负荷模式的聚类以及情境无关的行为描述符联合索引的专业化策略集合,并由无梯度进化算子与共享同一经验回放缓冲区的软演员-评论家(soft actor-critic)策略梯度算子共同填充。每个动作在执行前都经过确定性安全防护层过滤。该控制器在一个表示新加坡商业建筑潜在负荷、冷却塔逼近度和湿度约束的两层降阶环境中训练,并在全年回测中与ASHRAE Guideline 36基线进行对比评估。实现代码可在https://github.com/stevietran/hvac_cdqerl.git获取。

*关键词* 质量-多样性优化⋅\\cdot进化强化学习⋅\\cdot软演员-评论家⋅\\cdotHVAC控制⋅\\cdot热带建筑⋅\\cdotMAP-Elites

## 1 引言

建筑在全球能源消耗中占很大比例,其中供暖、通风和空调系统是主要的终端用能。这一比例在赤道附近急剧上升。在热带商业建筑中,空调能耗可占总能耗的50%至60%,而中央冷水机组系统本身就占空间调节能耗的40%以上。因此,在机组层面提高一个百分点的效率,将惠及庞大的塔楼、办公楼和公共机构建筑存量。

在潮湿的热带地区,控制问题的特征发生了变化,而这一点在以温带案例研究为主的文献中往往被忽视。三个关键事实主导着这一特征。新加坡的环境湿球温度接近25至26°C,全年变化很小,因此冷却塔需要在持续狭窄且昂贵的逼近度下排热,而空气侧节能器(温带地区主要的节能策略)几乎没有任何贡献。设计负荷的显热比降至约0.65至0.75,因此决定盘管尺寸和冷冻水供水温度的是除湿需求而非温度。相对湿度上限约为60%至65%(新加坡SS 553标准中明确规定),这是一个冷凝和霉菌限制,而非舒适性偏好,因此它是对控制器的硬性安全约束,而非可以与能源进行权衡的软性目标。基准仿真器和大多数已发表的案例研究仍然以温带、供暖季节和显热负荷为主,因此这一运行工况在设计师可获得的证据基础中系统性代表性不足。

现行的监督控制基线是一组分层启发式方法:基于负荷阈值的冷水机组启停、针对设备曲线的静态设定点优化,以及ASHRAE Guideline 36中的trim-and-respond和双最大值序列。这些序列是供应商中立的、经过现场验证的,并且难以被诚实地超越;而针对任何较弱基线报道的机器学习节能数据都不可信。模型预测控制是严谨的替代方案,近期的现场部署在真实冷水机组上报告了约11%至15%的节能效果。然而,其严谨性受到结构性事实的限制,而非工程投入的限制。每项主要研究都面临同一个结构性事实:冷水机组监督控制通过双线性设备物理特性将离散启停与连续设定点混合在一起,本质上是一个缓慢的混合整数非线性规划问题。每个现场部署都以不同方式近似这一混合整数非线性规划。非线性规划松弛方法在机场中央工厂调度了冷水机组、水泵和蓄热装置,实现了约10%的模拟节能和7%的现场验证节能(6 (https://arxiv.org/html/2608.11324#bib.bib14))。将搜索截断为基于神经冷水机组模型和梯度提升负荷预测的两步动态规划,实现了14.98%的现场验证节能,同时将最坏情况计算时间从10,000秒缩短至2.79秒(16 (https://arxiv.org/html/2608.11324#bib.bib16))。改变控制信号本身——预测冷冻水回水温度而非在超限后作出反应——仅使用已安装的传感器便实现了11.07%的现场验证节能(14 (https://arxiv.org/html/2608.11324#bib.bib17))。通过可微预测控制离线学习混合整数策略,将优化从关键路径上完全移除,在推理速度比混合整数模型预测控制快数个数量级的情况下实现了高达13%的节能,尽管其设备模型忽略了在热带气候中约束最严格的冷却塔和冷凝器回路(4 (https://arxiv.org/html/2608.11324#bib.bib22))。

强化学习消除了对显式、持续维护的设备模型的需求,最强结果确实令人鼓舞。应用于建筑领域时,相关文献经历了三个阶段。早期工作证明,基于无模型的深度强化学习仅使用天气和价格信号就能将建筑维持在舒适范围内,相对于未明确的基于规则的基线报告了20%至70%的节能效果(24 (https://arxiv.org/html/2608.11324#bib.bib10))。基于模型的变体后来缩小了大部分样本效率差距,一种环境条件动力学模型集成与模型预测路径积分控制相结合,使用少一个数量级的训练数据达到了与无模型方法相当的节能效果(7 (https://arxiv.org/html/2608.11324#bib.bib12))。最近阶段显著提高了证据标准。一种基于物理信息的离线控制器运行生产数据中心冷却系统超过2,000小时,实现了14%至21%的节能且无安全违规(26 (https://arxiv.org/html/2608.11324#bib.bib13)),而直接作用于空气侧和水侧执行器的深度强化学习比Guideline 36提升了高达17%,同时泛化到未见过的 occupancy 场景(20 (https://arxiv.org/html/2608.11324#bib.bib15))。然而,该领域的自身审计发现,在77个被调查的控制器中只有11%曾在真实建筑中测试过,并将这一差距追溯到四个反复出现的失败模式:在有人建筑中不可接受的探索成本;诸如离散冷水机组启停和露点悬崖等非平滑动力学使梯度方法失效;单一标量化奖励策略必须在热带建筑实际经历的所有运行工况之间妥协;以及阻碍部署的安全性和迁移问题(23 (https://arxiv.org/html/2608.11324#bib.bib9))。

BOPTEST提供了一个共享基础设施层,直到最近才在通用标准上达成一致,它提供容器化的Modelica仿真器,内置基线控制、REST API和固定的关键绩效指标(3 (https://arxiv.org/html/2608.11324#bib.bib18))。它终于允许控制器之间相互基准测试,而不是在定制案例研究上进行。CityLearn v2以物理保真度为代价,提供快速、自包含、数据驱动的Gymnasium环境,支持建筑群的多智能体和电网交互控制(19 (https://arxiv.org/html/2608.11324#bib.bib23))。Spawn将EnergyPlus围护结构建模与Modelica HVAC及控制耦合在一起,耦合时间步长比早期接口更大、更易处理,因此可以按实际编写的控制序列进行模拟,而不需要近似处理(25 (https://arxiv.org/html/2608.11324#bib.bib20))。这三个工具共同背后的核心问题是:面向控制的模型究竟需要多少建筑细节。物理信息神经网络恢复室温与隐藏热质量状态时误差低于0.25度,并且在比普通网络更长的预测范围内保持准确性(9 (https://arxiv.org/html/2608.11324#bib.bib11))。分阶段灰箱辨识表明,在模型预测控制中,一个辨识良好的单区域模型可以胜过辨识不良的多区域模型,因此区域间细节只有在估计良好时才有帮助(2 (https://arxiv.org/html/2608.11324#bib.bib19))。

在建筑控制文献之外,另一条研究线已经成熟地阐述了为什么进化搜索和梯度强化学习具有互补的失败模式,以及如何将两者结合起来。进化强化学习将基于种群的进化搜索(无梯度、全局探索、对奖励不连续性不敏感)与离策略梯度学习器(提供样本效率和精细的逐步控制)相结合(13 (https://arxiv.org/html/2608.11324#bib.bib4))。进化引导的策略梯度让种群和离策略学习器共享同一条经验流,使得回合级信用分配和广泛探索与梯度样本效率共存,而一种组合变体将超参数敏感性重新定义为跨不同时间尺度学习器的计算分配问题(12 (https://arxiv.org/html/2608.11324#bib.bib5))。质量-多样性搜索通过维护多样化、高性能解决方案的归档而非收敛于单一策略来扩展这一思想,使用高效变异算子(22 (https://arxiv.org/html/2608.11324#bib.bib6))和策略梯度辅助变异将规模扩展到深度神经控制器(18 (https://arxiv.org/html/2608.11324#bib.bib8);10 (https://arxiv.org/html/2608.11324#bib.bib2))。在质量-多样性家族中,利用精英在共享基因型区域中的经验集中度设计的有向变异算子显著加速了MAP-Elites(22 (https://arxiv.org/html/2608.11324#bib.bib6))。由异步训练的评论家驱动的策略梯度变异算子将归档规模从大约一百个控制器参数扩展到超过两万个参数的深度网络(18 (https://arxiv.org/html/2608.11324#bib.bib8))。噪声鲁棒变体在每个生态位(niche)中存储一个小型子种群而非单个精英,使得归档在噪声适应度下保持准确,且无需额外评估成本(8 (https://arxiv.org/html/2608.11324#bib.bib25))。通过后继特征评论家和学习到的约束乘子将多样性目标折叠到单个演员-评论家架构中,在深度强化学习样本效率下达到可比的多样性(10 (https://arxiv.org/html/2608.11324#bib.bib2))。MAP-Elites的一种多任务变体用任务索引的归档取代行为归档,通过利用上述变异算子所假设的相同精英超体积结构解决数千个相关任务(17 (https://arxiv.org/html/2608.11324#bib.bib26)),后来进一步推广到连续任务空间(1 (https://arxiv.org/html/2608.11324#bib.bib24))。最近的两篇综述对这一混合领域进行了整体梳理,一篇按照进化与强化学习相互协助的方向分类(15 (https://arxiv.org/html/2608.11324#bib.bib1)),另一篇按照进化在2017年后的四十五种组合中所扮演的架构角色分类(21 (https://arxiv.org/html/2608.11324#bib.bib7))。一个硬件加速库已消除了计算方面的实际障碍,使得任何此类方法都可运行(5 (https://arxiv.org/html/2608.11324#bib.bib21))。这一谱系中的所有领域仍然是模拟的连续控制运动或操作任务,其行为轴或任务轴在建筑能源领域没有既定的对应物,而这正是本文旨在填补的空白。

本文提出了一种情境化质量-多样性进化强化学习控制器 CQD-ERL,用于热带水冷式冷水机组及其相关空气侧,并在一个针对新加坡条件校准的专用降阶物理环境中进行训练和评估。情境化的概念意味着归档围绕一组控制器组织,每个控制器专门针对一种运行情境,并通过将当前工况与最近的存储专家匹配来调度。本文采用软演员-评论家(soft actor-critic),这是一种通过策略熵增强回报的深度强化学习算法(11 (https://arxiv.org/html/2608.11324#bib.bib3))。这种离策略公式在随机种子上的稳定性显著优于大多数近期HVAC控制器所依赖的确定性方法。该环境被设计为两层结构。一个毫秒级成本的降阶模型承载基于种群搜索所需的数百万次 rollout,而一个经过校准、社区基准测试的双胞胎模型承载验证,遵循BOPTEST协议。本文的贡献有三方面:一种验证一组工况专用控制器组合的归档架构,而非收敛于单一折中策略;一个代表热带运行中占主导地位但大多数基准仿真器忽略的潜在负荷、冷凝风险和冷却塔逼近度的训练环境;以及一份以ASHRAE Guideline 36基线为基准的实证报告。

## 2 情境化质量-多样性进化强化学习

本文将 *情境化* 定义为:部署的控制器不是在一个热带建筑所经历的每种运行条件下都进行折中的单一策略,而是由主导工况选择的一组专业化策略组合。情境是当天天气与负荷的低维摘要,它决定调度哪个存储控制器,而不是作为额外输入馈入单个网络。该情境可以扩展到其他运行模式,如需求响应、电价结构和峰值削减。

该控制器称为 CQD-ERL,处于混合进化-强化学习分类法中的协同方向。在这一方向上,进化搜索和梯度学习器各自独立但又不断交换信息,而非仅为单向辅助。具体而言,它是一个策略梯度辅助的 MAP-Elites 归档,并朝着质量-多样性演员-评论家(quality-diversity actor-critic)所引入的约束演员-评论家多样性处理方式推广。无梯度进化算子提供全局探索,并且对梯度方法失效的非平滑动力学、离散冷水机组启停和露点悬崖不敏感。软演员-评论家算子则提供对连续设定点的样本高效、细粒度的调制。图1 (https://arxiv.org/html/2608.11324#S2.F1) 显示了算法的详细信息。

### 2.1 算法

#### 2.1.1 情境化归档

归档是一个乘积结构,而非单一划分。每个情境单元维护一个由十二个质心组成的行为索引子归档,因此一个基因组在一个情境内被评分,并根据其行为在该情境内定位:

archive[i][j],i∈{1,...,N_c},j∈{1,...,N_b}(1)

其中 i 索引情境单元,j 索引其中的行为生态位。N_c、N_b 分别是情境质心数和每个情境中的行为质心数。

情境和行为是独立分配的,各自通过最近邻 c

相似文章

DEI:进化推断中的多样性用于质量-多样性搜索

Hugging Face Daily Papers

DEI引入了一种分布式质量-多样性搜索框架,使用异构大语言模型(LLMs)作为变异算子,表明模型多样性相比同构并行方法能提升性能。在Core War领域上的评估显示,一个四节点异构集成在QD-Score和覆盖率上取得了显著提升。