从热偏好预测到自适应热干预:一种基于生理与环境传感的强化学习方法

arXiv cs.LG 论文

摘要

本文介绍了一个两阶段的个性化热舒适系统,该系统利用强化学习和多模态传感技术,根据个体使用者的偏好来调节暖通空调控制。

arXiv:2608.20423v1 公告类型:新 摘要:个性化热舒适对于使用者的福祉以及开发更具响应性的建筑控制策略至关重要,然而传统的供暖、通风与空调系统依赖静态设定点和群体层面的舒适模型,无法捕捉个体的生理变异性。本文提出了一种两阶段的个性化热舒适方法,该方法整合了多模态生理与环境传感以及基于强化学习的决策机制。
查看原文
查看缓存全文

缓存时间: 2026/08/24 04:28

# 从热偏好预测到自适应热干预:一种基于生理与环境传感的强化学习方法
来源:https://arxiv.org/html/2608.20423

Isibor Kennedy Ihianle | https://orcid.org/0000-0001-7445-8573 | [email protected]  
组织:诺丁汉特伦特大学计算机科学系,城市:诺丁汉,邮编:NG11 8NS,国家:英国  
组织:约克大学,城市:安大略省,邮编:M3J 1P3,国家:加拿大  

Ehsan Asnaashari | https://orcid.org/0000-0001-5552-9428 | [email protected]  

Mojgan Jadidi | https://orcid.org/0000-0002-2692-6157 | [email protected]  

Pedro Machado | https://orcid.org/0000-0003-1760-3871 | [email protected]  

Amrit Sagoo | https://orcid.org/0000-0000-0000-0000 | [email protected]  

Ahmad Lotfi | https://orcid.org/0000-0002-5139-6565 | ahmad.lotfi.ac.uk  

###### 摘要
个性化热舒适度对于住户福祉以及开发更具响应性的建筑控制策略至关重要。然而,传统的供暖、通风和空调(HVAC)系统依赖于静态设定点和群体级舒适度模型,无法捕捉个体生理差异。本文提出了一种两阶段个性化热舒适度方法,整合了多模态生理与环境传感以及基于强化学习的决策机制。第一阶段,利用集成学习模型,基于可穿戴设备采集的生理信号(包括心率、手腕和脚踝皮肤温度以及近体温度)结合环境传感数据,为每位参与者开发专属的“舒适度预言机”。这些预言机估算住户偏好更凉爽环境、无温度变化或更温暖环境的概率,从而同时表示预测偏好与模型置信度。第二阶段,将这些个性化预言机嵌入三个强化学习(RL)控制器——上下文多臂赌博机(CB)、Q学习(QL)和深度Q网络(DQN)中,以推荐等效的环境温度干预措施,旨在最大化预测舒适度,同时惩罚不必要的或不稳定的动作。使用公开数据集进行的实验表明,个性化舒适度预测在参与者中表现稳定,环境描述符相比仅使用生理特征能提供互补性改进。在代理控制环境中,舒适度预言机支持不同的住户特定干预策略:CB实现了最高的预测舒适度和平均奖励,QL提供了最高的单位代理干预奖励和舒适度,而DQN则提供了更大的动作灵活性,但干预变异性也更高。这些结果证明了将个性化舒适度推理与强化学习相结合以生成自适应热干预策略的可行性,并为未来与经过物理验证的以住户为中心的HVAC系统集成奠定了基础。

###### 关键词
热舒适度,舒适度建模,HVAC控制,智能建筑,可穿戴传感器,强化学习,人在环人工智能  

††标题注:本文档为诺丁汉特伦特大学资助的研究项目成果  
††通讯作者:通讯作者  

## 1 引言
热舒适度是住宅和工作场所环境中福祉、生产力和满意度的关键决定因素。次优的热环境已被证实与认知能力下降、睡眠质量受损以及住户投诉增加相关\[23 (https://arxiv.org/html/2608.20423#bib.bib13), 4 (https://arxiv.org/html/2608.20423#bib.bib14)\]。尽管如此,大多数HVAC系统仍然依赖于静态设定点、基于规则的调度或包括PMV/PPD在内的群体平均舒适度模型\[12 (https://arxiv.org/html/2608.20423#bib.bib12)\]。这些方法假设热反应具有同质性,但数十年的实证证据表明,个体间存在显著差异,这些差异由生理、行为适应、衣着、代谢率和环境历史驱动\[18 (https://arxiv.org/html/2608.20423#bib.bib15), 9 (https://arxiv.org/html/2608.20423#bib.bib16), 21 (https://arxiv.org/html/2608.20423#bib.bib5)\]。因此,传统的HVAC控制往往无法提供个性化的舒适度,导致能源浪费和频繁的手动恒温器干预。

可穿戴传感和泛在环境监测的最新进展,使得持续测量心率、皮肤温度和活动水平等生理信号成为可能,同时也能结合室外温度、湿度、风速和太阳辐射等环境变量。这些多模态数据流为个性化热舒适度建模提供了丰富的基础。机器学习方法,包括集成方法——随机森林(RF)、梯度提升(GB)和极端树(ET),在传感器数据上展现了强大的预测性能,在不同住户群体中准确率达到0.65至0.85之间\[24 (https://arxiv.org/html/2608.20423#bib.bib1), 2 (https://arxiv.org/html/2608.20423#bib.bib6), 22 (https://arxiv.org/html/2608.20423#bib.bib2)\]。此外,个性化模型始终优于群体级舒适度预测器,证实了热偏好具有高度个体化特征,无法可靠地从聚合行为模式中推断出来\[37 (https://arxiv.org/html/2608.20423#bib.bib17)\]。

然而,仅靠预测不足以实现智能舒适度管理。分类器可以估计住户偏好更凉爽、更温暖或无变化的条件,但需要一个额外的决策机制将该估计转化为候选热干预措施。这一空白激发了人们对强化学习在建筑控制中的应用日益增长的兴趣。我们之前的工作证明了利用生理反应和个人热偏好来自动确定共享环境共识温度设定点的可行性。然而,该方法依赖于预定义的控制逻辑,而非自适应序列决策。本研究通过整合个性化热舒适度预测与强化学习以生成自适应干预策略,扩展了这一方向\[19 (https://arxiv.org/html/2608.20423#bib.bib4)\]。强化学习提供了一种在不确定性下进行序列决策的方法,并已被证明与基于规则和PID控制器相比,能够提高能源效率和舒适度维持水平\[34 (https://arxiv.org/html/2608.20423#bib.bib18), 36 (https://arxiv.org/html/2608.20423#bib.bib19), 30 (https://arxiv.org/html/2608.20423#bib.bib20)\]。深度强化学习方法,包括DQN\[26 (https://arxiv.org/html/2608.20423#bib.bib10)\]和演员-评论家方法\[10 (https://arxiv.org/html/2608.20423#bib.bib21)\],在从高维状态表示中学习复杂的建筑控制策略方面展现了前景。然而,大多数基于强化学习的热舒适度研究依赖群体级舒适度模型、简化的热感觉标签或模拟建筑环境,限制了其适应个体住户的能力。此外,现有的强化学习控制器通常假设可以获取室内空气温度或HVAC设定点数据,而这些信息在许多可穿戴传感器数据集中是不可用的。

为了解决这些局限性,本文提出了一种两阶段个性化热舒适度架构,将住户特定的热偏好预测与基于强化学习的干预策略生成相结合。第一阶段,利用生理和环境传感为每位参与者开发个性化的舒适度预言机。该预言机输出三种热偏好状态(更凉爽、无变化、更温暖)上的概率分布,提供舒适度置信度的连续表示。第二阶段,将此预言机嵌入强化学习控制器(CB、QL和DQN)中,以推荐等效的环境温度干预措施,旨在最大化预测舒适度,同时惩罚不必要的或不稳定的动作。在本研究中,这些动作被评估为代理控制信号,代表潜在热干预的方向和相对幅度,而非直接的恒温器指令。因此,该架构将热舒适度建模从被动预测扩展到自适应、以住户为中心的干预策略评估,符合个性化智能环境的新兴趋势\[24 (https://arxiv.org/html/2608.20423#bib.bib1), 39 (https://arxiv.org/html/2608.20423#bib.bib22)\]。

本文的贡献有四点:
1.  一个个性化的热舒适度建模流程,整合了多模态生理和环境传感与集成学习,构建参与者特定的概率性舒适度预言机,能够表示个体间热偏好变异性。
2.  一个用于个性化热干预推荐的强化学习方案,将概率性舒适度预言机输出直接嵌入控制器状态,使强化学习策略能够优化舒适度置信度,而不仅仅依赖离散的偏好标签。
3.  一个闭环代理评估环境,使得在缺乏实测室内温度、恒温器设定点、执行器状态和HVAC功耗数据的情况下,能够训练和比较等效的环境温度干预策略。
4.  对CB、QL和DQN在多个个性化预言机特征表示上进行对比评估,提供了关于预测舒适度、累积奖励、代理HVAC ΔT、干预效率、动作切换以及与记录热偏好一致性的证据。

本文结构如下:第2节\[2 (https://arxiv.org/html/2608.20423#S2)\]回顾并分析了相关工作。第3节\[3 (https://arxiv.org/html/2608.20423#S3)\]介绍了所提出的个性化热舒适度架构。第5节\[5 (https://arxiv.org/html/2608.20423#S5)\]展示了实验方法和结果。最后,第6节\[6 (https://arxiv.org/html/2608.20423#S6)\]给出了结论和未来工作方向。

## 2 相关工作
本节回顾支撑所提两阶段方法的相关文献。首先考虑传统和个性化的热舒适度建模,然后是利用生理和环境传感预测个体热偏好的机器学习方法。接着探讨强化学习在智能热控制和HVAC决策中的应用,最后指出个性化热舒适度预测与序列干预策略生成之间尚未解决的鸿沟。

### 2.1 热舒适度建模
热舒适度研究历史上依赖群体级模型,包括PMV/PPD\[12 (https://arxiv.org/html/2608.20423#bib.bib12)\],这些模型假设稳态条件、固定代谢率和均匀环境。尽管PMV在建筑标准中被广泛采用,但已被反复证明在真实环境中会错误预测舒适度,因为它无法捕捉行为适应、瞬态条件和个体间差异\[18 (https://arxiv.org/html/2608.20423#bib.bib15), 11 (https://arxiv.org/html/2608.20423#bib.bib23)\]。自适应舒适度模型引入了基于室外温度的上下文适应,但仍在群体层面运行,且未纳入生理信号\[9 (https://arxiv.org/html/2608.20423#bib.bib16)\]。

最新进展表明,热舒适度具有高度个体化特征,受到生理、适应、衣着、活动水平和行为模式的影响\[21 (https://arxiv.org/html/2608.20423#bib.bib5), 8 (https://arxiv.org/html/2608.20423#bib.bib24), 1 (https://arxiv.org/html/2608.20423#bib.bib25)\]。可穿戴传感技术现在能够持续测量皮肤温度、心率、活动和外周热状态,为个性化舒适度推理提供更丰富的数据流\[24 (https://arxiv.org/html/2608.20423#bib.bib1), 2 (https://arxiv.org/html/2608.20423#bib.bib6)\]。2020年至2025年间发表的研究扩展了这一方向,一致表明个性化舒适度模型在准确度上比PMV高出30-50%以上\[27 (https://arxiv.org/html/2608.20423#bib.bib26), 8 (https://arxiv.org/html/2608.20423#bib.bib24), 16 (https://arxiv.org/html/2608.20423#bib.bib27)\]。这些发现突显了向以住户为中心的舒适度建模的明确转变,其中生理和行为信号构成了准确、自适应热偏好预测的基础。

### 2.2 基于机器学习的个性化热舒适度预测
机器学习已成为个性化热舒适度预测的主要方法,特别是应用于多模态生理和环境数据时。集成学习方法(RF、GB和ET)在可穿戴数据集上展现了强大的预测性能,在不同住户群体中准确率达到0.65至0.85之间\[24 (https://arxiv.org/html/2608.20423#bib.bib1), 2 (https://arxiv.org/html/2608.20423#bib.bib6)\]。这些模型在最近的研究中由于其对表格型传感器数据的鲁棒性而保持竞争力\[8 (https://arxiv.org/html/2608.20423#bib.bib24), 28 (https://arxiv.org/html/2608.20423#bib.bib28)\]。

深度学习方法也逐渐受到关注。卷积和循环神经网络已被用于捕捉生理信号中的时间动态\[16 (https://arxiv.org/html/2608.20423#bib.bib27), 29 (https://arxiv.org/html/2608.20423#bib.bib29)\],而基于Transformer的架构最近也被探索用于建模长程热偏好依赖关系\[38 (https://arxiv.org/html/2608.20423#bib.bib37)\]。结合生理传感和行为数据的混合模型\[27 (https://arxiv.org/html/2608.20423#bib.bib26), 17 (https://arxiv.org/html/2608.20423#bib.bib38)\]在住宅环境中显示出改进的泛化能力。近期文献(2020-2025)中一个显著的趋势是从离散的热感觉标签转向概率性的舒适度表示。包括\[7 (https://arxiv.org/html/2608.20423#bib.bib39)\]和\[29 (https://arxiv.org/html/2608.20423#bib.bib29)\]在内的研究表明,基于概率的舒适度输出为下游控制任务提供了更丰富的反馈,能够实现更稳定和可解释的决策。然而,大多数机器学习研究仅关注预测而非控制,在将个性化舒适度推理与实时HVAC决策相结合方面留下了明显空白。

### 2.3 智能热控制与强化学习
智能HVAC控制已通过优化、模型预测控制(MPC)和强化学习得到广泛探索。MPC方法在节能建筑控制方面表现出强大性能\[3 (https://arxiv.org/html/2608.20423#bib.bib30), 25 (https://arxiv.org/html/2608.20423#bib.bib31), 20 (https://arxiv.org/html/2608.20423#bib.bib32)\],但需要准确的热模型,并且常常难以应对住户变异性。强化学习提供了一种无模型替代方案,能够直接从交互数据中学习最优控制策略。

早期工作也探索了生理控制的HVAC系统,其中将个人热偏好和生理测量相结合,以确定共享环境的共识温度设定点。尽管这些方法证明了以住户为中心控制的可行性,但它们依赖于预定义的控制算法而非自适应的强化学习策略\[19 (https://arxiv.org/html/2608.20423#bib.bib4)\]。近期的强化学习-HVAC研究已应用DQN、软演员-评论家(SAC)、近端策略优化...

相似文章

利用主动学习构建集成热能系统的基于物理的数字孪生

arXiv cs.LG

本文提出了一种主动学习框架,将高保真 Modelica 仿真与更简单的代理模型(SINDyC、FNN、GRU)相结合,以创建高效的热能分配系统数字孪生。该方法在保持预测精度和实现不确定性量化的同时,显著减少了所需的仿真轨迹数量。