通过扩散代理强化学习的高效地热井控优化
摘要
本文提出了一种扩散代理引导的强化学习框架,用于高效的地热井控优化,减少对昂贵高保真模拟的依赖。
arXiv:2608.28791v1 Announce Type: new
摘要:增强地热系统 (EGS) 的实时决策具有挑战性,因为长期生产阶段涉及高维控制空间和大量耗时的高保真水热模拟。强化学习为基于状态的顺序控制提供了一个自然框架,但直接使用数值模拟器进行策略训练计算成本高昂。为解决这一问题,我们提出了一种扩散代理引导的强化学习框架,用于长期视野的 EGS 井控优化。储层温度和压力场用作系统状态,而注入速率被选为控制动作。利用条件扩散模型构建了一个学习到的代理环境,以预测储层温度和压力场的演化,并使用单独的奖励模型来估计相应的经济回报。然后,将代理环境与近端策略优化 (PPO) 集成,以进行高效的策略训练。在破碎 EGS 基准上的实验表明,扩散代理能够准确再现多个控制阶段的储层状态演化。所得的代理辅助 PPO 策略在井控性能上与直接基于模拟器的 PPO 和现有优化方法相比具有竞争力,同时显著减少了对昂贵高保真模拟的依赖。这些结果展示了基于扩散的代理环境在高效地热井控强化学习中的潜力。
查看缓存全文
缓存时间: 2026/09/01 12:39
# 基于扩散代理强化学习的地热井控高效优化 来源:https://arxiv.org/html/2608.28791 戴瑞敏 郭栋 陈 所属单位:能源地球科学部 劳伦斯伯克利国家实验室 加州大学伯克利分校 美国加州伯克利 [email protected] 所属单位:兰迪·哈苏科 所属单位:能源地球科学部 劳伦斯伯克利国家实验室 加州大学伯克利分校 美国加州伯克利 [email protected] 所属单位:刘坤鹏 所属单位:克莱姆森大学计算学院 美国南卡罗来纳州克莱姆森 [email protected] 所属单位:中田纪* 所属单位:能源地球科学部 劳伦斯伯克利国家实验室 美国加州伯克利 [email protected] ###### 摘要 增强型地热系统(EGS)的实时决策颇具挑战性,因为长期生产过程涉及高维控制空间和大量耗时的高精度热流体动力学模拟。强化学习为基于状态的序列控制提供了天然框架,但直接使用数值模拟器训练策略计算成本高昂。为解决此问题,我们提出了一种扩散代理引导的强化学习框架,用于长期地热井控优化。储层温度场和压力场被用作系统状态,注入速率被选为控制动作。利用条件扩散模型构建一个学习的代理环境来预测储层温度场和压力场的演化,并使用单独的奖励模型估算相应的经济回报。然后将该代理环境与近端策略优化(PPO)结合,用于高效的策略训练。在一个裂缝性EGS基准案例上的实验表明,扩散代理可以准确复现多个控制阶段的储层状态演化。所得的代理辅助PPO策略在井控性能上与直接基于模拟器的PPO和现有优化方法相比具有竞争力,同时显著减少了对昂贵高精度模拟的依赖。这些结果证明了基于扩散的代理环境在地热井控高效强化学习优化中的潜力。 ###### 索引术语: 增强型地热系统;井控优化;强化学习;扩散模型;代理建模 \*\*脚注:通讯作者。 ## I 引言 增强型地热系统(EGS)提供了一种实用的方法,可以从自然渗透性不足以进行传统地热生产的高温岩层中提取地热能[1 (https://arxiv.org/html/2608.28791#bib.bib2), 2 (https://arxiv.org/html/2608.28791#bib.bib1), 3 (https://arxiv.org/html/2608.28791#bib.bib3)]。如图1 (https://arxiv.org/html/2608.28791#S1.F1)所示,相对较冷的流体通过注入井注入地热储层,在裂缝和周围岩石基质中循环,并从热地层吸收热量。然后,加热后的流体通过生产井采出并输送到地表用于发电或直接供热。这种循环过程实现了从地下储层连续提取热量。由于裂缝是流体运移的主要通道,EGS的性能强烈依赖于地下流动与传热的耦合行为[4 (https://arxiv.org/html/2608.28791#bib.bib4), 5 (https://arxiv.org/html/2608.28791#bib.bib5), 6 (https://arxiv.org/html/2608.28791#bib.bib6)]。井操作的变化可以重新分配储层压力并改变流体循环路径,进而改变温度场的演化。这些效应直接影响储层体积的波及效率、生产井何时发生冷水突破以及长期运行可回收的热能量。 参见图注图1:增强型地热系统(EGS)示意图。冷水通过注入井注入地热储层,在地下地层中循环时被加热,然后通过生产井采出用于地表能量利用。 因此,合理设计的井操作策略对于EGS项目的长期经济表现至关重要。井控优化旨在确定地热生产不同阶段的合适控制设置,以便在项目寿命期内高效提取热量并保持经济可行性[7 (https://arxiv.org/html/2608.28791#bib.bib7), 8 (https://arxiv.org/html/2608.28791#bib.bib8), 9 (https://arxiv.org/html/2608.28791#bib.bib9)]。根据操作方案,决策变量可能包括注入速率、生产速率和井底压力。这些决策不仅影响即时的生产响应,还影响储层压力、温度以及整体生产潜力的后续演化。 因此,井控优化不能简化为在单个时间步长上最大化短期注入速率、生产速率或热输出[9 (https://arxiv.org/html/2608.28791#bib.bib9), 10 (https://arxiv.org/html/2608.28791#bib.bib20), 11 (https://arxiv.org/html/2608.28791#bib.bib21)]。控制决策必须在整个开发周期内进行评估,将增加的热产量与流体注入、生产和其他操作活动相关的成本进行权衡。净现值(NPV)通常用于将这种权衡纳入单一经济目标。从这个角度看,EGS井控优化可以表述为一个序列决策问题,搜索一个时间依赖的控制策略,以在整个生产期间最大化累计经济回报。 强化学习(RL)非常适合处理长期序列决策问题,其中当前控制动作影响未来的系统状态和回报[12 (https://arxiv.org/html/2608.28791#bib.bib10), 13 (https://arxiv.org/html/2608.28791#bib.bib11), 14 (https://arxiv.org/html/2608.28791#bib.bib12), 15 (https://arxiv.org/html/2608.28791#bib.bib13)]。RL并非直接优化预定的固定控制变量序列,而是通过智能体与环境的交互来学习策略,从当前状态选择动作以最大化决策周期内的累积奖励。这种表述已用于工程控制问题,包括油气藏生产优化,其中储层状态作为观测,井控变量定义动作空间,净现值(NPV)作为奖励[16 (https://arxiv.org/html/2608.28791#bib.bib14), 17 (https://arxiv.org/html/2608.28791#bib.bib29)]。同样的序列结构也出现在EGS井控优化中。每个控制阶段的注入决策都会改变储层压力场和温度场,这些变化会影响后续阶段的热提取和经济性能。因此,RL可以依据不断演化的储层状态来制定井控决策,并针对长期经济回报进行优化,而不是仅仅针对单个控制步骤的即时响应进行优化。 尽管优化方法已被应用于井控优化,但长期EGS井控优化仍存在三个关键限制: 1. **高维井控空间增加了优化难度。** 优化多个井在多个控制阶段的参数会产生大量决策变量。结合井控与储层响应之间的非线性关系,这种高维搜索空间可能需要大量评估才能收敛,并且可能阻碍优化器在有限计算预算内识别出高质量的控制方案[18 (https://arxiv.org/html/2608.28791#bib.bib15), 19 (https://arxiv.org/html/2608.28791#bib.bib16)]。 2. **热流体动力学模拟构成了主要的计算瓶颈。** 通常,每个候选控制方案都必须使用计算成本高昂的热流体动力学模拟进行评估[20 (https://arxiv.org/html/2608.28791#bib.bib17), 8 (https://arxiv.org/html/2608.28791#bib.bib8), 21 (https://arxiv.org/html/2608.28791#bib.bib18)]。由于优化需要反复评估不同的控制方案,模拟成本可能主导整个优化过程。同样的问题在RL中更为突出,因为策略学习需要与模拟环境进行大量交互。 3. **预定义的控制序列未明确考虑不断演化的储层状态。** 大多数现有优化方法预先确定整个生产周期的井控序列。这些开环策略没有建立从演化中的储层状态到后续控制动作的明确映射。因此,生产过程中储层温度和压力的变化无法直接纳入后续的井控决策中,限制了对运行中遇到的储层条件的适应性[22 (https://arxiv.org/html/2608.28791#bib.bib19)]。 为解决这些限制,我们提出了一种扩散代理强化学习框架,用于长期EGS井控优化。我们将井控表述为一个序列决策问题,其中储层温度场和压力场代表系统状态,注入速率被选为控制动作。为降低反复进行热流体动力学模拟的成本,我们构建了一个代理环境,其中条件扩散模型根据当前状态和动作预测下一个储层状态,而单独的奖励模型估算相应的NPV奖励。然后,将学习的代理环境与近端策略优化(PPO)[23 (https://arxiv.org/html/2608.28791#bib.bib22)]结合,用于高效的策略训练,同时使用高精度COMSOL模拟器进行最终的策略评估。我们的贡献总结如下: - **问题表述。** 我们将EGS井控优化表述为一个基于状态的序列决策问题。该表述学习一个将演化中的储层温度场和压力场映射到井控动作的策略,而非在整个生产周期内优化固定的开环控制序列。 - **算法。** 我们开发了一种基于扩散的代理环境用于RL训练。条件扩散模型近似储层状态转换(以当前状态和注入动作为条件),而单独的奖励代理估算由此产生的经济回报。将这些模型与PPO集成,减少了策略学习期间所需的高精度热流体动力学模拟次数。 - **评估。** 我们在一个裂缝性EGS井控问题上评估了所提出的框架,考察了代理预测准确性、控制性能和计算成本。结果表明,学习的策略在需要显著更少的高精度模拟评估的情况下,达到了有竞争力的性能。 ## II 问题陈述 参见图注图2:提出的用于EGS井控优化的扩散代理强化学习框架概览,包括数据收集、代理环境构建、PPO策略训练和高精度策略评估。 ### II-A 裂缝性EGS的热流体动力学 本工作中考虑的增强型地热系统由被高渗透性裂缝切割的低渗透性岩石基质组成。裂缝提供了流体循环的优先通道,而周围的热岩石基质是主要的热源。在地热生产期间,相对冷水通过注入井注入储层。由此产生的压力梯度驱动流体通过裂缝网络流向生产井。当注入流体在储层中循环时,热量从热岩传递到流体,随后沿流动路径传输。因此,储层响应受流体流动与传热耦合演化的控制。 裂缝储层中的流体运移遵循质量守恒。对于多孔介质,控制方程可表示为: ∂(ρfφ)/∂t + ∇⋅(ρfu) = Ψmf + Qm, (1) 其中ρf表示流体密度,φ是孔隙度,u是达西速度,Ψmf代表岩石基质与裂缝之间的流体交换,Qm表示与井操作相关的质量源或汇。流体速度由达西定律控制: u = - (k/μ)(∇p + ρfg∇D), (2) 其中k是渗透率,μ是流体粘度,p是储层压力,g是重力加速度,D代表海拔坐标。由于裂缝渗透率远高于基质渗透率,裂缝网络形成了压力驱动流体运移的主导通道。储层温度演化由能量平衡方程控制,该方程考虑了对流和热传导传热: (ρC)eff ∂T/∂t + ρfCf u⋅∇T - ∇⋅(λeff∇T) = Emf + Qh, (3) 其中T表示温度,(ρC)eff是流体-岩石系统的有效体积热容,Cf是流体比热容,λeff是有效导热系数,Emf代表基质与裂缝之间的热交换,Qh表示热源或热汇。 这些耦合的热流体动力学过程建立了井操作与储层演化之间的直接关系。改变注入速率会修改储层压力梯度和流体循环路径,从而改变热传输和储层温度的空间分布。因此,井控决策不仅影响瞬时生产响应,还影响储层未来的热状态和水力状态。在本工作中,耦合的热流体动力学方程使用高精度COMSOL模拟器求解,所得的温度场和压力场用于表征储层状态。 ### II-B 强化学习表述 基于上述耦合的热流体动力学,我们将EGS井控优化表述为一个有限时域马尔可夫决策过程(MDP)。在每个控制步t,储层状态表示为: s_t = [T_t, P_t], (4) 其中T_t和P_t分别表示储层温度场和压力场。这两个场表征了耦合流体流动与传热过程产生的热状态和水力状态。 给定当前储层状态,参数化策略π_θ确定井控动作: a_t = [q_{1,t}, ..., q_{N_I,t}], (5) 其中q_{i,t}表示第i口注入井的注入速率,N_I是注入井的数量。应用a_t改变压力分布和流体
相似文章
GDSD:强化学习作为扩散语言模型的引导式降噪器自蒸馏
GDSD提出了一种强化学习方法,直接从优势引导的自教师中蒸馏扩散语言模型的降噪器,避免了基于ELBO的似然代理带来的偏差。在规划、数学和编码基准上,比先前最先进的方法准确率提升高达+19.6%。
SafeDiffusion-R1: 在线奖励引导的安全扩散后训练
SafeDiffusion-R1 引入了一个基于 GRPO 和引导奖励机制的在线强化学习框架,用于提升扩散模型的安全性,无需监督数据或奖励调优,在多个有害类别上实现了最先进的性能。
Spectral Guidance:灵活高效的扩散模型控制方法
介绍了Spectral Guidance,一种通过利用扩散过程的低维表示来控制扩散模型的框架,无需任务特定的重新训练或通过去噪器的反向传播即可实现灵活稳定的控制。
LeanGRPO: 消除扩散强化学习中的冗余重计算
LeanGRPO通过引入无重计算的训练计划,消除扩散强化学习方法中的冗余重计算,在保持优化目标的同时实现高达1.83倍的速度提升。
不破坏的引导:基于机制的离散扩散语言模型干预
本文介绍了一种新颖的自适应调度器,用于利用稀疏自编码器引导离散扩散语言模型,结果表明,基于特定属性提交时机进行针对性干预,比均匀方法能提升控制质量和强度。