通过执行语义弥合基于强化学习的工业调度中的仿真到现实差距
摘要
本文提出了一种策略中立的执行与测量层,以弥合基于强化学习的工业调度中的仿真到现实差距,实现执行错误的结构化归因,提升可靠性与可解释性。
arXiv:2605.29078v1 公告类型:new
摘要:事件驱动的调度策略日益部署于工业环境,在此类环境中,决策在异步且部分可观测的系统状态下做出。因此,决策状态在时间上不一致,动作的可接受性未被明确定义,且执行错误的来源仍然模糊。这些问题限制了可靠性与可解释性。
为弥合这一差距,本文提出一种策略中立的执行与测量层,以协调调度策略与工业执行环境。该层从异步事件流中构建决策有效的快照,定义包含明确动作可接受性的标准化执行合约,并将结果记录为策略意图、事务性结果、物理执行与人工干预之间的偏差。这使得决策语义与执行行为得以分离,并使部署不匹配变得可观测且可结构化归因。
所提出的框架通过离散事件仿真进行评估。结果表明,在所有观测滞后条件下均具有分析优势,无差别的执行失败被转化为具有完整归因覆盖的结构化、类型化结果。在观测滞后较低时,运营优势最为显著,可避免的执行错误能在提交前得到预防。总体而言,该层将执行不确定性转化为用于评估与策略改进的监督数据。
查看缓存全文
缓存时间: 2026/05/29 09:12
# 弥合基于强化学习的工业调度中的模拟到现实鸿沟:通过执行语义 ††感谢:由Chips联合企业及其成员支持,包括国家当局的追加资助,隶属于Cynergy4MIE项目(授权协议号101140226)。 来源:https://arxiv.org/html/2605.29078 ###### 摘要 事件驱动的调度策略越来越多地部署在工业环境中,决策在异步和部分观测的系统状态下做出。因此,决策状态在时间上不一致,动作可允许性未被明确定义,执行错误的起源仍然模糊。这些问题限制了可靠性和可解释性。 为弥合这一鸿沟,本文提出一个策略无关的执行与测量层,作为调度策略与工业执行环境之间的中介。该层从异步事件流构建决策有效的系统快照,定义具有明确动作可允许性的标准化执行契约,并将结果记录为策略意图、事务性结果、物理执行和人为干预之间的偏差。这使得决策语义与执行行为得以分离,并使部署中的不匹配变得可观察且可结构性地归因。 所提出的框架通过离散事件仿真进行评估。结果表明在所有观测延迟区间内均具有分析性优势,未区分的执行失败被转化为带有完整归因覆盖的结构化、类型化结果。操作性优势在低观测延迟下最为显著,此时可避免的执行错误能在提交前被阻止。总体而言,该层将执行不确定性转化为用于评估和策略优化的监督数据。 ## I引言 作业车间调度问题(JSSP)是生产控制中制定和训练调度策略的基础模型[1 (https://arxiv.org/html/2605.29078#bib.bib1)]。虽然经典方法依赖静态启发式规则(如优先级调度规则),但近期研究越来越多地采用强化学习(RL)直接从模拟的JSSP环境中学习自适应调度行为[2 (https://arxiv.org/html/2605.29078#bib.bib2)]。受基于图的表示、可扩展的RL架构以及新兴离线训练方法的推动,近期工作表明基于RL的调度可以提升策略质量、适应性以及应用于更大规模调度实例的能力[3 (https://arxiv.org/html/2605.29078#bib.bib3), 2 (https://arxiv.org/html/2605.29078#bib.bib2), 4 (https://arxiv.org/html/2605.29078#bib.bib4), 5 (https://arxiv.org/html/2605.29078#bib.bib5)]。 尽管取得了这些进展,基于RL的调度在工业中的采用仍然有限。正如近期关于基于RL的调度系统验证与部署的工作所强调的,成功部署不仅取决于优化性能,还依赖于监控、可解释性、安全性、工作流集成、操作员交互以及模拟到现实的鲁棒性[6 (https://arxiv.org/html/2605.29078#bib.bib6)]。 在实践中,策略被嵌入制造执行系统(MES)、企业资源规划(ERP)系统和物理生产环境中,必须在异步数据流、部分可观测性和人为干预下运行。在这些条件下,调度器不再基于同步且完全观测的状态行动。相反,决策基于从异构事件流重构且具有时间滞后的观测值。这引入了策略假设与执行现实之间的结构性不匹配,仅靠提升策略质量无法解决[7 (https://arxiv.org/html/2605.29078#bib.bib7)]。 本文认为核心局限在于缺乏一个在决策制定与工业执行系统之间充当中介的执行与测量层。没有这样的层,决策有效性、执行可行性及结果归因便隐式定义,无法以结构化方式进行分析。 为解决这一局限,本文提出一个策略无关的执行与测量层,该层从异步数据构建决策有效的状态表示,定义跨异构策略的共享执行契约,并支持执行结果的结构化归因。贡献在于方法论和架构层面,聚焦于部署时的语义而非策略设计。 ## II 当前文献中的模拟到现实鸿沟 现有关于基于RL的调度的工作承认训练环境与工业部署之间存在差异。文献大致可分为三个研究方向来解决这一鸿沟。 第一类研究关注对扰动的鲁棒性。这类方法在变化的系统条件下训练策略,例如通过引入动态任务到达、机器故障、随机加工时间、设置时间、运输过程、缓冲区约束或其他与生产相关的限制[8 (https://arxiv.org/html/2605.29078#bib.bib8), 9 (https://arxiv.org/html/2605.29078#bib.bib9), 10 (https://arxiv.org/html/2605.29078#bib.bib10), 3 (https://arxiv.org/html/2605.29078#bib.bib3), 11 (https://arxiv.org/html/2605.29078#bib.bib11)]。目标是通过在训练中让策略暴露于更广泛的情景来提高泛化能力。 第二类工作依赖于模仿学习和离线学习。这些方法直接从历史数据或专家演示中学习调度行为[4 (https://arxiv.org/html/2605.29078#bib.bib4), 3 (https://arxiv.org/html/2605.29078#bib.bib3), 7 (https://arxiv.org/html/2605.29078#bib.bib7)]。通过利用观测到的执行数据,它们旨在捕捉难以显式建模的操作模式。 第三类包括元学习和知识迁移方法。这些方法旨在通过任务间知识迁移或将策略压缩为更高效的表示来提高跨环境的适应性[12 (https://arxiv.org/html/2605.29078#bib.bib12), 9 (https://arxiv.org/html/2605.29078#bib.bib9)]。这使得无需从头重新训练即可快速适应新的生产环境。 尽管存在差异,这些方法共享一个共同策略。它们通过提高策略对训练与执行条件之间差异的鲁棒性来改善部署性能。同时,它们大多保留了一个假设:在推理时存在有效的决策状态和一致的动作接口。 因此,部署不匹配的根本原因仍未得到充分解决。关注点在于吸收观测与执行之间的不一致,而不是使其显式化、可测量和可归因。这一局限促使本文提出的执行与测量概念,将焦点从策略层面的鲁棒性转向部署时的显式执行语义。 ## III 工业调度的执行层需求 工业调度中的模拟到现实鸿沟反映了调度决策与其在生产系统中实现之间的不匹配。这种不匹配源于部署环境的结构性特征,而这些特征在现有方法中未被明确捕捉。 本文识别出工业部署中出现的三个执行层挑战。这些挑战涉及异步观测下的状态构建、跨异构系统的执行语义与动作可允许性,以及意图与实现执行之间偏差的结构化归因。下文从这些挑战出发,推导出执行与测量层设计的各项需求。 ### III-A 异步观测下的状态构建 调度策略在工业环境中的部署从根本上受到决策时系统状态构建方式的限制[7 (https://arxiv.org/html/2605.29078#bib.bib7)]。与JSSP公式和RL训练环境通常假定的同步且完全可观测的状态表示不同,真实生产系统运行在异步、事件驱动的数据流之上。关于任务进度、机器状态和资源可用性的信息分布在MES和ERP系统中,并且通常带有不可忽略的延迟或不一致性。因此,面向调度器的状态并不是底层真实世界的直接表示,而是从部分且时间错位的观测中拼凑出的重构状态[13 (https://arxiv.org/html/2605.29078#bib.bib13)]。 这种不匹配将有效问题表述从完全可观测的马尔可夫决策过程转变为部分可观测环境。结果,调度器基于的状态未必对应于底层的物理和事务性系统状态。因此,基于可用观测有效的决策在执行时可能因延迟更新、缺失确认或未观测到的系统变化而变得不可行。 这种投影差距要求本文提出的执行与测量层提供一种显式机制来构建决策有效的状态表示,整合异步输入,强制时间一致性,并表示由不完整或延迟信息引起的不确定性。 ### III-B 执行约束下的动作可允许性 除了不完整且时间错位的系统状态投影之外,工业部署中的另一个挑战源于缺乏对决策如何被解释和执行的明确定义。当前调度方法隐含地依赖于一个定义良好的动作空间和一组在推理时可用的可允许决策。在工业环境中,这一假设无法得到保证[7 (https://arxiv.org/html/2605.29078#bib.bib7)]。虽然ISA-95等框架定义了企业与控制层之间的分层数据交换[14 (https://arxiv.org/html/2605.29078#bib.bib14)],MES和ERP系统管理事务性工作流和系统协调,但两者均未提供面向调度器的定义,说明决策何时有效、如何触发以及动作在什么条件下可以执行[13 (https://arxiv.org/html/2605.29078#bib.bib13)]。 即使在新兴的工业4.0架构中(例如IoT和数字孪生等基础设施提升了系统可见性和表示能力[13 (https://arxiv.org/html/2605.29078#bib.bib13), 15 (https://arxiv.org/html/2605.29078#bib.bib15)]),重点仍在于数据可用性而非决策如何转化为系统动作[16 (https://arxiv.org/html/2605.29078#bib.bib16)]。 当在同一生产环境中集成异构调度方法时,这一差距变得尤为突出,因为这些策略在同一个底层系统上运行时,依赖于关于状态完整性、时序和动作可行性的不同隐含假设。没有关于决策如何解释的共享定义,候选动作仍然模糊,无法在执行前进行一致验证。 这引出了本文提出的执行与测量层的第二个需求。该层必须定义一个执行契约,规定决策如何表示、何时被认为有效、如何触发以及如何转化为系统动作。它必须提供动作可允许性的显式语义,并确保在事务性约束下对决策进行一致的验证、拒绝或延迟。此外,它还必须支持将人为干预作为执行过程的显式表示元素进行集成。 ### III-C 结构化执行结果归因 工业部署中的另一个挑战涉及执行结果的归因。在当前实践中,计划动作与执行动作之间的偏差未被归因于不同原因。失败或变更的动作被记录为通用扰动,而未系统区分偏差源于物理约束、事务性不一致还是人为干预。同时,向工业5.0的过渡日益强调人在环中的决策制定[15 (https://arxiv.org/html/2605.29078#bib.bib15), 17 (https://arxiv.org/html/2605.29078#bib.bib17)]。因此,人为干预不应再被视为外生噪声,而必须作为执行结果的一个独立来源显式表示。 缺乏区分限制了评估和学习。观测到的结果不能可靠地反映策略质量,因为偏差可能源于外部约束而非次优决策。历史数据同样不适合学习,因为不同类型的执行失败被混为一谈。 这引出了需求:执行与测量层必须提供一个结构化表示,链接策略意图、执行上下文和实际行为。它必须显式区分偏差来源,从而支持一致的评估和系统的策略改进。 ## IV 所提出的架构:执行与测量层 我们提出一个执行与测量层,作为调度策略与工业执行环境之间的中间件。它控制如何将异构的物理和事务性事件流转化为决策相关状态,并定义何时以及何种条件下调用策略。以下各节详细说明通过快照进行状态隔离、通过执行契约进行决策制定以及结果归因的机制,以及部署所需的实现约束。 ### IV-A 面向决策有效性的状态快照隔离 从模拟到现实问题中衍生出的一个需求是:在具有异构和异步数据源的工业环境中,需要在推理时构建一个决策有效的系统状态。持续更新策略状态会使智能体暴露于破碎且时间不一致的信息中。所提出的层通过引入快照隔离机制来解决这一问题,该机制提供系统的一致视图,并定义如何在异步条件下构建和暴露决策相关状态。 传入的物理和事务性事件流累积在一个持续更新的执行缓存中。当调度触发发生时,该层隔离一个时间点快照 \( s_k \),代表决策时间点 \( k \) 时面向调度器的系统状态。该隔离解决冲突的时间戳,并整合执行所需的物理观测和事务性注释。 隔离后,快照在整个决策过程中保持不变。策略评估 \( s_k \) 而不受并发状态更新的影响。这防止了推理期间不一致的状态转换,并确保决策基于时间稳定的表示。然而,隔离并不意味着完整性。尚未到达的事件或周围系统中仍处于潜在状态的事务性状态不会在 \( s_k \) 中表示,并可能影响决策在执行时的有效性。 为维护决策与执行之间的一致性,该层监控不完整
相似文章
衡量模拟到现实的差距:为AIoT系统中的强化学习设计一个经济实惠的真实世界基准平台
本文介绍了一个为AIoT系统中的强化学习设计的经济实惠的真实世界基准平台,利用视频游戏来衡量模拟到现实的差距,并展示了将模拟训练出的智能体迁移到现实世界时性能显著下降的现象。
注意仿真与现实的差距,并像科学家一样思考
本文研究在序贯决策问题中,规划者何时以及如何用真实实验补充预训练模拟器,提出Fisher-SEP以最小化目标策略值的后验方差。
通过动力学随机化实现机器人控制的仿真到现实迁移
OpenAI 研究人员演示了一种通过使用随机化的模拟器动力学来训练策略,从而弥合现实差距的方法。这使得完全在仿真环境中训练的机器人能够成功迁移到现实世界任务,如物体操作,无需进行物理训练。
面向仓库SLAM吞吐量控制的离线强化学习
本文提出了一种离线强化学习框架,用于优化仓库履约环境中的SLAM吞吐量控制,在吞吐量最大化与下游稳定性之间取得平衡。该方法与算法无关,并证明CQL策略将系统健康状况提升了22.97%,并将限流持续时间减少了3.18%。
基于自适应奖励塑造和策略比率重加权策略的高样本效率迁移强化学习
本文提出了一种用于自动驾驶高速公路车道变换的安全迁移强化学习框架,采用自适应教师干预和奖励塑造来提高样本效率和安全性。实验表明,与基线相比,安全性提升超过52%,效率提升5%。