注意仿真与现实的差距,并像科学家一样思考
摘要
本文研究在序贯决策问题中,规划者何时以及如何用真实实验补充预训练模拟器,提出Fisher-SEP以最小化目标策略值的后验方差。
arXiv:2605.21458v1 公告类型:new
摘要:假设规划者拥有一个针对序贯决策问题的预训练模拟器,并且可以选择在实地进行真实实验。模拟器的查询成本低廉,但其校准数据会带来混杂和漂移。实验无偏,但每次试验消耗一个真实单位。我们研究规划者何时以及如何用实验补充模拟器。我们给出三个结果。首先,一个扩展的模拟引理将模拟器的价值误差分解为校准-部署偏移(可通过随机化识别)和一个参数残差(无法通过进一步交互减少)。其次,模拟器最优策略与最优策略之间的价值差距分为两部分:一个局部分量(涉及已部署策略已访问的状态)和一个可达性分量(涉及未访问的状态)。在纯被动学习下,可达性分量在任何时间范围内都远离零。第三,我们提出了Fisher-SEP,一种仿真辅助实验策略(SEP),它最小化目标策略值的后验预测方差,并具有仅奖励和仅转移的专门化变体。两个案例研究说明了这些机制。在一个自动售货机供应链中,一旦时间范围足够长以摊销试点,前期实验就会超过后验更新。在一个HIV移动检测示例中,有一条走廊分隔了监测良好区域和监测不良区域,只有设计性探索才能到达监测不良区域。
查看缓存全文
缓存时间: 2026/05/22 08:50
# 注意模拟到现实的差距,像科学家一样思考
标题的前半部分借用了伦敦地铁的提示语“Mind the Gap”,论文将其作为价值差距的局部与可达性分解的隐喻(命题1)。后半部分借用了GoNoodle的儿童歌曲《像科学家一样思考》,并指出了行动方案:**使用模拟器来选择在哪里进行实验,而不是选择要部署的策略**。来源:https://arxiv.org/html/2605.21458
Harsh Parikh
Amazon SCOT, 西雅图, 美国
耶鲁大学, 纽黑文, 美国
& Gabriel Levin-Konigsberg
Amazon SCOT, 西雅图, 美国
& Dominique Perrault-Joncas
Amazon SCOT, 西雅图, 美国
& Alexander Volfovsky
Amazon SCOT, 西雅图, 美国
杜克大学, 达勒姆, 美国
###### 摘要
假设一个规划者拥有一个预训练的序贯决策问题模拟器,并且可以选择在现实环境中进行真实实验。模拟器查询成本低,但其校准数据中存在混杂和漂移问题。实验无偏,但每次试验消耗一个真实单元。我们研究规划者何时以及如何用实验来补充模拟器。我们给出三个结果。首先,一个扩展的模拟引理将模拟器的价值误差分解为:随机化可以识别的校准-部署偏移部分,以及任何进一步交互都无法减少的参数残差部分。其次,模拟器最优策略与最优策略之间的价值差距被分解为两部分:一部分是**局部**分量,作用于已部署策略已访问的状态;另一部分是**可达性**分量,作用于它未访问的状态。在完全被动学习下,可达性分量在任何时间范围内都保持远离零。第三,我们提出**Fisher-SEP**,一种模拟辅助实验策略(SEP),它最小化目标策略价值的后验预测方差,并包含仅奖励和仅转移的专门化形式。两个案例研究说明了这些机制。在一个自动售货机供应链案例中,一旦时间范围足够长以分摊试点成本,前期实验就会超越后验更新。在一个HIV移动检测案例中,存在一条分隔监控良好区域与监控不良区域的走廊,只有设计好的探索才能到达监控不良区域。
## 1 引言
一个移动HIV检测计划需要决定每周将检测车派往何处。该团队拥有一个预训练的社区流行率**模拟器**——一个概率预测模型,对于每个区域和每周的检测选择,预测发现的新病例的预期数量,该模型根据两年的诊所数据进行拟合(Gonsalves 等人,2018 (https://arxiv.org/html/2605.21458#bib.bib150);Warren 等人,2025 (https://arxiv.org/html/2605.21458#bib.bib152))——并且每周有固定的车辆预算。模拟器根据预期新病例产出对区域进行排序,因此廉价的选择是直接部署由此产生的路线。另一种选择是将一部分车辆转移到模拟器排名较低的区域。转移车辆意味着在服务良好的区域失去即时外展机会,但这是了解低排名区域是真正的低流行率还是仅仅从未被检测过的唯一途径。这就是我们研究的问题。
这个问题比HIV检测更具普遍性。任何拥有预训练的现实世界系统模拟器的规划者都必须决定是否、何时以及如何用现实世界数据来补充它。模拟器是根据历史数据构建的,而这些历史数据是在存在**隐藏状态**的情况下,根据所选动作收集的:隐藏状态是影响奖励和转移但未被直接观测到的世界特征。由于历史操作者的动作与隐藏状态可能相关,模拟器的校准数据混淆了动作的效果与隐藏状态的效果。这就是因果推断中所说的**混杂**(Pearl, 2009 (https://arxiv.org/html/2605.21458#bib.bib140); Bareinboim and Pearl, 2016 (https://arxiv.org/html/2605.21458#bib.bib29)):校准数据中的条件平均奖励结合了动作的因果效应和给定操作者选择下隐藏状态的效应。(具体来说:如果历史上的操作者只在流行率高的区域才派送车辆,那么高流行率和“派送车辆”在数据中都较高,模拟器无法区分高产出来自区域本身还是操作者的选择。)即使在部署之后,第二个问题依然存在。状态-动作空间的大片区域可能永远不会出现在规划者生成的任何轨迹中。因果推断对此的称呼是**阳性**(positivity)违反:部署策略下概率为零的状态-动作对不产生任何证据,因此没有多少后续在线数据能够对其提供信息(Parikh 等人,2024b (https://arxiv.org/html/2605.21458#bib.bib163), 2025b (https://arxiv.org/html/2605.21458#bib.bib164))。
混杂和阳性违反是同一画面的两个方面。模拟器是观测状态上的一个**马尔可夫决策过程**(MDP)——一个其下一个状态和奖励是当前状态和动作的马尔可夫函数的模型。世界是一个部分可观测MDP(POMDP),它通过让相关状态同时具有观测和隐藏分量来推广MDP(Zhang and Bareinboim, 2016 (https://arxiv.org/html/2605.21458#bib.bib133); Namkoong 等人,2020 (https://arxiv.org/html/2605.21458#bib.bib131))。(在本文中,**模拟器**指代一个被视为MDP的预训练动力学模型,**实验**指代一个故意随机化的现实世界研究。)这些观察引出了两个问题。*给定一个预训练的模拟器,规划者何时应该进行现实世界实验?*以及,*如何最好地使用模拟器:是作为学习可部署策略的工具,还是作为选择实验的工具?* 离线强化学习(RL)和混杂MDP提供了从记录数据学习和诊断潜在混杂因素的工具(Levine 等人,2020 (https://arxiv.org/html/2605.21458#bib.bib24); Wang 等人,2021 (https://arxiv.org/html/2605.21458#bib.bib130); Zhang and Bareinboim, 2016 (https://arxiv.org/html/2605.21458#bib.bib133); Kallus and Zhou, 2018 (https://arxiv.org/html/2605.21458#bib.bib76)),但将历史数据集视为唯一信号,并未针对未来的现场实验联合优化其使用。贝叶斯自适应MDP(其中未知的MDP参数被视为隐藏状态,并通过贝叶斯法则从观测到的奖励和转移中进行更新)和后验采样形式化了后验在部署期间应如何适应(Duff, 2002 (https://arxiv.org/html/2605.21458#bib.bib116); Guez 等人,2012 (https://arxiv.org/html/2605.21458#bib.bib117); Osband 等人,2013 (https://arxiv.org/html/2605.21458#bib.bib91); Russo 等人,2018 (https://arxiv.org/html/2605.21458#bib.bib55)),但它们在模拟器已经使用的同一参数族上进行更新,并且假设阳性成立,而不是诊断其何时失效。模拟到现实和混合RL结合了模拟和真实交互,包括由模拟器引导的基于Fisher信息的探索(Tobin 等人,2017 (https://arxiv.org/html/2605.21458#bib.bib13); Wagenmaker and Jamieson, 2024 (https://arxiv.org/html/2605.21458#bib.bib118); Ball 等人,2023 (https://arxiv.org/html/2605.21458#bib.bib35); Song 等人,2023 (https://arxiv.org/html/2605.21458#bib.bib123); Memmel 等人,2024 (https://arxiv.org/html/2605.21458#bib.bib145)),但通常将模拟器作为热启动部署。因果可迁移性描述了在一个群体中识别出的效应何时可以转移到另一个群体(Bareinboim and Pearl, 2016 (https://arxiv.org/html/2605.21458#bib.bib29); Parikh 等人,2025a (https://arxiv.org/html/2605.21458#bib.bib147); Lanners 等人,2025 (https://arxiv.org/html/2605.21458#bib.bib148)),但没有说明当迁移失败时应该进行哪些实验。多保真度贝叶斯优化将模拟器视为黑箱目标的廉价替代(Poloczek 等人,2017 (https://arxiv.org/html/2605.21458#bib.bib11); Kandasamy 等人,2017 (https://arxiv.org/html/2605.21458#bib.bib9)),但没有区分部署策略访问的状态和未访问的状态。我们的框架解决了一个在逻辑上先于所有这些的问题:对于给定的模拟器和有限的规划时间范围,价值差距的哪一部分可以通过被动在线更新来弥合,哪一部分需要刻意实验?有关详细比较,请参见附录H (https://arxiv.org/html/2605.21458#A8)。
**贡献**。我们在一个有限潜在决策理论框架中工作,其中模拟器是观测状态上的MDP,世界是POMDP。我们命名了规划者的三个选项:信任模拟器并部署(**模拟器最优策略**,SOP),将模拟器作为贝叶斯先验并被动更新(**自适应SOP**,A-SOP),或者利用模拟器的结构来选择实验(**模拟辅助实验策略**,SEP)。模拟器的误差分解为两个分量:一个作用于部署策略访问的状态(其访问支撑集),另一个作用于它未访问的状态,这两个分量对在线数据的反应方式不同。(i)**差距分解**。部署策略与最优策略之间的价值差距分解为一个**局部**部分(作用于部署策略的访问支撑集)和一个**可达性**部分(作用于其外部的状态)(命题1 (https://arxiv.org/html/2605.21458#Thmproposition1),定理6 (https://arxiv.org/html/2605.21458#Thmtheorem6))。后验均值最优的在线更新渐近地闭合局部部分,但可证明地让可达性部分保持开放。(ii)**Fisher-SEP**。我们提出Fisher-SEP,一种由Fisher信息引导的SEP实例,它最小化选定目标策略价值的后验预测方差(PVV)(定义5 (https://arxiv.org/html/2605.21458#Thmdefinition5)),并针对转移已知和奖励已知情况提供两种专门化形式。(iii)**案例研究与诊断**。一个自动售货机供应链案例实例化了局部机制。一个HIV移动检测活动实例化了可达性机制。一个逐对诊断指标,**探索优先级指数**(EPI),为每个$(s,a)$对给出了应获得多少试点努力的分数(备注5 (https://arxiv.org/html/2605.21458#Thmremark5))。
**组织**。第2节 (https://arxiv.org/html/2605.21458#S2) 定义了世界、模拟器和策略类。第3节 (https://arxiv.org/html/2605.21458#S3) 阐述了差距分解。第4节 (https://arxiv.org/html/2605.21458#S4) 定义了Fisher-SEP。第5节 (https://arxiv.org/html/2605.21458#S5) 报告了案例研究。第6节 (https://arxiv.org/html/2605.21458#S6) 总结。图1 (https://arxiv.org/html/2605.21458#S1.F1.7) 用一个四状态例子说明了分解。
要么在线更新而不实验($\\blacksquare$)的策略停留在模拟器的面上,并且只闭合局部差距;实验策略($\\blacktriangle$)到达被忽略的角落并闭合可达性差距。)
## 2 设定
考虑一个由$n$个单元组成的总体,索引为$i \in \{1,\dots,n\}$,在离散时间$t \in \{0,\dots,T\}$上演化,折扣因子$\gamma \in [0,1)$——一个用于降低未来奖励重要性的权重,使得无限和的价值有限;**有效时间范围** $T_{\mathrm{eff}} := 1/(1-\gamma)$ 总结了策略规划的未来步数。每个单元有一个**观测状态** $S_{i,t} \in \mathbb{S}$ 和一个**隐藏状态** $H_{i,t} \in \mathbb{H}$,其中 $\mathbb{S}$ 和 $\mathbb{H}$ 是有限的。规划者从一个有限集合中选择动作 $A_{i,t} \in \mathbb{A}$,观测到奖励 $R_{i,t} \sim \rho(\cdot \mid S_{i,t}, A_{i,t}, H_{i,t}) \in [0, R_{\max}]$,并且状态转移为 $(S_{i,t+1}, H_{i,t+1}) \sim \wp(\cdot \mid S_{i,t}, A_{i,t}, H_{i,t})$。记 $\bar{r}(s,a,h) := \mathbb{E}[R \mid s,a,h]$ 为真实期望奖励,$\wp_S(\cdot \mid s,a,h)$ 为下一个观测状态核。由于 $H$ 是隐藏的,规划者只能看到 $(S,A,R)$ 上的边际过程,并且该边际在 $S$ 上单独不是马尔可夫的:过去的 $S,A$ 轨迹携带着关于当前 $H$ 的信息。
隐藏状态扮演两个角色。首先,它携带**混杂**:在模拟器训练的校准数据中,历史操作者的动作依赖于 $H$,因此在那些数据中 $A \not\perp H \mid S$(即 $A$ 在给定 $S$ 下**不**与 $H$ 条件独立)。其次,它携带**漂移**:$H$ 在给定 $S$ 下的条件分布在校准和部署之间发生了变化。在本文中,$\mathbb{P}_t(H \mid S)$ 表示部署时的条件分布,$\mathbb{P}_{\mathrm{calib}}(H \mid S,A)$ 表示校准时(即模拟器拟合时)的条件分布。用因果推断的语言来说,模拟器校准于观测到的 $\mathbb{E}[R \mid S,A]$,而规划者关心的是干预后的 $\mathbb{E}[R \mid S, \mathrm{do}(A)]$。只有当校准数据中 $A \perp H \mid S$ 时,两者才一致。
*三个近似层次*。模拟器是 $S$ 上的一个MDP。世界是 $(S,H)$ 上的一个POMDP。为了比较两者,我们需要一个仅在 $S$ 上的MDP;我们通过在每一步对隐藏状态进行平均来构建这样一个MDP,这丢失了信息(真实世界在 $H$ 中具有记忆,而这种构建丢弃了它),但当潜在动力学是收缩时,这种损失是有界的并且几何衰减(备注1 (https://arxiv.org/html/2605.21458#Thmremark1))。模拟器与世界之间的差距通过两个这样的 $S$ 上的中间马尔可夫对象来分解,每个对象是通过针对不同的条件分布对 $H$ 进行平均得到的。设 $\mathcal{M}^\star$ 表示真实世界。**部署时马尔可夫投影** $\mathcal{M}^\star_{\mathrm{obs}} = (\rho^\star_{\mathrm{obs}}, \wp^\star_{\mathrm{obs}})$ 在每一步根据部署时条件 $\mathbb{P}_t(H \mid S)$ 对 $H$ 进行平均,将 $H$ 视为从该条件中独立于过去 $(S,A)$ 轨迹的新抽取;真实的POMDP关于 $(S,A,R)$ 的边际在 $S$ 上单独不是马尔可夫的(因为过去轨迹携带着关于当前 $H$ 的信息),因此这个投影本身就是一个近似,其代价 $\epsilon^{\mathrm{hist}}$ 在备注1 (https://arxiv.org/html/2605.21458#Thmremark1) 中分析。**校准核** $\bar{\mathcal{M}}_{\mathrm{calib}} = (\bar{\rho}_{\mathrm{calib}}, \bar{\wp}_{\mathrm{calib}})$ 根据校准时条件 $\mathbb{P}_{\mathrm{calib}}(H \mid S,A)$ 对 $H$ 进行平均;这是在无限校准数据和完美指定参数族下模拟器训练过程的极限。模拟器 $\hat{\mathcal{M}}_{\mathrm{sim}} = (\hat{\rho}_{\mathrm{sim}}, \hat{\wp}_{\mathrm{sim}})$ 由于有限样本噪声和参数误设而与 $\bar{\mathcal{M}}_{\mathrm{calib}}$ 存在偏差。这四个对象位于一个链上:
$$\mathcal{M}^\star \; \xrightarrow{\; \epsilon^{\mathrm{hist}} \;} \mathcal{M}^\star_{\mathrm{obs}} \; \xrightarrow{\; \epsilon^相似文章
策略感知模拟器学习的理论基础与高效算法
本文提出了一种用于基于模型的强化学习中模拟器学习的策略鲁棒性目标,将其建模为模型玩家与对抗性策略玩家之间的极小极大博弈。提供了理论保证和可证明收敛的算法,实验表明预测误差在关键区域降低1.5-2.2倍,并提升了策略从模拟到真实世界的迁移效果。
基础模型体的模拟-现实差距:统一的MDP视角
本文将基础模型体的模拟-现实差距形式化为马尔可夫决策过程问题,提出了统一的研究议程,以适应如领域随机化等经典解决方案,从而提升智能体在真实部署中的鲁棒性和可靠性。
衡量模拟到现实的差距:为AIoT系统中的强化学习设计一个经济实惠的真实世界基准平台
本文介绍了一个为AIoT系统中的强化学习设计的经济实惠的真实世界基准平台,利用视频游戏来衡量模拟到现实的差距,并展示了将模拟训练出的智能体迁移到现实世界时性能显著下降的现象。
立场:强化学习研究者需区分求解模拟器与将模拟器作为代理使用
本文立场是,强化学习研究者需区分求解模拟器和将模拟器作为真实部署的代理使用,并指出若不加以区分会引发的问题。
通过执行语义弥合基于强化学习的工业调度中的仿真到现实差距
本文提出了一种策略中立的执行与测量层,以弥合基于强化学习的工业调度中的仿真到现实差距,实现执行错误的结构化归因,提升可靠性与可解释性。