衡量世界模型更新的价值:一种用于持续适应的反事实效用协议

arXiv cs.LG 论文

摘要

本文介绍了一种分叉账本协议,用于衡量持续适应中世界模型更新的反事实效用,表明总是应用更新会降低CartPole和Walker等控制任务的性能。

arXiv:2609.10954v1 公告类型:新 摘要:持续世界模型必须决定新数据是否足以改变模型。固定重放调度和预测误差触发器指定了何时更新,但都不能揭示单个更新的价值:一次部署运行无法显示如果模型保持其参数,同一模型在该时刻的表现如何。我们引入了分叉账本,它在预注册决策点将部署流分支为匹配的更新和保持延续,在公共随机数下进行。它在相同的情节上评估两种延续,并记录 $\Delta R = R_{\mathrm{update}} - R_{\mathrm{hold}}$。总是应用一种固定的更新机制会降低所有三个模拟控制任务的回报:CartPole ($-144.0$;检查点引导 $95\%$ 置信区间 $[-185.4,-116.1]$,对比收敛回报约 $650$),Walker ($-82.8$;$[-101.1,-61.7]$) 和 Cheetah ($-18.6$;$[-29.0,-6.6]$)。分歧是应用更新的结果,因此估计目标计算每一次尝试的分叉;限制在 $720$ 次中 $693$ 次未崩溃的情况下,CartPole 和 Walker 的符号未变 ($-113.4$ 和 $-82.1$),而 Cheetah 变为未解决 ($-3.9$;$[-17.5,+13.0]$)。任务是推理的单位:每个任务在五个预训练检查点与两个漂移方向交叉下贡献 $240$ 次尝试的分叉。该账本使固定机制的反事实效用可观察,允许通过它们选择的更新而不是仅仅通过意外检测来判断触发器。
查看原文
查看缓存全文

缓存时间: 2026/09/11 08:23

# 衡量世界模型更新的价值:持续适应的反事实效用协议
来源:https://arxiv.org/html/2609.10954  
作者:Kaden Kim  
所属机构:UC Berkeley  

###### 摘要

持续世界模型必须判断新数据是否值得更新模型。固定的重放计划和预测误差触发器规定了何时更新,但都无法揭示单次更新的价值:一次部署运行无法显示同一模型在保持其参数不变的情况下在同一时刻的表现如何。我们引入了*分叉账本*,它在预注册的决策点将部署流分支为匹配的更新和保持延续,并使用公共随机数。它在相同的episodes上评估两种延续,并记录ΔR=Rupdate−Rhold。在所有三个模拟控制任务(CartPole:−144.0;检查点自举95% CI [−185.4, −116.1],相对于接近650的收敛回报;Walker:−82.8;[−101.1, −61.7];Cheetah:−18.6;[−29.0, −6.6])中,始终应用一种固定的更新机制都会降低回报。分歧是应用更新的结果,因此估量计入了每一次尝试的分叉;仅限于720次中未崩溃的693次,CartPole和Walker的符号不变(−113.4和−82.1),而Cheetah变得不确定(−3.9;[−17.5, +13.0])。任务是推断的单元:每个任务在五个预训练检查点和两个漂移方向的交叉中贡献了240次尝试的分叉。该账本使固定机制的反事实效用变得可观测,允许根据触发器所选择的更新而非仅仅通过意外检测来评判触发器。

## 1 引言

持续世界模型必须决定何时新数据值得更改模型。DreamerV3使用固定的重放比率;部署时适应可以在线微调世界模型,而模型管理方法则使用模型偏移、欠拟合/过拟合或变化点信号来决定何时更新(Hafner et al., 2025; Feng et al., 2023; Ji et al., 2022; Dorka et al., 2023; Vovk et al., 2021)。这些工作设定了更新的条件;分叉账本则追问单次更新是否能改善控制。

缺失的量是反事实的。预测误差混合了可减少的模型失配和不可减少的转移不确定性,并且一次更新可以在改善近期损失的同时降低用于控制的表示质量。因此,在决策点,相关的比较是更新后的回报与同一部署模型在保持其参数不变的情况下本应获得的回报。现有的模型管理和重训策略围绕聚合行为、检测结果或预测模型质量来构建决策,而非这种匹配的、针对单次更新的控制对比(Liebman et al., 2018; Regol et al., 2025; Steland, 2026)。

*分叉账本*使这一比较在模拟中可观测。在每个预注册的决策点,它使用公共随机数运行匹配的更新和保持延续,并记录ΔRk=Rupdate,k−Rhold,k(第3.2节)。在经过修正的实验中,始终应用我们研究的这一种固定更新机制会降低CartPole和Walker的回报,而Cheetah则取决于漂移方向且结果不确定。流种子复制保持了这一模式。因此,我们提出的是一个测量声明和一个任务限定的经验声明,而非一个通用的更新规则。

#### 贡献。

- • 分叉账本,一个可复用的匹配反事实协议,它为单次更新赋予一个实现价值。
- • 在三个任务中,独立的推断单元(任务数量=3,外加一个遗留计划负对照),每个任务在五个预训练检查点和检查点分组区间中包含240次尝试的分叉:一种固定的无需重放的更新机制在所有三个任务中均被可靠地证明是有害的,且其幅度随任务和漂移而变化。
- • 对分叉前触发信号与相同标签的直接比较。残差和部署回报触发器,是经过修正的实验臂中唯一作为决策策略进行评分的家族,在CartPole上几乎持平(其排序主要是能力测量),且两者的排名都不能跨任务迁移。

## 2 相关工作

检测与更新时机。新颖性和分布外方法研究何时学习模型不可靠(Zollicoffer et al., 2025; Nasvytis et al., 2024)。事件触发学习、概念漂移管理和重训策略研究何时适应,评估检测质量或聚合下游行为(Ji et al., 2022; Dorka et al., 2023; Vovk et al., 2021; Liebman et al., 2018; Regol et al., 2025; Steland, 2026)。离线策略评估可以估计反事实,但仅在响应机制的假设下成立(Oberst and Sontag, 2019; Buesing et al., 2019);在模拟中,两个分支可以同时运行。

残差、适应性与更新价值。似然和预测误差信号可能混淆模型失配与数据熵或不可减少的噪声(Nalisnick et al., 2019; Caterini and Loaiza-Ganem, 2022; Zhang et al., 2021; Pathak et al., 2019; Mavor-Parker et al., 2022; Jarrett et al., 2023),并且单步似然不一定跟踪控制性能(Lambert et al., 2020; You et al., 2026)。最近的系统使用残差、一致性或在线世界模型信号进行适应或评估(Domberg and Schildbach, 2026; Shi et al., 2026; Liu et al., 2025)。最接近的是Ma et al. (2026),它在生成视频模型的分支之间耦合噪声,但干预的是动作流,其中溯因是精确的,因为事实分支是自生成的;分叉账本干预参数,通过模拟器状态和三个随机性流耦合分支,并对实现的控制回报而非可塑性损失或检测准确率进行评分。

## 3 方法

### 3.1 问题设定

#### 部署流。

世界模型pθ在平稳环境中进行预训练,然后部署在一个环境发生变化的流上。必须区分流的两个属性,因为残差会混淆它们。*波动性*是物理参数随时间的漂移(CartPole的重力,Walker的接触摩擦);一次更新原则上可以跟踪它。*随机性*是添加到执行动作上的尺度为σa的高斯噪声;它增加了转移不确定性,但不是更新可以移除的环境变化。我们在累积水平和速率上匹配漂移特征,使残差可检测性(而非无意的计划差异)不驱动比较。

#### 控制依赖于世界模型。

控制使用基于交叉熵方法(CEM)的潜在空间模型预测控制(MPC)来优化动作序列(Rubinstein, 1999),并带有TD-MPC2风格的终端值引导(Hansen et al., 2024)。这个选择很重要:一个在旧潜在空间上训练的经摊销演员会将世界模型更新与演员失配混淆,而MPC在决策时参考当前模型,因此更新改变行为而无需重训演员。

#### 更新机制保持固定。

每对延续应用N个梯度步骤到最近的W个转移上。我们研究的是*触发时机*,而非竞争性的更新机制;因此标签相对于此响应。100次单元的机制敏感性仅在一个任务-方向组合中改变了更新获得收益的裁决(附录A.4)。该机制不进行任何重放:部署缓冲区在流开始时全新分配,预训练检查点仅存储模型和优化器状态,因此W-转移窗口仅包含部署后数据。因此,ΔR标签为收敛模型的无重放微调定价,这是灾难性遗忘和非预期漂移预期的场景,而非一般意义上的更新价值。

### 3.2 分叉账本

该协议有三个阶段(图1)。

#### 1. 参考流。

一个预训练的世界模型在一个单元下部署T=6000个控制步(K=24个决策点,间隔250步,动作重复为4):一个预训练检查点和一个漂移方向,在整个修正臂中σa=0。我们记录单步预测误差流、原始(未裁剪的)KL、漂移水平g(t)和速率Δg(t),以及注入的噪声水平。冻结使得相同的流可重复用于每个触发器:更新模型的误差流将取决于产生它的触发器。

部署流:物理参数随时间漂移。在决策点k=1, 2, 3,应用N个梯度步骤进行更新,或不更新(保持)。评估更新回报Rupdate和保持回报Rhold于相同的m个episodes上。误差流对触发器可见。ΔRk=Rupdate,k−Rhold,k。两个分支共享公共随机数。图1:分叉账本。部署流在预注册的决策点k处进行检查点保存,并分支为更新和保持延续,在相同的m个episodes上使用公共随机数进行评估;ΔRk是在k处更新的实现价值。触发器仅观察分叉前的误差流(括号所示),因此每个候选者都针对相同的标签进行评分,无需重新运行环境。

#### 2. 配对标签。

在K个预注册的决策点,我们保存检查点并运行两个分支。*更新*分支对世界模型在最近的W个转移上应用N个梯度步骤,然后进行评估。*保持*分支立即进行评估。两个分支都在相同的m个episodes上评估,具有相同的初始状态、注入的动作噪声和规划器采样噪声。物理扰动在分叉时刻被*固定*:回报是在决策点时的世界状态下测量的,而不是在评估期间持续变化的世界。这个选择有代价。固定使得对比偏向波动性轴,如果控制损失是陈旧性的凸函数,则会低估漂移更快情况下的更新,如果它是饱和的,则会高估。附录A.6量化了这两个方向;哪个方向成立是经验性的,而非假设的,用于界定这一点的经验前向窗口臂仅在CartPole上运行。

#### 3. 评分。

我们将ΔR定义为*现在应用固定更新机制*与*不应用*的因果效应:它为整个干预——时机、剂量N、窗口W以及诱导的模型变化——定价,而不分离这些组成部分;它不是一个控制了剂量后的时机效应。这是有意的:它匹配部署触发器所做的决策。因此,基准率Pr(ΔR>0)包含剂量成分,因此精确度终点应参照该基准率而非零来解读。触发器是分叉前误差流的任何函数:在选定的比率下,它将决策点划分为触发和未触发情况,并针对固定的ΔR标签进行评分,作为纯后处理。对于经过修正的信号比较,部署回报特征是分叉前紧接区段的平均回报,在任一分支评估之前记录。我们从不使用分叉后的Rhold列作为触发器特征。公共随机数是标准做法(Glasserman and Yao, 1992);必须固定三个独立的噪声源,重复运行才能一致。

### 3.3 设计修正与预注册计划

#### 设计与推断。

*修正*单元运行承诺的协议:20,000步的漂移期,每250个控制步分叉一次,以及记录的分叉前部署回报字段。*遗留*单元早于一个或两个方面;它们仅提供敏感性,并且那些没有分叉前字段的单元被隔离出触发器排名。预注册设计明确了五项选择。其主要终点,E[ΔR|触发] - E[ΔR],单位为每episode回报标准差σep,在此未报告,这是一个偏差;取而代之的是单元级ΔR均值、检查点分组AUC和策略总计。触发器仅读取分叉前的流。AUC,即一个分叉前标量是否将正ΔR分叉排在负ΔR之上,是针对每个检查点在其两个预注册的方向流上合并计算的,并通过检查点集群自举而非原始分叉池化进行聚合(Cameron et al., 2008)。所有修正单元运行σa=0,每个分支有m=30个匹配的评估episodes,注册的episode爬坡未执行,因此随机性轴未被行使。仅有五个集群时,百分位数自举覆盖不足;相同检查点均值的Student-t区间仍保留两个负裁决(附录A.5),并且未对信号比较进行多重性调整,我们对此进行描述性解读。我们与比率匹配的随机触发器、ΔR神谕(仅限模拟器,因此是上限而非可部署规则)进行比较。注册设计指定因果运行分位数阈值;作为对该注册的偏离,修正的结果改为在分叉前信号上留出一个检查点外拟合阈值水平。比率匹配的控制在每个留出单元内进行置换,保持报告策略在其中触发的次数;将其进一步限制为连续时间块在限制给原假设任何自由度的地方保持裁决不变(第4.5节)(Anderson and ter Braak, 2003)。注册的选择与偏离

相似文章

世界模型应如何评估?一种以决策为中心的立场

arXiv cs.LG

本文调研了世界模型的评估方法,主张采用以决策为中心的框架,优先考虑反事实推理、规划与策略优化,而非视觉质量。文中引入了L0–L7评估阶梯及基准协议,使评估与声称的效用一致。