配对精确重置评估:基于预测的中型到全量世界模型级联
摘要
本文介绍了一种配对精确重置评估协议,用于确定何时从中型世界模型预测器切换到全量世界模型预测器能够改善任务特定的决策损失,并在PushT和PyBullet中的实验表明,增量路由具有优势。
arXiv:2608.14650v1 公告类型:新
摘要:现有的自适应推理和世界-动作模型系统使用低成本阶段的输出或预测的未来来分配额外的计算。我们研究一个更具体的问题:在配对精确重置的物理结果下,一个从中型模型派生的接口能否预测何时切换到单独的冻结全量预测器能够改善任务特定的决策损失,从而合理化顺序开销?我们的贡献是一个配对评估和审计协议,而不是一个新的通用路由规则:所有候选动作从相同的重置状态执行,中型和全量模型作用于相同的候选集和任务,它们的配对物理损失差异定义了路由目标。在一个新的PushT基准库(V106;1,600个状态,39个任务,三个检查点对)上,一个冻结的预测接口路由器相对于独立的中型模型、独立的全量模型和一个延迟优势的任务专用路由器,降低了包含开销的决策成本。然后,我们前瞻性地使用第二个1,600状态的PushT确认(V107),针对一个更强的当前状态控制,该控制使用任务、当前DINO特征的维度匹配投影和所有五个候选动作,不计DINO编码器延迟。预测接口降低了定价的物理决策成本0.002549(状态聚类95%区间[-0.002867, -0.002238];单侧95%上界-0.002286),对所有三个检查点对产生负面影响。一个受控的PyBullet审计独立支持一个复合任务-预测-机制路由器。顺序路由器仍然比固定策略慢,其优势仅限于低计算价格。证据支持在测试的预测接口中存在增量路由信息,超越了一个故意偏向的当前DINO控制,但不支持因果充分性、计算节省、闭环价值或跨族通用性。
查看缓存全文
缓存时间: 2026/08/18 10:20
# 预测衍生中等至完全世界模型级联的配对精确复位评估
来源:https://arxiv.org/html/2608.14650
###### 摘要
现有的自适应推理方法和近期的世界-动作模型系统已使用低成本阶段输出、中间状态或预测未来来分配额外计算。我们研究一个更窄的评估问题:在配对精确复位的物理结果下,基于中等模型的接口能否预测何时切换到单独冻结的完全预测器,能够将特定任务的决策损失改善到足以抵消顺序开销的程度?我们的贡献在于提出一种配对评估与审计协议,而非新的通用路由规则:每个候选动作从相同的复位状态执行,中等模型和完全模型在相同的候选集和下游任务上进行决策,它们的配对物理损失差异提供了事后路由目标。在一个初始的新鲜 PushT 审计库(V106;1,600 个状态,39 个任务,三组冻结检查点对)上,冻结预测接口路由器将包含开销的决策成本相对于独立中等模型降低了 0.00431,相对于独立完全模型降低了 0.00258,并且相对于延迟占优的仅任务路由器降低了 0.00262。随后我们仅使用 V106 进行开发,并前瞻性地将第二个 1,600 状态的 PushT 确认集(V107)与一个更强的当前状态替代方案进行密封对比:一个使用任务和与当前 DINO 特征维度匹配的投影以及所有五个候选动作的输入路由器,不计入 DINO 编码器延迟。预测接口将计价物理决策成本降低了 0.002549(状态聚类 95% 区间 [−0.002867, −0.002238];单侧 95% 上限 −0.002286),并且所有三个固定检查点对效应均为负。受控的 PyBullet 审计(12,000 个状态,81 个任务,六种运行模式,三组检查点对)独立支持一个复合任务-预测-运行模式路由器相对于固定、裕度和匹配随机策略;审计后修复在保留共享状态配对的同时未改变点估计。顺序路由器仍慢于固定策略,其固定策略优势仅限于低计算价格。证据支持在测试的对齐预测接口中存在增量路由信息,超越了一个特意偏好的当前 DINO 控制;但并未确立想象未来的因果充分性、计算节省、新的自适应路由理论、闭环价值或跨族通用性。
## 1 引言
预测模型之所以有用,是因为其输出能够介导决策。世界模型使这种关系变得异常具体:对于当前观测和候选动作,模型会展示一个想象的后果,控制器可以在执行前对其进行评分。面对复杂查询的自然反应是投入更多计算——使用更大的预测器、进行更多模拟推演,或运行更多去噪或规划步骤。然而,“更多预测计算”并非有序干预。更高容量的模型可以改善平均预测误差,同时改变少数关键动作的排序,且这种好处可能在不同状态和任务间发生逆转。若干并行系统已建立基于预测或中间状态条件的世界模型计算。门控几何最佳-of-N 使用初始动作和预测视觉未来来决定是否进行额外模拟推演;SANTS 从中间视频状态学习视频去噪的停止位置;自适应动作执行使用预测-现实一致性来确定何时需要另一次世界-动作模型遍历;自适应深度潜在世界模型在规划过程中路由预测器深度[22 (https://arxiv.org/html/2608.14650#bib.bib22), 14 (https://arxiv.org/html/2608.14650#bib.bib14), 17 (https://arxiv.org/html/2608.14650#bib.bib17), 13 (https://arxiv.org/html/2608.14650#bib.bib13)]。通用自适应神经级联、事后推迟和付费第二阶段获取同样学习后置计算的条件改进是否超过其成本[3 (https://arxiv.org/html/2608.14650#bib.bib3), 8 (https://arxiv.org/html/2608.14650#bib.bib8), 5 (https://arxiv.org/html/2608.14650#bib.bib5), 10 (https://arxiv.org/html/2608.14650#bib.bib10)]。因此,我们的新颖性主张并非关于使用预测未来进行自适应计算;而是关于用于比较单独训练的预测能力的配对物理估计量和冻结评估协议。我们提出的问题是:
> *在配对精确复位的物理结果下,基于中等模型的接口能否预测何时切换到单独冻结的完全预测器,能够将特定任务的决策损失改善到足以抵消顺序开销的程度?*
我们通过信息接口来隔离这个问题。预测接口路由器观测下游损失规范和中等模型的预测后果,但不观测真实未来、预言遗憾、完全预测或特权模拟器状态。精确复位使我们能够在相同的物理查询上评估中等模型、完全模型和所有候选动作,从而离线观测到实际的升级收益。在测试时,策略是顺序的:评估中等模型,形成其下游动作,并决定是否为完全模型付费。允许仅任务控制在运行中等模型之前进行路由,因此它是延迟占优的,而非人为削弱的顺序基线。由于该 V106 控制在 99.1% 的审计行上路由到完全模型,我们随后进行了更强的前瞻性测试。V107 冻结了预测路由器和一个维度匹配的输入路由器,该路由器接收任务、当前 DINO 表示和每个候选动作。当前 DINO 控制是刻意偏好的:其表示被视为已可用,其路由决策先于中等模型,且不计入编码器延迟。只有在对比、阈值、投影、自助法和新鲜状态清单密封后,我们才生成第二个 1,600 状态的精确复位库。*决策价值*与*计算节省*之间的区别至关重要。我们在目标中计入了中等模型、完全模型、任务评估和路由器开销。学习到的路由器减少了足够的物理遗憾,从而在定价这些延迟后击败了两种固定策略,但它在原始毫秒数上仍然较慢。这一结果是有用的——它识别了一种可学习的选择性优势——同时排除了更强的部署声明。我们的贡献包括:
1. 1\. 一个候选完备的配对精确复位协议,用于衡量单独冻结的中等和完全预测器在相同状态-任务-动作查询上的特定任务物理决策损失。
2. 2\. 一个部署成本账本,实例化了标准自适应级联和信息价值理论,同时明确比较了中等优先序列与独立完全模型。
3. 3\. 冻结的 PushT 和受控的 PyBullet 审计,包括一个前瞻性密封的第二个 PushT 库,与延迟占优、动作条件化的当前 DINO 控制进行对比,包含状态聚类推理、计算价格敏感性以及发布的面向论文的记录。
查询 Q:观测、任务、动作
运行中等模型预测 Ŷ_M(a)
预测接口路由器
π=0:使用 A_M
π=1:运行完全模型,使用 A_F
离线精确复位
观测每个 Y(Q,a)
配对标签 B = L_M − L_F − λ d_F
仅拟合/审计
部署时没有真实未来、完全预测或模拟器状态
图 1:部署的策略仅看到任务和中等模型的预测后果。精确的物理结果离线监督和评估路由器,但在路由时不可用。
## 2 中等到完全升级的决策账本
### 2.1 查询与可观测决策损失
在一个支持物理查询 Q = (X, T, 𝒜) 的概率空间上工作:当前观测 X、下游任务 T 和有限候选动作集 𝒜。以下所有总体陈述均以已知冻结的中等/完全检查点对 r 及其相关的路由器、阈值和延迟常数为条件;我们在符号中省略 r。等效地,当对有限的三检查点设计求平均时,检查点对索引包含在每个比较的信息字段中,报告的风险是预先指定的三个检查点特定风险的等权重平均值。冻结模型 m ∈ {M, F} 预测 Ŷ_m(Q, a) 并选择 A_m(Q) ∈ arg min_{a∈𝒜} ℓ_T(Ŷ_m(Q, a)),使用固定的平局规则。精确复位为每个候选展示 Y(Q, a)。我们使用候选集物理遗憾 L_m(Q) = ℓ_T(Y(Q, A_m)) − min_{a∈𝒜} ℓ_T(Y(Q, a))。因此 L_M 和 L_F 在相同的查询上被观测到;未对 𝒜 之外的动作或真实机器人因果效应做任何声明。配对是针对每个候选由源强制的:PushT 在每次模拟推演前重置为记录的种子基础状态,PyBullet 恢复保存的模拟器状态。此外,在每个 PushT 分片的三个状态和每个检查状态的一个候选上检查确定性重复回放;这是采样验证,而非对所有状态和动作的穷举回放测试。模型动作平局使用冻结的确定性平局规则。V106 路由器分数以 NumPy float32 重放,并且仅在严格比较 score > threshold 下升级;V104D/V104E 审计环境固定序列化运行时并记录存档的升级掩码校验和。
### 2.2 顺序与独立成本
令 s_𝒢(Q) 为运行中等模型并暴露接口 𝒢 的始终支付延迟,令 d_F(Q) 为在中等模型后评估和评分完全模型的额外延迟。一般符号还允许查询相关的独立延迟 c_M(Q) 和 c_F(Q)。在执行的分析中,这些延迟在检查点对和延迟汇总内是冻结常数,因此期望仅跨预先指定的检查点权重对其求平均。假设相关损失和成本可积。在计算价格 λ ≥ 0 下,定义实际净升级收益 B = L_M − L_F − λ d_F。
(1)
正 B 意味着升级减少了计价的决策目标。顺序接口 𝒢 是中等模型后可用的 σ-域。例如,
𝒢_0 = σ(T, R), 𝒢_1 = σ(T, R, S_M),
其中 T 是下游任务,R 表示在接口间固定的任何信息(例如预先指定的运行模式描述符),S_M 是中等模型预测的物理后果。一个 𝒢-可测的二元策略 π 具有顺序成本 C_𝒢(π) = L_M + λ s_𝒢 − π B。
(2)
定义 b_𝒢 = E[B | 𝒢]。
###### 命题 1(标准贝叶斯升级规则与可用价值)
一个最优的 𝒢-可测规则是 π*_𝒢 = 𝟙{b_𝒢 > 0},直到平局。其期望成本为
E[C_𝒢(π*_𝒢)] = E[L_M + λ s_𝒢] − V(𝒢),
V(𝒢) := E[(b_𝒢)_+].
因此 V(𝒢) 是在增量完全成本定价后、但在将始终支付的顺序延迟与独立策略比较之前,从条件升级中可用的改进。
###### 命题 2(顺序到独立的会计恒等式)
令 c_M 和 c_F 为固定中等和固定的完全的测量独立延迟,并定义带符号的顺序到独立完全延迟差 κ_𝒢 = s_𝒢 + d_F − c_F。在评估的协议中,此差值为正,因此是重复惩罚;恒等式本身不要求非负性。贝叶斯顺序路由器相对于独立策略的期望收益为
E[C_M^{fix} − C_𝒢(π*_𝒢)] = V(𝒢) − λ E[s_𝒢 − c_M],
(3)
E[C_F^{fix} − C_𝒢(π*_𝒢)] = E[(-b_𝒢)_+] − λ E[κ_𝒢],
(4)
其中 C_m^{fix} = L_m + λ c_m。方程 (4) 防止了一个常见的会计错误。负部项是在不利查询上不升级的价值,但独立完全模型完全避免了中等遍历。顺序路由器仅当其选择权超过计价的带符号延迟差时才击败固定完全模型。在两个评估的协议中 κ_𝒢 > 0,因此差值是重复惩罚;我们的路由器在冻结价格下克服了它,尽管原始延迟更高。
### 2.3 预测后果的价值
假设 𝒢_0 = σ(T, R) ⊆ 𝒢_1 = σ(T, R, S_M),因此唯一添加的来源是中等模型的预测后果。
###### 定理 1(嵌套接口 Jensen 恒等式)
定义 PIV(𝒢_1; 𝒢_0) := V(𝒢_1) − V(𝒢_0)。
则
PIV(𝒢_1; 𝒢_0) = E[ (E[B | 𝒢_1])_+ − (E[B | 𝒢_0])_+ ] ≥ 0.
(5)
记 U = E[B | 𝒢_1],该差值严格为正当且仅当一个粗略结果的正概率集同时具有 E[U_+ | 𝒢_0] > 0 和 E[(-U)_+ | 𝒢_0] > 0。对于共同的增量完全成本,用 𝒢_1 替换 𝒢_0 的净部署价值为
PIV(𝒢_1; 𝒢_0) − λ E[s_{𝒢_1} − s_{𝒢_0}].
该定理是一个总体信息陈述,并非保证任意有限样本学习者会利用该接口。此外,我们密封的 PushT 仅任务控制在运行中等模型之前路由,因此是延迟占优的。它在冻结的函数类和数据下是一个严格的部署比较器,而非方程 (5) 的插件估计器。
### 2.4 有限样本选择
以所有开发数据、验证选择、拟合参数和算法随机性为条件,令 b̂ 为一个 𝒢-可测的分数,并令 π̂ = 𝟙{b̂ > 0}。任何执行的严格阈值规则 𝟙{s > τ} 都具有此形式,取 b̂ = s − τ。假设 E|b_𝒢| < ∞,令…相似文章
预测潜在世界模型的闭环性能:LunarLander中非马尔可夫奖励下MPC和基于模型的强化学习的离线检查点选择
本文通过提出离线诊断方法来解决基于模型的强化学习中的目标失配问题,以预测潜在世界模型的闭环性能。在LunarLander-v3上,奖励可观性分数(ROF)和复合分数(CROF)能够选择出生成强大MPC和基于模型的强化学习策略的检查点,同时大幅减少与真实环境的交互次数。
评估协议决定结果:在TwoRoom上对LeWorldModel的独立复现
这项复现研究在TwoRoom环境中独立重新实现了LeWorldModel,达到了94%的目标达成率,而非报告的87%,并表明四个未记录的评估约定决定了结果。它还发现,单步预测误差不能可靠预测长时域规划的成功,且批归一化可能虚增验证损失。
PROWL: 面向世界模型学习的优先遗憾驱动优化
介绍了一种优先遗憾驱动优化框架PROWL,该框架利用对抗性课程通过聚焦高误差轨迹来提升基于扩散的世界模型的鲁棒性,在MineRL中的分布外场景上取得了更好的性能。
重放差距:LLM智能体中模型切换的静态评估打分于错误的世界
本文证明,基于重放的LLM智能体模型切换静态评估存在根本缺陷:在轨迹中途更换模型时,环境与后续动作会与记录的轨迹产生巨大偏差,从而使大多数基准测试结果失效。作者提出分支展开(branching rollouts)作为一种更忠实的评估方法,并公开了其测试框架与轨迹数据。
WorldReward: 针对相机条件化世界模型的奖励建模
WorldReward 介绍了一种针对相机条件化世界模型的视觉语言奖励模型,通过分块分解和偏好聚合统一了动作一致性和视觉质量评估,在基准测试中优于现有方法如GPT-5.5。