认证世界模型作为感知时钟:面向主动感知的漂移感知截止时间

arXiv cs.LG 论文

摘要

本文介绍了一种针对世界模型的认证感知时钟,该时钟基于模型的有效性视界,提供了一种主动的、解析推导的截止时间,用于指示智能体何时必须重新感知。本文提出了一种漂移感知部署方法,并在冻结的3D VN-JEPA模型上展示了其有效性,与基准调度器相比减少了尾部违规。

arXiv:2607.01537v1 Announce Type: new 摘要:认证世界模型可以估计其预测保持有效的时间长度。我们将这一有效性视界转化为可操作的感知时钟:一个关于智能体何时应停止滑行并重新感知的规则。从一个经过审计的等变世界模型出发,我们推导出无感知间隔的截止时间,并展示了学习世界模型中可部署的截止时间必须具有漂移感知:仅靠流形上的李雅普诺夫速率会高估滑行有效性,而校准后的本地 rollout 漂移包络则承载了部署保证。在冻结的3D VN-JEPA模型上,所得时钟控制了保留间隔的同时证书违规(跨种子和数据分片)。在一个线索条件化的定理床(一个合成基准,其中所有调度器共享相同模型,隔离调度规则)上,该时钟在部署分布上仍然有效,并在匹配感知预算下,相对于精确混合期望信念调度,大幅减少了事件性尾部违规。我们还报告了局限性:在短视界冻结VN-JEPA机制下,经验共形视界在有效性和预算上与部署时钟相匹配,而部分重置探索发现谱项没有明显的预算匹配优势。因此,贡献在于一个认证的感知时钟原语和漂移感知部署方法,而非声称谱时钟在经验上优于所有非谱调度器。
查看原文
查看缓存全文

缓存时间: 2026/07/03 05:41

# 认证世界模型作为感知时钟:面向主动感知的漂移感知截止时间  
来源:https://arxiv.org/html/2607.01537  

###### 摘要 认证世界模型能够估计其预测的有效时长。我们将这一有效性时域转化为一个可操作的感知时钟:即智能体应何时停止开环预测并重新感知的规则。从一个经过审计的等变世界模型出发,我们推导出无感知间隔的截止时间,并表明可部署的学习世界模型截止时间必须具有漂移感知特性:仅靠流形上的李雅普诺夫率会高估开环预测的有效性,而经过校准的原生展开漂移包络才能承载可部署的保证。在冻结的3D VN-JEPA模型上,该时钟控制着留出间隔上的同步认证违规(跨种子和数据分片)。在一个线索条件化的定理测试平台(一个综合基准,其中所有调度器共享同一模型,从而隔离调度规则)上,该时钟在部署分布上保持有效,并在匹配的感知预算下,与精确混合期望信念调度相比,显著降低了事件尾部违规。我们还报告了局限性:在短时域冻结VN-JEPA制度下,经验共形时域在有效性和预算上与部署时钟相匹配;部分重置探索未发现谱项在预算匹配下具有明确的优势。因此,贡献在于一个认证感知时钟原语和漂移感知部署方法,而非主张谱时钟在经验上支配所有非谱调度器。  

## 1 引言  

一个能够预测未来的世界模型,仍然不知道其自身的预测何时失效。依赖开环预测的智能体最终必须重新感知:感知太迟会导致模型的保证失效,感知太早则会浪费稀缺的预算。固定的重新规划周期忽略了模型的实际可靠性,而纯粹的反应式监控仅在残差已经增大后才采取行动。我们研究缺失的原语:  

> 一个认证世界模型应将其有效性时域暴露为一个可操作的“感知截止时间”——一个告诉智能体何时重新感知的时钟。  

当认证时域归零时,智能体停止开环预测并感知。这完善了认证世界模型的更广泛计划:何时信任预测(先前的认证时域工作(Wang, 2026 (https://arxiv.org/html/2607.01537#bib.bib6)))、何时重新规划以及——这里——何时感知。图1 (https://arxiv.org/html/2607.01537#S1.F1) 勾勒了该原语。  

#### 拥挤领域的定位。主动感知、信息价值、带保证的\\(\\rho\\)-POMDP规划、主动推理/期望自由能调度以及共形感知都会调度观测。我们的区别在于狭窄而明确:我们贡献了第一个主动的、分析推导的认证时域感知触发——基于一个经过审计的(等变)世界模型计算而来——其中模型的谱展开速率作为推导时域的“审计接口”,而经校准的漂移包络承载可部署的保证——这与反应式信息增益贪婪调度器、固定时域轮询以及缺乏预测有效性证书的共形残差监控器形成对比。这是一篇“拥挤领域差异化论文,带有新原语”,而非“空位声明”。  

#### 贡献。我们做出四项正面贡献,并明确说明一个边界。  

1. 1. 感知时钟原语(证书=感知时钟):一个认证的开环预测截止时间,控制间隔同步认证违规(§3,命题1 (https://arxiv.org/html/2607.01537#Thmproposition1),§4)。  
2. 2. 一种漂移感知部署方法——可部署的截止时间不仅仅是\\(\\lambda\\):流形上的李雅普诺夫率将可部署时域高估了大约一个数量级,而承担负载的项是一个经校准的原生展开漂移包络(§3,§5.4)。  
3. 3. 在真实等变世界模型上的实例化——在冻结的3D VN-JEPA模型上,时钟控制留出间隔的ICV(间隔同步认证违规),跨种子和数据分片得到确认(§4,§5.1)。  
4. 4. 一个反应对比定理测试结果——在共享模型下,期望信念反应调度(MB-EIG)低估了事件尾部风险:认证时钟在部署分布上保持有效,并在匹配预算下将事件尾部违规从0.36降至0.16,而MB-EIG需要约\\(3\\times\\)预算才能恢复尾部(§4,§5.2)。  

#### 边界(已说明,非隐藏)。我们并未声称经验上优于非谱调度器。一个精确合成提前时间测试返回空值(§5.3);在学习制度下,一个非谱经验共形时域在有效性和预算上与部署时钟匹配(§5.4);部分重置探索发现谱项在预算匹配下没有优势(§5.5)。这些结果缩小了——而非驳斥了——该原语(§6)。  

参考图注  
图1:证书即时钟原语。认证世界模型将其有效性时域暴露为一个可操作的感知截止时间:在感知重置信念后(\\(e_0\\approx 0\\)),模型在证书有效时进行开环预测,当认证时钟\\(T_{\\mathrm{eq}}(\\epsilon_{\\mathrm{cert}})\\)到期时重新感知(开环预测误差范数\\(\\left\\lVert e_h\\right\\rVert_{\\mathcal{C}}\\)达到认证容差\\(\\epsilon_{\\mathrm{cert}}\\))。与固定周期时钟(对模型可靠性不敏感)或反应式监控器(仅在残差增长后才触发)不同,该截止时间是主动的且基于证书。  

## 2 问题设置  

#### 开环预测间隔。智能体交替进行感知(从观测中重置信念)和开环预测(使用世界模型进行开环预测)。一个开环预测间隔\\(\\mathcal{I}=(\\tau,\\tau')\\)跨越两次感知之间的步骤;\\(H_{\\mathcal{I}}=\\tau'-\\tau-1\\)是其长度。部署策略是根据\\(\\tau\\)时刻的状态设置\\(\\tau'\\)的截止时间规则。  

#### 间隔同步认证违规(主要指标)。设\\(\\left\\lVert\\cdot\\right\\rVert_{\\mathcal{C}}\\)是世界模型潜在空间上的一个证书范数(对于VN-JEPA,是一个不可约表示/块范数;§3)。预先注册的主要指标是开环预测误差在间隔内任意位置超过认证容差\\(\\epsilon_{\\mathrm{cert}}\\)的概率:  

\\[  
\\mathrm{ICV}_{\\epsilon}(\\pi)=\\Pr_{\\mathcal{I}}\\Big[\\max_{1\\le h\\le H_{\\mathcal{I}}}\\left\\lVert\\hat{z}_{\\tau+h\\mid\\tau}-z_{\\tau+h}\\right\\rVert_{\\mathcal{C}}>\\epsilon_{\\mathrm{cert}}\\Big],\\qquad\\bar{U}:=U^{\\mathrm{cluster}}_{0.95}\\big(\\widehat{\\mathrm{ICV}}_{\\epsilon}\\big),  
\\]  

其中使用聚类自助法上界(跨种子/集数,因为集内间隔不独立);在表格和结果中我们将\\(U_{95}\\)写为\\(\\bar{U}\\)。预先注册的目标是\\(\\bar{U}\\le \\alpha_{\\mathrm{target}}+\\delta=0.10+0.05=0.15\\)。  

#### 感知预算。\\(B(\\pi)=\\mathbb{E}[\\#\\text{sense}/T]\\),平均感知率。比较在匹配预算下进行(阈值在校准拆分上校准,冻结后一次评估于测试拆分)。  

#### 提前时间(可选;限于原生轨迹可用时)。对于安全关键的部署,还需要可操作的提前时间\\(L_{\\mathrm{safe}}=t_{\\mathrm{last\\text{-}safe}}-\\tau_{\\mathrm{trigger}}\\)。这需要原生危险/最后安全/干预语义,而VN-JEPA开环预测语料库不包含这些(§5.4);我们仅在合成基准上测试提前时间(§5.3),并明确推迟学习制度下的提前时间问题。  

## 3 方法  

#### 谱时域(朴素)。如果开环预测误差仅由局部展开率\\(\\lambda\\)从感知后误差\\(e_0\\)增长而来,则截止时间将为\\(T_\\lambda(\\epsilon)\\sim\\log(\\epsilon/e_0)/\\lambda\\)。在合成线性高斯误差动力学中,这一神谕谱时域为间隔同步认证违规提供了一个校准的上界,支撑了机制单元测试(§4.1)。  

#### 漂移感知校正(承担负载)。在真实的冻结世界模型上,仅凭流形上的率会高估可部署时域,因为开环预测误差包含原生展开漂移、模型偏差以及\\(\\lambda\\)无法看到的流形外偏离。我们通过以下方式界实现误差:  

\\[  
r_h\\le b_h^{\\mathrm{UCB}}+C\\,e^{\\lambda h} e_0+\\eta_h,\\qquad T_{\\mathrm{eq}}=\\sup\\bigl\\{h:\\ b_h^{\\mathrm{UCB}}+C\\,e^{\\lambda h} e_0+\\eta_h\\le\\epsilon_{\\mathrm{cert}}\\bigr\\},  
\\]  

其中\\(b_h^{\\mathrm{UCB}}\\)是一个校准的原生展开漂移包络(在时域\\(h\\)处开环预测误差的留出高分位数),\\(C e^{\\lambda h} e_0\\)是审计的局部展开项,\\(\\eta_h\\)是有限样本松弛项。*审计的李雅普诺夫率排名局部流形上展开;可部署的开环预测有效性由局部展开与原生展开漂移之和决定。*  

###### 命题1(漂移感知间隔证书)。假设在校准分布上,界\\(b_h^{\\mathrm{UCB}}+C\\,e^{\\lambda h} e_0+\\eta_h\\)在\\(1\\le h\\le H\\)上同时支配实现的开环预测误差\\(r_h\\),概率至少为\\(1-\\alpha\\)。则截止时间\\(T_{\\mathrm{eq}}=\\sup\\{h: b_h^{\\mathrm{UCB}}+C\\,e^{\\lambda h} e_0+\\eta_h\\le\\epsilon_{\\mathrm{cert}}\\}\\)以水平\\(\\alpha\\)控制间隔同步认证违规,直至校准失效概率:\\(\\mathrm{ICV}_{\\epsilon_{\\mathrm{cert}}}(\\pi_{T_{\\mathrm{eq}}})\\le\\alpha\\)。  

###### 证明草图。在界同时成立的事件上,对于所有\\(h\\le T_{\\mathrm{eq}}\\),我们有\\(r_h\\le b_h^{\\mathrm{UCB}}+Ce^{\\lambda h}e_0+\\eta_h\\le\\epsilon_{\\mathrm{cert}}\\),因此不会发生间隔同步违规;违规事件包含在校准失效事件中,其概率\\(\\le\\alpha\\)。∎  

这将部署校准协议重述为一个证书;并不声称\\(\\lambda\\)改进了界——在完全重感知制度中,\\(e_0\\approx 0\\),因此界由漂移主导。  

#### 完全重感知制度中的部署形式。由于完全重感知使得感知后误差\\(e_0\\approx 0\\),\\(Ce^{\\lambda h}e_0\\)消失,部署截止时间简化为漂移包络时钟  

\\[  
T_{\\mathrm{drift}}(\\epsilon)=\\sup\\{h:\\ b_h^{\\mathrm{UCB}}\\le\\epsilon_{\\mathrm{cert}}\\}.  
\\]  

我们确认这正是冻结VN-JEPA上的部署截止时间(§5.4)。因此,流形上谱\\(\\lambda\\)作为局部展开审计/理论接口,而非部署时域中的主动项。(经验上,审计的流形上\\(\\lambda\\approx 0.07\\);朴素的仅\\(\\lambda\\)时域将可部署时域高估了大约一个数量级,而漂移包络则产生部署的约\\(\\sim 2\\)–\\(3\\)步时域。)  

参考图注  
图2:为什么仅谱时域会高估截止时间。开环预测误差与时域关系(固定的\\(\\epsilon_{\\mathrm{cert}}\\),断裂的\\(h\\)轴:左侧=测量区域,右侧=朴素穿越点)。流形上\\(\\lambda\\)排序局部展开,但原生展开漂移决定了冻结VN-JEPA制度中可部署的开环预测有效性:校准的漂移包络\\(b_h^{\\mathrm{UCB}}\\)首先越过\\(\\epsilon_{\\mathrm{cert}}\\),在部署的\\(T_{\\mathrm{drift}}\\approx 2\\)–\\(3\\)步处,而朴素的仅\\(\\lambda\\)界\\(Ce^{\\lambda h}e_0\\)(审计的\\(\\lambda\\approx 0.07\\))大约晚一个数量级。部署截止时间由首先达到\\(\\epsilon_{\\mathrm{cert}}\\)的项设定;在完全重感知制度中(\\(e_0\\approx 0\\)),这始终是漂移包络。图中\\(\\epsilon_{\\mathrm{cert}}=1.012\\)是机制示意图的代表审计值;部署容差按每次拆分独立校准,如表2 (https://arxiv.org/html/2607.01537#S5.T2) 所示。  

#### 校准协议。在VN-JEPA上,证书范数是逐块归一化的不可约表示块\\(b\\)上的最大值:\\(\\left\\lVert e\\right\\rVert_{\\mathcal{C}}=\\max_b \\left\\lVert e_b\\right\\rVert_2 / s_b\\),带逐块尺度\\(s_b\\)。这些尺度、容差\\(\\epsilon_{\\mathrm{cert}}\\)、漂移包络\\(b_h^{\\mathrm{UCB}}\\)以及任何共形松弛项在校准拆分上固定,其中\\(\\epsilon_{\\mathrm{cert}}\\)被选为满足如下条件的最小容差:其校准间隔ICV上界在诱导截止时间处达到\\(\\alpha_{\\mathrm{target}}\\)。测试拆分仅评估一次,不重新调优。谱审计在原生流形上轨迹上执行(短期时域残差预测器的自由迭代会产生流形外展开伪象,\\(\\lambda\\approx 3.5\\)与流形上\\(\\approx 0.07\\)对比,仅用作流形外压力诊断)。  

## 4 实验  

实验阶梯每级隔离一个变量;失败归因保持清晰。表1 (https://arxiv.org/html/2607.01537#S4.T1) 映射了各级;结果见§5。  

表1:实验阶梯——评审者的地图。阶梯每级隔离一个变量;确认级(0A→1b-lite→2A)构建正面主张,而诚实的否定级(2B, 2C-V, E0)定义边界。  

各级细节:  

- •阶段0A——合成误差动力学基准上的神谕截止时间机制:联合界最坏情况截止时间控制间隔ICV(\\(U_{95}=0.040\\)和\\(0.073\\),两种规格变体,均\\(\\le 0.15\\)),且该基准可证伪(ICV随感知周期单调增加,认证截止时间位于拐点)。通过。  
- •阶段1a——用有限数据审计估计(OLS + 自助法UCB)替换神谕谱:有效性经得起估计误差(\\(U_{95}\\le 0.073\\)),预算接近神谕(比率\\(\\le 1.11\\)),审计样本低至\\(n\\approx 5\\)。通过。  
- •阶段1b-lite——冻结的3D VN-JEPA等变世界模型(来自与Wang2026 (https://arxiv.org/html/2607.01537#bib.bib6) 相同认证时域项目的SO(3)-等变向量神经元JEPA):审计谱 + 原生漂移包络 → 漂移感知截止时间 → 留出原生开环预测间隔ICV。通过候选,跨种子和数据分片确认。  
- •阶段2A——线索条件化反应对比定理测试平台,所有调度器共享同一模型;测试期望信念反应是否低估事件尾部。机制通过。  
- •阶段2B——状态依赖提前时间基准。空。  
- •阶段2C——学习制度可替换性:可行性审计(2C-0:原生轨迹缺乏危险语义,因此完整三轴可替换性测试受阻)和有效性/预算测试(2C-V)。仅有效性警告。  
- •E0(探索性)——部分重置制度以激活谱项。空。  

## 5 结果  

### 5.1 阶段1b-lite——冻结的3D VN-JEPA

相似文章

TaskSense:专注于世界模型中的关键要素

arXiv cs.AI

TaskSense 提出了一种以任务为中心的世界建模框架,利用基于先前潜在状态的条件随机空间注意力以及辅助逆动力学目标,聚焦于与控制相关的区域,相比 DreamerV3,在视觉干扰下具有更强的鲁棒性。