用于混沌预测的时间范围约束的Rashomon集
摘要
介绍了时间范围约束的Rashomon集,用于表征混沌系统中模型多样性的演化。该框架证明了预测等价性的指数收缩,并开发了决策对齐算法,将决策质量提高了18-34%。
arXiv:2605.05218v1 公告类型:新
摘要:预测多样性和混沌动力学是机器学习中的两个基本挑战,尽管它们在概念上相关,但一直独立发展。我们通过引入时间范围约束的Rashomon集来弥合这一差距,这是一个理论框架,用于表征在混沌系统中模型多样性如何随预测时间范围演化。与Rashomon集保持不变的静态预测任务不同,混沌导致最初相似的模型呈指数级发散,从根本上改变了预测等价性的性质。我们证明了有效Rashomon集随提前时间以最大Lyapunov指数决定的速率指数收缩,并引入了Lyapunov加权度量,为预测分歧提供了更紧的界限。利用这些见解,我们开发了决策对齐的选择算法,该算法根据下游效用而非单纯的预测准确性在接近最优的模型中进行选择。在合成混沌系统(Lorenz-96、Kuramoto-Sivashinsky)和实际应用(风力发电、交通、天气)上的大量实验表明,我们的框架将决策质量提高了18-34%,同时保持了有竞争力的预测性能。这项工作建立了混沌理论与预测多样性之间的首次严谨联系,为在安全关键的混沌领域部署机器学习提供了原则性指导。
查看缓存全文
缓存时间: 2026/05/08 06:27
# 混沌预测中的视界约束Rashomon集 来源:https://arxiv.org/html/2605.05218 Rahul VishwakarmaWorkOnward Inc\., USA Holly DiamondWorkOnward Inc\., USA Ava HedayatipourDept\. of Electrical Engineering, California State University Long Beach, USA Ava\.Hedayatipour@csulb\.edu (https://arxiv.org/html/2605.05218v1/mailto:[email protected]) Amin RezaeiDept\. of Computer Engineering & Computer Science, California State University Long Beach, USA ###### 摘要 预测多重性和混沌动力学是机器学习中的两个基本挑战,尽管它们在概念上存在联系,但一直以来是独立发展的。我们通过引入视界约束Rashomon集来弥合这一鸿沟,该理论框架刻画了混沌系统中模型多重性随预测视界的变化规律。与静态预测任务中Rashomon集保持不变不同,混沌会导致初始相似的模型产生指数发散,从根本上改变预测等价性的本质。我们证明了有效Rashomon集随前置时间呈指数收缩,收缩速率由最大Lyapunov指数决定,并引入了Lyapunov加权度量,为预测不一致性提供了更紧的界。利用这些见解,我们开发了决策对齐的选择算法,该算法基于下游效用而非单纯的预测准确度,在近最优模型中进行选择。在合成混沌系统(Lorenz-96、Kuramoto-Sivashinsky)和真实世界应用(风电、交通、天气)上的大量实验表明,我们的框架将决策质量提高了18-34%,同时保持了有竞争力的预测性能。该工作建立了混沌理论与预测多重性之间的第一个严格联系,为在安全关键的混沌领域中部署机器学习提供了原则性指导。 ## I 引言 推荐系统、金融市场、天气预报和交通管理共享一个基本挑战:它们在混沌领域中运行,初始条件的细微差异会导致指数发散的结局[16(https://arxiv.org/html/2605.05218#bib.bib42),24(https://arxiv.org/html/2605.05218#bib.bib43)]。同时,机器学习社区已经认识到,多个模型可以获得等效的预测准确度,同时做出相互冲突的个体预测,这种现象被称为Rashomon效应[4(https://arxiv.org/html/2605.05218#bib.bib1)]。尽管这两个已建立的研究领域在概念上相似,但它们在过去是独立发展的。预测多重性文献建立了严格的框架来刻画等优质模型的空间[18(https://arxiv.org/html/2605.05218#bib.bib4),23(https://arxiv.org/html/2605.05218#bib.bib8),22(https://arxiv.org/html/2605.05218#bib.bib9),8(https://arxiv.org/html/2605.05218#bib.bib24),10(https://arxiv.org/html/2605.05218#bib.bib31),11(https://arxiv.org/html/2605.05218#bib.bib2)]。然而,这些工作仅专注于静态预测任务,没有考虑时间动态。相反,混沌预测社区在使用储层计算和神经算子[19(https://arxiv.org/html/2605.05218#bib.bib6),25(https://arxiv.org/html/2605.05218#bib.bib12)]预测混沌系统[2(https://arxiv.org/html/2605.05218#bib.bib37),5(https://arxiv.org/html/2605.05218#bib.bib46)]Lyapunov时间方面取得了显著成功,却始终只优化单个“最佳”模型,而没有刻画等精度替代方案的多重性。 这种脱节具有实际后果。以风电预测为例:多种神经网络架构可能达到相同的6小时前准确度[8(https://arxiv.org/html/2605.05218#bib.bib24)],但它们的24小时预测由于混沌引起的敏感性而大幅发散。哪个模型应该指导电网调度决策?当前框架无法提供原则性答案,因为它们未能解释混沌如何随时间改变预测多重性。在安全关键应用中,错误的模型选择可能导致停电、交通拥堵或应急响应失败,风险尤其高。此外,随着机器学习系统越来越多地部署于气候适应、流行病预测以及在湍流环境中运行的自主系统,理解混沌与模型多重性之间的相互作用对于可靠的实际部署变得至关重要。忽视时间动态的现有方法有可能在模型选择中产生系统性错误,可能偏好那些在短期预测中表现优异但在决策相关视界上灾难性失败的模型。最近的工作通过将Rényi熵产生与Lyapunov指数相结合,建立了极端事件的有效预警指标,证明了其在Lorenz、FitzHugh–Nagumo和Ikeda映射等系统中的预测能力。两个领域的理论基础表明,这一整合是自然而必要的下一步。混沌理论已经确定,确定性系统存在有限的预测视界,超过该视界,无论模型多么复杂,预测都会变得有效随机[12(https://arxiv.org/html/2605.05218#bib.bib25)]。同时,Rashomon效应表明,机器学习的优化景观本质上是非凸的,允许存在多个具有不同行为的全局最优解。然而,尚无现有工作检验这些现象如何相互作用:混沌是放大还是约束了预测多重性?当预测准确度和下游效用都重要时,决策者应如何驾驭模型选择?面对这两种不确定性,什么算法原则可以指导实践者?这些问题仍然没有答案,尽管它们对于在动态环境中可靠部署AI至关重要。 我们通过引入视界约束Rashomon集来弥补这一缺口,该理论框架捕捉了混沌系统中模型多重性的时变特性。我们的关键见解是,混沌从根本上改变了预测等价性——在短期预测上完美一致的模型,在接近系统预测视界时会指数发散。这种随时间变化的多重性需要新的理论工具和算法方法来进行混沌领域的模型选择。本文的主要贡献如下: - • 我们形式化了混沌动力学中的视界约束Rashomon集,并证明了有效集以最大Lyapunov指数决定的速率随前置时间呈指数收缩(定理1)。 - • 我们引入了Lyapunov加权Rashomon比率,它考虑了混沌引起的敏感性,为预测不一致性提供了比经典度量更紧的界(定理2)。 - • 我们开发了决策对齐的选择算法,该算法基于下游效用函数有效选择近最优预测模型,并具有凸目标收敛保证(定理3)。 - • 我们在三个真实世界混沌预测任务上验证了我们的框架,在保持有竞争力预测准确度的同时,决策质量提高了18-34%。 ## II 相关工作 ### II.1 预测多重性与Rashomon集 机器学习中的Rashomon效应是指存在多个具有等效预测性能但不同个体预测的模型[4(https://arxiv.org/html/2605.05218#bib.bib1)]。D'Amour等人[7(https://arxiv.org/html/2605.05218#bib.bib5)]证明了ML流程中广泛存在欠规范问题,表明标准实践往往无法唯一确定模型行为。Marx等人[18(https://arxiv.org/html/2605.05218#bib.bib4)]形式化了预测多重性,并引入了量化等精度模型之间不一致性的度量。最近的工作探讨了Rashomon集对公平性和可解释性的影响。Black等人[3(https://arxiv.org/html/2605.05218#bib.bib10)]表明,等精度模型在公平性属性上可能差异显著,而Rudin等人[22(https://arxiv.org/html/2605.05218#bib.bib9)]主张利用多重性来寻找更简单、更可解释的模型而不牺牲准确性。Xin等人[27(https://arxiv.org/html/2605.05218#bib.bib20)]开发了用于探索稀疏决策树整个Rashomon集的高效算法。尽管取得了这些进展,现有关于预测多重性的工作仅集中于静态预测任务。尚无先前工作考虑时间动态(特别是混沌)如何影响Rashomon集随时间的演化和结构。[1(https://arxiv.org/html/2605.05218#bib.bib3)] ### II.2 混沌系统的机器学习 储层计算已成为预测混沌系统的强大方法[14(https://arxiv.org/html/2605.05218#bib.bib28),13(https://arxiv.org/html/2605.05218#bib.bib29)]。Pathak等人[19(https://arxiv.org/html/2605.05218#bib.bib6)]证明了储层计算机可以预测混沌动力学5-8个Lyapunov时间,大大优于传统方法。Vlachas等人[25(https://arxiv.org/html/2605.05218#bib.bib12)]将反向传播与储层计算相结合,进一步扩展了预测视界。物理信息神经网络(PINNs)将已知控制方程作为约束,提高了混沌PDE的泛化能力[21(https://arxiv.org/html/2605.05218#bib.bib13)]。最近在神经算子方面的工作克服了传统闭合模型的基本限制[6(https://arxiv.org/html/2605.05218#bib.bib14)]。像FourCastNet[20(https://arxiv.org/html/2605.05218#bib.bib7)]和GraphCast[15(https://arxiv.org/html/2605.05218#bib.bib41)]这样的大型天气模型在操作预测任务上取得了最先进的性能。然而,这些广泛的文献始终专注于寻找单个最优模型。等精度预测模型的多重性及其对决策的影响仍然未得到探索。 ### II.3 决策聚焦学习 决策聚焦学习优化预测模型以提高下游决策质量,而非仅仅预测准确度[26(https://arxiv.org/html/2605.05218#bib.bib15)]。这一范式已扩展到各种设置,包括在线优化[9(https://arxiv.org/html/2605.05218#bib.bib16)]和公平感知预测[29(https://arxiv.org/html/2605.05218#bib.bib17)]。Mandi等人[17(https://arxiv.org/html/2605.05218#bib.bib32)]提供了该领域的全面综述。虽然决策聚焦学习提供了将预测优化到特定目标的工具,但现有工作没有解决混沌动力学或时变模型多重性带来的独特挑战。 ## III 问题形式化 考虑一个混沌动力系统,其状态xt∈Rd\mathbf{x}_t \in \mathbb{R}^d 根据(可能未知的)动力学演化。我们观察时间序列D={x0,x1,...,xT}\mathcal{D} = \{\mathbf{x}_0, \mathbf{x}_1, \ldots, \mathbf{x}_T\},并试图预测未来状态xt+k\mathbf{x}_{t+k},其中前置时间k∈{1,...,K}k \in \{1, \ldots, K\}。令H\mathcal{H}表示预测模型的假设类。每个模型h∈Hh \in \mathcal{H}根据过去ww个观测的窗口产生预测: x^t+kh=h(xt−w:t,k)\hat{\mathbf{x}}_{t+k}^h = h(\mathbf{x}_{t-w:t}, k) (1) 在视界kk处的预测损失为: Lk(h)=Et[‖xt+k−x^t+kh‖2]L_k(h) = \mathbb{E}_t\left[ \|\mathbf{x}_{t+k} - \hat{\mathbf{x}}_{t+k}^h\|^2 \right] (2) 我们将经典Rashomon集概念扩展到考虑预测视界: 定义1(视界约束Rashomon集)。对于前置时间kk和容差εk\epsilon_k,视界约束Rashomon集为: Rεk(k)={h∈H:Lk(h)≤Lk∗+εk}\mathcal{R}_{\epsilon_k}^{(k)} = \{ h \in \mathcal{H} : L_k(h) \leq L_k^* + \epsilon_k \} (3) 其中Lk∗=minh∈HLk(h)L_k^* = \min_{h \in \mathcal{H}} L_k(h) 是视界kk处可实现的最优损失。 与保持固定的经典Rashomon集不同,Rεk(k)\mathcal{R}_{\epsilon_k}^{(k)} 随预测视界变化。模型可能随着kk的变化而进入或退出该集,反映了混沌系统中预测等价性的时变特性。 ### III.1 决策上下文 预测指导下游决策a∈Aa \in \mathcal{A},效用函数u:Rd×A→Ru: \mathbb{R}^d \times \mathcal{A} \rightarrow \mathbb{R}将系统状态和动作映射到奖励。代表性应用包括风电调度、交通信号优化和天气相关资源分配,每种应用都表现出非对称成本,不同方向上的预测误差会导致不同的后果。给定模型hh及其预测x^t+kh\hat{\mathbf{x}}_{t+k}^h,决策者选择: a∗(h)=argmaxa∈AE[u(x^t+kh,a)]a^*(h) = \arg\max_{a \in \mathcal{A}} \mathbb{E}[u(\hat{\mathbf{x}}_{t+k}^h, a)] (4) 我们的目标是选择h∗∈Rεk(k)h^* \in \mathcal{R}_{\epsilon_k}^{(k)},使得实现效用E[u(xt+k,a∗(h))]\mathbb{E}[u(\mathbf{x}_{t+k}, a^*(h))] 最大化,而非仅仅最小化预测误差,认识到预测精度相同的模型可能会引发截然不同的决策结果。 ## IV 理论框架 我们首先刻画视界约束Rashomon集在混沌动力学下如何演化。 定理1(指数收缩)。对于最大Lyapunov指数为λmax\lambda_{\max}的混沌系统,如果Rε1(1)\mathcal{R}_{\epsilon_1}^{(1)}中的模型初始预测差异有界于δ0\delta_0,则: |Rεk(k)|≤|Rε1(1)|⋅exp(−βλmaxk)|\mathcal{R}_{\epsilon_k}^{(k)}| \leq |\mathcal{R}_{\epsilon_1}^{(1)}| \cdot \exp\left(-\beta \lambda_{\max} k\right) (5) 其中β>0\beta>0适当选择,取决于εk\epsilon_k的增长率。 证明。考虑两个模型h1,h2∈Rε1(1)h_1, h_2 \in \mathcal{R}_{\epsilon_1}^{(1)},初始分离度为δ0\delta_0。根据混沌的定义性质: E[‖x^kh1−x^kh2‖]≈δ0eλmaxk\mathbb{E}\left[ \|\hat{\mathbf{x}}_k^{h_1} - \hat{\mathbf{x}}_k^{h_2}\| \right] \approx \delta_0 e^{\lambda_{\max} k} (6) 要使两个模型都保持在Rεk(k)\mathcal{R}_{\epsilon_k}^{(k)}中,它们的预测必须满足容差约束。指数增长的分离度导致满足此约束的模型对比例呈指数递减。完整的证明见附录A。□\square 这一结果揭示了静态预测与混沌预测之间的根本区别:等质模型的有效空间随预测视界指数收缩。经典Rashomon比率对所有视界一视同仁,这在混沌系统中是不合适的。我们引入混沌感知度量: 定义2(Lyapunov加权Rashomon比率)。 ρL=1K∑k=1Kwk⋅|Rεk(k)||H|\rho_L = \frac{1}{K} \sum_{k=1}^K w_k \cdot \frac{|\mathcal{R}_{\epsilon_k}^{(k)}|}{|\mathcal{H}|} (7) 其中权重wk=exp(−λmaxkΔt)/Zw_k = \exp(-\lambda_{\max} k \Delta
相似文章
从罗生门理论到PRAXIS:高效决策树罗生门集合
PRAXIS是一种新算法,能够高效近似接近最优决策树的罗生门集合,在运行时间和内存使用上实现数量级的改进,同时保持近乎完美的召回率。
针对CTF4Science Lorenz挑战的度量感知混合预测
本文描述了一种针对CTF4Science Lorenz挑战的度量感知混合预测系统,该系统结合了神经去噪器、ODE拟合和直方图尾部分布替代,以优化九个任务对中的不同度量,在公开排行榜上取得了83.85529分的成绩。
模拟体:用于近最优时间序列预测与推断的决策理论预训练
本文介绍了一个统一的决策理论预训练框架,用于基于神经网络的时间序列估计器,该框架在分层模拟上进行训练以逼近近最优决策规则。实验表明,所得估计器在合成和现实基准上均优于最大似然估计等传统方法。
QuChaTeR: 混合量子混沌时域框架用于地震预测
介绍QuChaTeR,一种混合架构,结合了小波预处理、混沌映射和变分量子电路与循环结构,用于地震预测,在收敛速度和准确性上优于经典和量子基线。
用于支持主动运营决策的急诊科滞留时间集成预测原型
本文介绍了一种多时间尺度时间序列预测框架,使用DLinear和NLinear模型预测急诊科滞留时间,并开发了一个MLOps网页应用原型,以支持主动运营决策。