当动力学模型读取错误的时间步:无标签事件信用重锚定以实现鲁棒全局读出

arXiv cs.LG 论文

摘要

本文识别了学习动力学模型中的'时间信用稀释'现象,其中全局读出关注的是虚假相关性而非短暂的物理事件。它提出了CREST,一种无需训练的方法,通过事件核心估计重新锚定池化表示,提高了分布外鲁棒性。

arXiv:2606.17572v1 公告类型:新 摘要:学习动力学模型通常通过将每步特征序列池化成一个读出向量来回答全局物理问题,例如故障严重程度或冲击刚度。这种序列到全局的接口产生了一个未被充分研究的时间信用问题:仅有轨迹级别的监督时,模型可以在训练条件下准确预测,同时从丰富的平滑相关性中读取,而非决定目标的短暂物理事件。我们将这种失败称为时间信用稀释。它不会通过训练损失暴露,也不会被标准的物理信息残差消除,因为错误在于全局读出分配功能信用的位置。我们引入了Credit-in-Event,一种接口级探针,用于测量池化信用落在事件步上的多少,并闭式证明当事件分数减小时,池化线性读取器将信用路由到虚假的背景通道。然后我们提出了CREST,一种无需训练且无标签的读出方法,通过从学习特征中估计瞬态事件核心,并通过事件与非事件的对比重新锚定池化表示。在模拟齿轮和冲击系统、循环和注意力编码器以及公共轴承振动数据上,CREST减少了分布外误差,同时恢复了事件信用。消融实验表明,稳定步选择和感受野收缩均失败,证实了增益来自事件核心信用重锚定,而非通用的局部性或稳定性先验。
查看原文
查看缓存全文

缓存时间: 2026/06/17 05:41

# 当动力学模型误读时间步:面向鲁棒全局读出的无标签事件信用重锚定
来源:https://arxiv.org/html/2606.17572

###### 摘要

学习到的动力学模型通常通过将每步特征序列池化成一个读出向量来回答全局物理问题(如故障严重程度或冲击刚度)。这种序列到全局的接口产生了一个未被充分研究的时序信用问题:仅有轨迹级监督时,模型可以在训练条件下准确预测,但所依赖的却是丰富的平滑相关量,而非决定目标的短暂物理事件。我们将这种失败称为时序信用稀释。它不会在训练损失中暴露,也不会被标准的物理信息残差消除,因为错误在于全局读出分配功能信用的位置。我们引入了Credit-in-Event,一种接口级探针,用于衡量池化信用有多少落在事件步骤上,并在闭式形式下证明:当事件分数缩小时,池化线性读取器会将信用路由到虚假的背景通道。接着我们提出CREST,一种无需训练且无需标签的读出方法,它能从学习到的特征中估计出一个瞬态事件核心,并通过事件与其余部分的对比来重新锚定池化表示。在模拟的齿轮和冲击系统、循环和注意力编码器以及公开的轴承振动数据上,CREST降低了分布外误差,同时恢复了事件信用。消融实验表明,稳定步骤选择和感受野缩小均告失败,从而确认性能提升来源于事件核心的信用重锚定,而非泛化的局部性或稳定性先验。

## 1 引言

学习物理动力学的模型越来越多地从一个测量序列中回答全局性问题:正在发展的故障严重程度、冲击所揭示的刚度、稳定裕度或安全分数(Raissi et al. 2019 (https://arxiv.org/html/2606.17572#bib.bib12); Chen et al. 2018 (https://arxiv.org/html/2606.17572#bib.bib11))。这些部署共享一个结构:一个每步编码器将轨迹映射为特征序列,一个聚合步骤将该序列池化为一个向量,然后一个线性头部读出感兴趣的标量(Vaswani et al. 2017 (https://arxiv.org/html/2606.17572#bib.bib9); Cho et al. 2014 (https://arxiv.org/html/2606.17572#bib.bib10))。它们也有一个共同的要求,即当运行条件在训练和部署之间变化时的鲁棒性。

池化步骤正是这种结构变得脆弱的地方。监督是粗粒度的,每条轨迹只有一个标签,因此损失从未说明答案应来自哪个时间步。我们说,当一个步骤实质性地塑造了池化向量从而影响了预测时,读出器将该步骤分配了*功能信用*。当决定性的物理内容集中在几个短暂事件中,而一个平滑的全局统计量恰好与数据收集期间的标签相关时,池化读出器可以通过将其功能信用置于平滑统计量上来降低其训练误差。我们将这种失败称为时序信用稀释:在物理上决定目标的事件在池化表示中几乎得不到信用,而预测依赖于一个非因果的相关量。

这种失败对通常的信号是不可见的。分布内误差平滑减小,因此验证曲线看起来健康。一个物理信息残差约束了局部状态演化,但让全局读出器自由地总结轨迹的错误部分,因此它并不能消除失败,而我们提出的补救措施也不是一个新的物理损失。只有在分布偏移打破了平滑相关量时,误差才会上升,而此时模型已经承诺读取了错误的步骤。图1 (https://arxiv.org/html/2606.17572#S1.F1) 说明了这种现象和我们的补救措施。

现有工具并不针对这个接口。捷径学习和虚假相关方法要么作用于输入特征,要么需要组标签或环境标签,这对于单流物理测量来说很少可用(Geirhos et al. 2020 (https://arxiv.org/html/2606.17572#bib.bib1); Arjovsky et al. 2019 (https://arxiv.org/html/2606.17572#bib.bib5); Sagawa et al. 2020 (https://arxiv.org/html/2606.17572#bib.bib6); Kirichenko et al. 2023 (https://arxiv.org/html/2606.17572#bib.bib7))。时间序列中的捷径学习研究目前通过梯度检测输入级点捷径(Ibarra et al. 2025 (https://arxiv.org/html/2606.17572#bib.bib4)),而我们证明,这种接口无法看到在池化过程中被错误分配的信用。聚合伪影在视觉表示中也被观察到(Shi et al. 2026 (https://arxiv.org/html/2606.17572#bib.bib3)),但全局物理读出提出了一个不同的问题:一个标量预测是否从决定测量量的瞬态事件中获得功能信用。这种区别激发了对时序信用的分析,而非视觉令牌修复。

我们直接在读出层面解决时序信用稀释问题。我们引入了Credit-in-Event,一种接口级探针,用于量化有多少池化信用落在事件上,证明了为什么池化会稀释信用,并提出了通过稀疏瞬态读出进行信用重锚定(CREST),这是一种无需训练且无需标签的规则,它根据特征本身估计出的瞬态事件核心来重新锚定池化向量。我们的贡献如下。

- •**时序读出失败。** 我们识别了时序信用稀释,其中一个序列到全局的动力学模型在分布内准确预测,同时却将很少的读出信用分配给决定目标的稀疏物理事件。
- •**接口级探针与理论。** 我们介绍了Credit-in-Event,并在一个稀疏事件双通道模型中证明,全局池化使得事件信用缩放为Θ(ε²),而丰富的背景线索保持高信噪比,因此输入梯度显著性无法检测到该失败。
- •**无标签事件重锚定。** 我们提出了CREST,一种无需训练的读出方法,它从学习到的特征中估计出一个瞬态事件核心,并形成事件与其余部分的对比,无需事件标签、分布外标签或每系统的测试调参。
- •**证据与证伪。** 在两个模拟器、循环和注意力编码器以及一个公开轴承数据集上,CREST改善了分布外误差并恢复了事件信用。稳定步骤选择、感受野缩小和群体鲁棒性均告失败,从而将时间机制分离出来。

参见图注
图 1: 时序信用稀释与 CREST。(a) 一个物理状态序列被压缩成一个标量 ŷ;目标由稀疏事件(阴影区域)决定,但一个平滑线索在训练中具有全局预测性。(b) 注意力读出将大部分信用放在平滑背景上,而很少放在事件窗口上。(c) CREST 通过低通残差对特征瞬态性进行评分,该残差在事件上达到峰值,并选择一个稀疏核心。(d) 在破坏线索的偏移下,CREST 在两个系统上都降低了分布外误差,且无需使用事件标签。
## 2 相关工作

### 捷径学习与分布外鲁棒性。

深度模型会利用在训练中具有预测性但非因果的线索(Geirhos et al. 2020 (https://arxiv.org/html/2606.17572#bib.bib1); Nam et al. 2020 (https://arxiv.org/html/2606.17572#bib.bib8))。标准补救措施假设组或环境结构,如不变风险最小化(Arjovsky et al. 2019 (https://arxiv.org/html/2606.17572#bib.bib5))和组分布鲁棒优化(Sagawa et al. 2020 (https://arxiv.org/html/2606.17572#bib.bib6)),或在重新加权的划分上重新训练最终层(Kirichenko et al. 2023 (https://arxiv.org/html/2606.17572#bib.bib7))。这种结构对于单流物理测量很少可用,因为没有人口统计组,并且驱动偏移的运行条件本身在部署时也是未观察到的。因此,我们在单一训练分布下直接干预读出。

### 时间序列中的归因与信用。

显著性通过输入敏感性解释预测(Sundararajan et al. 2017 (https://arxiv.org/html/2606.17572#bib.bib19)),最近的工作使用梯度检测时间序列分类中的点级捷径(Ibarra et al. 2025 (https://arxiv.org/html/2606.17572#bib.bib4))。我们的推论 1 (https://arxiv.org/html/2606.17572#Thmcorollary1) 表明,相关的失败对输入敏感性是不可见的,因为一个步骤可以对输入敏感,同时对池化向量几乎无贡献。因此,Credit-in-Event 并非一种注意力权重解释,而是一种接口测量,并且注意力权重是否解释预测本身也存在争议(Jain and Wallace 2019 (https://arxiv.org/html/2606.17572#bib.bib13); Wiegreffe and Pinter 2019 (https://arxiv.org/html/2606.17572#bib.bib14));我们通过掩蔽因果地验证信用。

### 物理信息动力学学习。

物理信息目标和神经微分方程通过约束局部演化或残差一致性来改进学习到的动力学(Raissi et al. 2019 (https://arxiv.org/html/2606.17572#bib.bib12); Chen et al. 2018 (https://arxiv.org/html/2606.17572#bib.bib11))。这些约束是有价值的,但与我们研究的问题正交:在特征序列被学习之后,全局读出仍然可以将其功能信用放在具有预测性而非物理决定性的时间步上。因此,CREST 针对的是聚合接口,而不是状态转移模型或残差损失。

### 动力学之外的聚合伪影。

视觉 Transformer 可能发展出高范数的背景令牌,这些令牌服务于内部聚合角色,最近的工作将这种行为的一部分与粗语义监督下的捷径式聚合联系起来(Darcet et al. 2024 (https://arxiv.org/html/2606.17572#bib.bib2); Shi et al. 2026 (https://arxiv.org/html/2606.17572#bib.bib3))。CREST 研究了一个不同的接口:一个物理状态序列被压缩成一个标量读出,问题在于池化表示是否将信用分配给决定目标的稀疏事件。决定性的内容是短暂的物理瞬态而非前景区域,有用的选择方向是瞬态而非稳定,并且分析给出了一个闭式稀疏事件信用定理和一个用于事件锚定的预算律。因此,我们将视觉令牌伪影方法视为相关的动机,而非学习动力学的机制或基线解决方案。

### 选择性池化与弱监督。

选择信息性元素出现在多实例学习中(Ilse et al. 2018 (https://arxiv.org/html/2606.17572#bib.bib16)),通常用于弱监督分类。CREST 选择谱瞬态步骤用于分布外物理回归,将选择预算与一个闭式预算律联系起来,并且在无需标签或训练的情况下运行。

## 3 问题设置与信用探针

我们观察轨迹 X = (x₁, …, x_T) 及其粗标签 y ∈ ℝ,每条轨迹一个标签。一个物理事件集 E ⊂ {1, …, T},|E| = L,事件分数 ε = L/T,标记了决定 y 的步骤。对于模拟器,E 可以从生成方程中得知;对于真实振动数据,E 是一个根据阶次跟踪估计的诊断事件窗口,仅用于分析和监督参考,CREST 从未观察它。模型族是一个每步编码器 F_t = φ(x_t) ∈ ℝᴰ,一个聚合器 p = Agg(F_{1:T}),以及一个线性读出器 ŷ = wᵀ p。实验变量是 Agg。

我们在聚合接口处测量信用。与模型无关的步骤分数是步骤特征与池化向量之间的余弦对齐:

s_t = ⟨F_t, p⟩ / (‖F_t‖ ‖p‖), c_t = max(s_t, 0). (1)

正部分 c_t 丢弃特征方向与池化方向相反的步骤,因为这样的步骤不支持最终的读出向量。我们定义

ECM = (∑_{t∈E} c_t) / (∑_{t=1}^T c_t + δ), Prec@|E| = |Top_{|E|}(s) ∩ E| / |E|, (2)

其中 CiE@1 = Pr(arg max_t s_t ∈ E),δ > 0 是一个小量。CiE@1 的随机水平等于 ε,并在每张图中显示。所有 Credit-in-Event 量仅用于诊断和报告;它们不是训练目标,CREST 也不使用它们进行选择。

## 4 时序信用稀释

### 一个可解模型。

我们使用一个双通道生成模型,固定视界 T,事件集 E 的大小 L = εT 独立于噪声,标签 y ∼ N(0,1),独立单位高斯 ξ,噪声尺度 s₀, s₁ > 0,以及线索强度 γ ∈ (0,1]:

x_t⁰ = 1[t∈E] y + s₀ ξ_t⁰, (3)
x_t¹ = 1[t∉E] (g y) + 1[t∉E] s₁ ξ_t¹. (4)

通道 0 是不变事件通道,通道 1 是虚假背景,分布在分布内时 g = γ,分布外时 g = 0,而噪声律保持不变。风险是归一化均方误差,Var(y)=1。池化线性读取器只看到全局均值 mⱼ = (1/T) ∑_t x_tⱼ,并且

S_E = ε² T / s₀², S_B = (1-ε) γ² T / s₁², S = S_E + S_B. (5)

事件通道仅在 εT 步上被观测到,全局平均将其幅度缩小了 ε,因此其池化信号功率按 ε² 缩放,而背景线索占据 (1-ε)T 步,保持为阶数 1。

###### 命题 1 (稀疏事件信用稀释)。

考虑 ε → 0,T 固定,S_B 有界远离零。在 (m₀, m₁) 上的总体最小二乘读取器具有

R_id = 1/(1+S), R_ood = ( (1+S_B)/(1+S) )² + S/(1+S)², (6)

且事件信用份额 ρ_E = S_E / S = Θ(ε²)。因此

lim_{ε→0} R_ood = 1 + S_B/(1+S_B)² > 1, lim_{ε→0} R_id = 1/(1+S_B). (7)

因此,一个高信噪比的背景线索使得分布内风险很小,而一旦移除线索,同一个池化读取器变得比预测均值更差。命题 1 确立了在稀疏事件机制中,该失败可以是池化策略的总体最优解:模型在分布内看似可靠,而事件信用随 Θ(ε²) 消失,当线索被破坏时分布外风险超过均值预测器。证明见附录,其

相似文章

扩散大语言模型中面向格式约束生成的动态填充锚点

arXiv cs.CL

本文提出了动态填充锚点(DIA),一种适用于扩散大语言模型的免训练方法。该方法通过动态估计终止锚点位置来强制执行格式约束(如可解析的 JSON、推理模板),同时避免了固定跨度方法的僵硬性。实验表明,DIA 在 GSM8K 和 MATH 基准测试上取得了显著的零样本性能提升。