一个好的预测器能有多错?预测KL散度消失下的发散更新

arXiv cs.LG 论文

摘要

本文证明,在平稳对称高斯HMM中,更新映射之间的无界间隙可以与预测KL散度消失共存,表明内部计算不匹配不一定意味着预测失败。

arXiv:2609.11132v1 Announce Type: new Abstract: 准确的后验预测不一定需要精确的贝叶斯更新近似。我们证明,在平稳对称高斯HMM中,对于每个固定的有限$K\ge2$,更新映射之间的无界间隙可以与预测KL散度消失共存。精确贝叶斯混合和显式确定性径向滤波器作用于相同的$K-1$个信念坐标。当$q\to0^+$时,在最坏情况下,它们在中心化对数中的分离在自然置信度尺度$L_K(q)$上至少线性增长,而它们的分类$D_{\mathrm{KL}}(\mathrm{exact}\|\mathrm{radial})$在同一显见证据处消失。沿着平稳HMM轨迹,滤波后验之间的期望终端KL也收敛到零,当$H(q)=\lceil-\log(q)/c\rceil+1$。典型无切换块将两个滤波器驱动到共同的置信锥中,其中softmax曲率抑制它们的分歧;单个高斯最大事件控制自适应噪声。在$K\in\{2,4,8\}$上使用等间隔高斯的扫描说明了相反的趋势,二进制控制在长视野下比较饱和和非饱和递归。该结果隔离了内部更新间隙和预测成本之间两个缺失的环节:分离状态对期望损失的贡献和解码器敏感性。因此,即使无界的内部更新间隙本身也不一定能证明预测失败。该构造在$K$中固定,没有提供压缩无害时的通用标准,也没有表征内部间隙必须导致任务损失时的情形。
查看原文
查看缓存全文

缓存时间: 2026/09/11 08:28

# 一个良好的预测器能有多错误?具有消失预测KL的分歧更新

来源:[https://arxiv.org/html/2609.11132](https://arxiv.org/html/2609.11132)

**齐阜文**  
所属机构:波士顿大学,波士顿,马萨诸塞州,美国  
所属机构:上海交通大学,上海,中国  
电子邮件:[qfwen@bu\.edu](mailto:)

**刘帅俊**  
所属机构:香港科技大学(广州),广州,中国  
\*共同第一作者\。

**曾曦**  
所属机构:波士顿大学,波士顿,马萨诸塞州,美国

**苏宁鑫**  
所属机构:香港科技大学(广州),广州,中国  
\*共同第一作者\。

###### 摘要

精确的后验预测并不需要对贝叶斯更新进行精确近似。我们证明,在一个平稳对称高斯隐马尔可夫模型中,对于任意固定的有限K≥2,更新映射之间的无界差距可以与每个时间步的预测KL散度消失共存。精确的贝叶斯混合与一个显式的确定性径向滤波器作用在相同的K−1个置信坐标上。当q→0⁺时,在最坏情况下,它们在中心化logits中的分离度至少以自然置信尺度L_K(q)线性增长,而它们的分类KL散度D_KL(exact∥radial)在相同的显见证据处消失。沿着平稳HMM轨迹,滤波后验之间的期望终端KL也在H(q)=⌈−log(q)/c⌉+1处收敛到零。没有状态切换的典型块将两个滤波器驱动到共同的置信锥,其中softmax曲率抑制了它们的分歧;一个高斯最大事件控制着自适应噪声。在K∈\{2,4,8\}上的等间距高斯扫描展示了相反的趋势,而长水平的二值控制比较了饱和与非饱和递归。该结果揭示了内部更新差距与预测代价之间两个缺失的环节:分离状态对期望损失的贡献以及解码器的敏感性。因此,即使内部更新差距无界,其本身也并不能保证预测失败。该构造在K上是固定的,并未提供一个通用的标准来判断压缩在何时是无害的,也没有描述内部差距何时必然导致任务损失。

## 1 引言

Transformer保留不断增长的上下文,而状态空间和循环替代方案则将历史压缩为固定大小的确定性状态。因此,循环表达性和状态跟踪是活跃的设计约束[36, 34],形式化的比较也将简化的选择性SSM与线性注意力区分开来[10]。但这些架构层面的结果并未在任务层面回答这个问题:何时严格的计算不匹配会迫使预测变差?在一个有限的HMM中,精确贝叶斯本身仅占据K−1个置信坐标;问题在于,一个具有固定状态的不同更新几何是否必须付出预测损失。逐点的可表示性、可学习性以及由分布加权的任务成本是不同的。逐点分离的预测成本取决于解码器在评估路径定律下能够看到的损失,包括罕见路径上的损失大小。架构层面的不可能性定理确立了指定模型中的表示差距[56, 54],而可学习性即使在可表示函数上也可能失败[27]。单独的任何一种区分都不能决定这种任务成本。我们研究一个具有有限状态的序列模型中的边界,在该模型中两者均可计算。

我们的结果分为两个层面。在更新映射层面,对于每个固定的有限K≥2,一个显式的移动见证使得精确贝叶斯混合与径向滤波器在中心化logits中的商距离以Ω(L_K(q))增长,而它们在该相同见证处的分类KL散度D_KL(exact∥radial)趋于零。在路径定律层面,在两两不同的标量高斯均值和缓慢对称切换下,滤波器消耗相同的平稳HMM观测值,它们在H(q)=⌈−log(q)/c⌉+1处的期望终端后验KL也趋于零。因此,即使内部分离无界,也不一定导致持续的性能差距。

映射层面的结果涉及解码器几何:两个更新都对同一状态变得越来越自信,因此softmax消除了一致增长的logit差异。路径定律下的定理增加了一个分布性论证。在一个没有潜在切换的块上(这以高概率发生),一个最大事件控制所有自适应高斯噪声权重,径向饱和将近似保持在精确贝叶斯的置信锥内,而均匀的KL包络吸收剩余路径。在K∈\{2,4,8\}上的等间距高斯扫描说明了有限尺度下的两种相反趋势:中心化状态分离的同时预测KL在缩小。二值情况是显微镜,而非定理的范围:它可视化了几何结构,并将饱和与tanh具体区分开来。训练实验并未建立到学习模型的转移。我们证明,对于固定的K,内部分离可以发散,而预测KL在相同输入下消失。我们还证明,在罕见切换的极限下,期望预测KL随着水平增加在平稳定律下收敛。该定理解释了解码器敏感性和分离状态对期望损失的贡献如何控制预测误差。受控的数值实验说明了这两个结果;更简单的递归在测试的短水平(表7)上也实现了小的KL。我们不声称在K增长时的均匀性、对一类架构的不可能性结果,或径向规则的可学习性。

图1区分了在共同输入下和在路径定律下的陈述。

图 1:两个不同的固定K分离。(A) 在一个共同的移动输入下,精确混合与径向混合在中心化logits中具有发散的差距,但分类KL消失。(B) 在来自高斯HMM的共享平稳观测值上,它们的独立递归在H(q)处具有消失的期望终端后验KL。两个陈述在q→0⁺之前都固定了K和发射参数;该示意图并未断言(A)蕴含(B)。

## 2 相关工作

##### 表达性、学习与任务成本。

高效的序列模型使循环表达性成为一个明确的设计变量。最近的工作加强了选择性状态空间更新,分析了它们在状态跟踪上的极限,并将简化的选择性层与线性注意力进行了比较[36, 34, 10, 56, 1]。关于最坏情况和形式语言的结果确定了特定架构无法表示的计算[43, 54],而互补的结果表明,可表示的函数可能仍然难以学习[27]。这些结果决定的是表示或优化,而不是由分布加权的不匹配的预测成本。预测成本还取决于解码器敏感性以及在评估路径定律下由损失加权的分离状态的贡献。在KL无界的情况下,仅凭事件概率消失并不能控制这种贡献。针对GNN特定任务的表达性分析做出了相关诊断[35];我们的贡献是一个显式的序列反例,并在路径定律下证明了损失。

##### 无害的信息丢失与内部发散。

任务感知的压缩已经表明,对于下游预测器族或失真度而言,丢弃的信息可以是无害的[16, 15, 26]。我们不是优化表示或比特率:状态维度和规定的更新族是固定的,而它们的数值映射依赖于q,并且它们在中心化logits中的距离发散。这种通用的数学形式本身并不新鲜。在可分数据上,梯度下降可以使线性预测器的范数趋于无穷,同时逻辑损失趋于零且归一化方向收敛[62]。我们的组合是不同的:两个显式的滤波映射在相同的中心化输入下发散,它们的分类KL在该处消失,并且第二个定理证明了在平稳序列定律下的预测收敛。

##### 近似贝叶斯滤波与有限记忆。

RNN可以在固定有限水平上近似贝叶斯滤波统计量,并且在附加条件下,在时间上是一致的[5]。神经贝叶斯滤波则学习固定长度的信念嵌入,并在其陈述的假设下证明在有限水平上的一致性[61]。短记忆预测提供了一个不同的基准:一个ℓ阶马尔可夫预测器平均KL至多为I(M)/ℓ,平均ℓ₁误差至多为√(I(M)/ℓ)[57]。对于一个n状态HMM,I(M)≤log n,独立于混合时间。这个基准涉及下一个观测值的分布,而我们的定理测量的是分类滤波后验。我们的预测器维护K−1个置信坐标。流式投影则通过一个确定性递归维护一个具有固定预算的截断混合[17]。区别在于维护的对象和近似操作,而非递归本身;我们的结果将发散的中心化映射距离与消失的分类KL耦合起来。

##### 滤波稳定性与鲁棒性。

经典的滤波稳定性询问,在正确模型下运行的滤波器是否会合并,无论初始条件如何[46, 9, 41]。鲁棒性理论则扰动模型核并控制策略成本[31, 33],或者在各自假设下控制滤波器核和策略性能中的误差[14]。具有有限窗口的控制策略也可以随着窗口增长而接近最优[32]。我们的递归既不是不同初始化的精确滤波器,也不是收敛到真实核的核序列;它的逐点更新不匹配在所述见证上增长。

##### 检测延迟与二值控制。

长端点处的仿射控制接近于最快变化检测。Page引入了累积和方案[48];Lorden引入了关于最坏情况条件延迟的准则并证明了渐近最优性,Moustakides在此条件下建立了精确的CUSUM最优性,而Pollak研究了在不同条件延迟准则下接近极小极大的检测[40, 44, 52]。Pollak的具有单一变化的不可逆模型接近但不同于我们反复切换的HMM。这些工作校准了二值诊断,但并未暗示固定K径向定理。

##### 为何状态空间模型是动机案例。

确定性状态的设计模式跨越了结构化SSM、线性RNN、门控线性注意力和循环竞争模型[24, 25, 60, 47, 67, 68, 49, 3, 12]。选择性SSM理论和状态跟踪研究展示了转移结构、组合、精度或归一化如何改变表示能力[45, 59, 7, 64, 58, 38]。它们激发了这里研究的逻辑问题。我们并未证明任何命名的架构实现或未能实现我们定理中的任何一个滤波器。

## 3 问题设置:具有固定有限状态和径向滤波器的高斯HMM

###### 定义1
(平稳K状态高斯HMM与耦合滤波器)。固定一个整数K≥2,两两不同的均值μ₀,…,μ_{K−1}∈ℝ,以及σ>0,其中L_K(q)>0且α_K(q)>0。令(S_t)_{t≥0}平稳且在{0,…,K−1}上均匀分布,其中Pr(S_{t+1}=i | S_t=i)=1−q,Pr(S_{t+1}=j | S_t=i)=q/(K−1) (j≠i)。给定S_t=s,令X_{t+1} ∼ N(μ_s, σ²)。记C z = z − K⁻¹(1ᵀ z)1表示中心化,g(x)_s = (μ_s x)/σ² − (μ_s²)/(2σ²)表示高斯得分,理解为模公共偏移。对于中心化logits z,定义精确转移混合Φ_q(z) = C log(P_qᵀ softmax(z)),其中对数是逐分量的。令r(z) = √2 ‖C z‖₂,α_K(q) = 1 − (K q)/(K−1),L_K(q) = log((K−1)(1−q)/q),并定义径向映射R_q(z) = (L_K(q) tanh(α_K(q) r(z)/L_K(q)) / r(z)) C z,其连续值R_q(0)=0且在原点处缩放为α_K(q)。从z₀ᴱ=z₀ᴿ=0开始,耦合滤波器使用相同的观测值:

z_{t+1}ᴱ = C(Φ_q(z_tᴱ) + g(X_{t+1})),
z_{t+1}ᴿ = C(R_q(z_tᴿ) + g(X_{t+1})).

它们的终端分类输出为p_tᴱ = softmax(z_tᴱ)和p_tᴿ = softmax(z_tᴿ)。

相似文章

Fast Rates for Swap-Agnostic Learning of Proper Losses

arXiv cs.LG

This paper studies swap-agnostic learning of proper losses, showing that prediction-level comparisons can be controlled jointly via second-order multicalibration, achieving tight rates for finite hypothesis classes and families of losses.

用于LLM强化学习的预测性散度掩码

Hugging Face Daily Papers

提出用于LLM强化学习的预测性散度掩码,通过预测下一步策略梯度步骤将增加还是减少信任区域所使用的散度,改进了PPO的方向准则,从而带来更好的对齐,并提升了不同模型规模下的强化学习训练效果。

马尔可夫边界在表格预测中的好、坏与丑

Hugging Face Daily Papers

本文评估了马尔可夫边界在表格预测中的实际效果,发现尽管理论上最优,但由于计算限制和优化目标不匹配,当前的因果发现方法无法持续提升预测性能。