正则化强调时序差分学习:常数步长下的稳定性

arXiv cs.AI 论文

摘要

本文介绍了正则化强调时序差分学习(RETD),该方法通过归一化强调TD信号,确保在常数步长下的稳定性,并提供了收敛性证明和实验验证。

arXiv:2609.19170v1 公告类型:新 摘要:强调时序差分学习(ETD)稳定了预期的离策略TD更新并改变了其投影几何,但这两个性质都不能确定常数步长下的采样动态。我们构造了一个遍历的两状态反例,其中ETD均值映射收缩,而采样乘积具有正的上李雅普诺夫指数。再生周期分析将这一符号与跟随轨迹的无限方差分离。我们引入了正则化强调TD(RETD),这是一种归一化的一阶冲击后修复方法,它保持了轨迹和重要性比率不变,将强调TD信号存储在泄漏标量状态中,并释放延迟校正。RETD的原始平衡是ETD平衡的仿射偏移;单正则化和双正则化读数完全恢复ETD固定点。我们证明了调和递减步长的几乎必然收敛性,并从马尔可夫随机乘积边界得出了条件常数步长矩收缩结果。RETD在两状态构造和一个Baird点上具有经认证的负指数,而正的Baird ETD指数仍然是数值性的。配对的10,000次运行实验验证了两种分离、固定点恢复、非单调稳定区域和任务依赖性。RETD改变了冲击后动态;它没有减少共享的跟随轨迹方差。
查看原文
查看缓存全文

缓存时间: 2026/09/18 09:15

# 正则化强调时序差分学习:固定步长下的稳定性  
来源:https://arxiv.org/html/2609.19170  

**作者**:邢国富†、吴朝辉、叶金国、李超、杨尚东、杨光、梁天宇、王文浩  
**†通讯作者**:邢国富,南京邮电大学江苏省大数据安全与智能处理实验室,邮编 210023,中国  
电子邮件:[[email protected]](mailto:[email protected])  

**吴朝辉**  
南京邮电大学江苏省大数据安全与智能处理实验室,邮编 210023,中国  

**叶金国**  
南京邮电大学江苏省大数据安全与智能处理实验室,邮编 210023,中国  

**李超**  
南京邮电大学江苏省大数据安全与智能处理实验室,邮编 210023,中国  

**杨尚东**  
南京邮电大学江苏省大数据安全与智能处理实验室,邮编 210023,中国  

**梁天宇**  
微软公司,雷德蒙德大道 1 号,华盛顿州 98052,美国  

**王文浩**  
国防科技大学电子对抗学院,合肥 230037,中国  

---

### 摘要  
强调时序差分学习(ETD)通过期望更新的稳定性和投影几何的改变解决了离策略学习的稳定性问题,但两者均未决定固定步长下的采样动态。本文构造了一个遍历的两状态反例,其中 ETD 均值映射是压缩的,但其采样乘积的上李雅普诺夫指数为正。再生循环分析将这一符号与后继轨迹的无穷方差区分开来。我们提出正则化强调时序差分(RETD),这是一种一阶归一化冲击后修复方法,不改变轨迹和重要性比率,而是将强调时序差分信号存储在一个泄漏标量状态中,并释放延迟校正。RETD 的原始平衡状态是 ETD 平衡状态的仿射平移;单次和双次正则化读数可精确恢复 ETD 固定点。本文证明了调和递减步长的几乎必然收敛性,并基于马尔可夫随机乘积边界给出了固定步长下的条件矩收缩结果。RETD 在两状态构造和一个 Baird 点上具有经认证的负指数,而 Baird ETD 的正指数仍为数值结果。配对的万次实验验证了两者分离、定点恢复、非单调稳定区域和任务依赖性。RETD 改变了冲击后的动态,但未降低共享的后继轨迹方差。  

---

### 关键词  
离策略学习,强调时序差分学习,固定步长,随机矩阵乘积,定点恢复  

---

## 1 引言  
离策略时序差分学习至少涉及两个问题:期望递归是否稳定,以及其定点是否是对目标策略的良好近似。Baird 反例表明,普通离策略 TD 可能在均值更新层面失效(Baird, 1995)。梯度 TD 方法则通过稳定投影目标来解决此问题(Sutton 等人, 2008; 2009)。斜投影分析进一步表明,收敛并不意味着良好的近似(Scherrer, 2010; Kolter, 2011)。ETD 通过强调状态加权解决了这两个问题:其稳态期望更新是正稳定的,投影贝尔曼方程使用强调权重(Sutton 等人, 2016; Hallak 等人, 2016)。递减步长收敛和受约束的固定步长弱收敛结果已知(Yu, 2015; 2016),但这些结果并未解决无约束的固定非零步长采样递归问题。有限均值、无穷方差的后继轨迹标识了冲击源,而非相关随机矩阵乘积的符号。我们在一个完全指定的两状态示例中研究这一差距:目标动作的行为概率为 0.3,重要性比率为 10/3 和零,γ=0.9,标量特征为 1 和 2,步长 α=0.1。ETD 均值乘子为 0.684,而再生分析证明其上李雅普诺夫指数严格为正。我们称此为**均值-路径稳定性差距**。  

同一构造也指明了修复机制。长时间的目标动作运行会产生较大的强调冲击,但随后的零比率 ETD 更新是恒等操作。RETD 添加一个泄漏标量状态,使得后续样本即使在当前比率为零时也能释放延迟校正;轨迹和比率本身保持不变。第 3 节从七个设计约束推导出 RETD。正泄漏消除了 c=0 的守恒模态,而平衡分析给出了单 c 和双 c 下对 ETD 预测的恢复,包括奇异和病态情况。随后我们证明递减步长结果,并实例化 Durmus 等人(2021)的固定步长随机乘积定理;显式反例点通过再生或投影证书处理。  

我们的贡献有三方面:  
**(1)** 给出精确的两状态均值-路径分离:ETD 在均值上是严格稳定的,但具有正的上李雅普诺夫指数;而 RETD 在相同任务和步长下具有经认证的负指数。  
**(2)** 将 RETD 推导为冲击后动态的一标量反馈修正,描述其平衡性质,包括单 c 和双 c 下对 ETD 固定点的恢复以及相关的奇异性和条件数。  
**(3)** 证明递减步长和条件固定步长随机稳定性结果,在 Baird 反例上给出严格的 RETD 证书和数值 ETD 诊断,并评估机制、恢复、稳定区域、基线、成本和不利任务。  

---

## 2 预备知识与固定步长 ETD 反例  
我们从普通和强调投影系统开始,区分定点质量与三种动态稳定性概念。随后两状态反例展示了 ETD 均值稳定性为何不能解决固定步长采样路径问题。  

### 2.1 离策略线性预测  
考虑有限马尔可夫决策过程,状态空间 S,动作空间 A,目标策略 π,行为策略 μ,常数折扣 γ∈[0,1)。行为链是非周期不可约的,具有平稳分布 d_μ,且目标策略被行为策略覆盖。在时刻 t,定义 ρ_t = π(A_t|S_t)/μ(A_t|S_t),以及 v_θ(s) = φ(s)^⊤θ,其中 Φ 的行是特征向量。TD 误差为 δ_t = R_{t+1} + γφ(S_{t+1})^⊤θ_t - φ(S_t)^⊤θ_t。设 P_π 和 r_π 分别为目标策略转移矩阵和期望单步奖励,则 v_π = (I - γP_π)^{-1}r_π。  

普通重要性采样 TD(0) 的稳态均值系统为:  
A_μ = Φ^⊤D_μ(I - γP_π)Φ, b_μ = Φ^⊤D_μ r_π,  
其中 D_μ = diag(d_μ)。Baird 反例表明 A_μ 不一定是正稳定的,因此期望递归本身可能发散(Baird, 1995)。  

### 2.2 定点是独立问题  
假设算法收敛到 θ_μ = A_μ^{-1}b_μ,其预测是斜投影,质量取决于采样和投影几何;因此收敛并不意味着接近 v_π(Scherrer, 2010; Kolter, 2011)。可达性和质量是独立问题。梯度 TD 方法稳定投影目标,但不会自动将行为加权替换为 ETD 相关的强调加权。单位兴趣的 ETD(0) 使用后继轨迹 F_{t+1} = 1 + γρ_t F_t 和更新 θ_{t+1} = θ_t + α_t F_t ρ_t δ_t φ(S_t)。其期望强调权重和线性系统为:  
f = (I - γP_π^⊤)^{-1}d_μ, F = diag(f),  
A = Φ^⊤F(I - γP_π)Φ, b = Φ^⊤F r_π。  
在标准正兴趣和特征条件下,A 是正稳定的,θ_E = A^{-1}b 解决强调加权投影贝尔曼方程(Sutton 等人, 2016; Hallak 等人, 2016)。因此路径稳定性修正必须说明如何保留此定点信息。  

### 2.3 三种稳定性概念  
“ETD 是稳定的”这一说法不完整,除非指定渐近区域和随机对象。我们区分三种概念:  

- **均值稳定性**:轨迹过程处于平稳状态且参数冻结时,期望 ETD 漂移为 θ̇ = b - Aθ。当 -A 是 Hurwitz 矩阵时 ODE 是稳定的;对于常数 α,ρ(I - αA) < 1 是对应的均值映射诊断。两者均不是采样乘积的期望。  

- **递减步长随机稳定性**:对于 Robbins-Monro 调度 α_t ↓ 0,实际迭代是否保持有界且几乎必然收敛?这不蕴含当 α_t ≡ α > 0 时的稳定性。  

- **固定步长随机稳定性**:对于常数调度 α_t ≡ α > 0,减去平衡状态并将齐次误差递归写作 e_{t+1} = M_t(α)e_t。相关长期对象是有序随机乘积 M_{t-1}⋯M_0。在可识别预测空间上,定义上李雅普诺夫指数:  
  λ(α) = lim sup_{t→∞} (1/t) log ‖M_{t-1}(α)⋯M_0(α)‖。 (1)  
  负指数意味着初始扰动的指数遗忘,对于仿射递归,通常收敛到平稳因果过程而非确定点。正指数意味着存在扩展的主方向;在标量反例中每个非零初始误差指数增长。这些概念不通过简单期望恒等式相联系。特别是 E[M_t e_t] ≠ E[M_t]E[e_t],因为 F_t、状态和当前迭代是相关的。F_t 的无穷方差警告冲击严重,但不决定方程(1)的符号;该符号必须从乘积中分析。  

后文使用的矩阵 A 和 G_c 是平稳均值矩阵,而采样因子生成有序随机乘积。均值矩阵的谱半径计算不能替代其采样乘积的李雅普诺夫指数计算。  

### 2.4 两状态反例  
设 S = {s_1, s_2},A = {a_0, a_π}。行表示当前状态,列表示下一状态,动作条件转移矩阵为:  
P^{a_0} = [[1, 0], [1, 0]], P^{a_π} = [[0, 1], [0, 1]]。  
特征向量:φ(s_1) = 1,φ(s_2) = 2。  
目标策略始终选择 a_π,行为策略选择 a_π 的概率为 p = 0.3,选择 a_0 的概率为 0.7。  
因此 P_μ = [[7/10, 3/10], [7/10, 3/10]],d_μ = [7/10, 3/10]^⊤,  
ρ(a_π) = 10/3,ρ(a_0) = 0。  
设 R_{t+1} = 0,γ = 0.9,α = 0.1,φ(s_1) = 1,φ(s_2) = 2。两状态保持区别:它们在两种动作下的转移目标不同且特征值不同。标量参数仅将两个预测限制在 (θ, 2θ),并不合并状态。零奖励使真实值 v_π = 0,精确由 θ^* = 0 表示。仿射项消失,因此无需近似误差即可研究齐次稳定性问题。  

### 2.5 轨迹具有有限均值和无穷方差  
设 K_t 为

相似文章

扩散模型的时间差分学习

arXiv cs.LG

本文提出了一种用于扩散模型的时间差分(TD)学习目标,该目标在去噪轨迹上强制跨时间一致性。它将去噪重新表述为强化学习中的策略评估问题,展示了在样本质量(FID)上的显著改进,尤其适用于少步采样器。

AMRD:面向轻量级语音情感识别的自适应多教师关系蒸馏

Hugging Face Daily Papers

本文介绍了AMRD,一种自适应多教师关系蒸馏方法,用于将大型自监督语音情感识别模型压缩为面向边缘设备的轻量级学生模型。它解决了教师可靠性变化和关系结构丢失的问题,在IEMOCAP和CREMA-D数据集上展示了改进。

ReDiTT: 面向异步时间序列的检索增强条件扩散Transformer

arXiv cs.LG

本文提出了 ReDiTT,一种面向异步时间序列预测的检索增强条件扩散Transformer。该模型检索结构相似的潜在序列作为参考条件,以改进长时域预测和样本多样性,在七个真实数据集上取得了最先进的性能。