用于具有不可观测记忆状态的欧拉-拉格朗日系统自适应控制的时序注意力
摘要
本文提出了一种利用时序自注意力进行元控制的架构,旨在对具有不可观测记忆状态的欧拉-拉格朗日系统进行自适应控制。在2自由度机械臂上的实验表明,该方法在追踪性能上优于基线方法,同时揭示了在长记忆机制下的失效模式。
arXiv:2605.06877v1 公告类型:新论文
摘要:当摩擦力由无法通过关节测量直接观测到的有限视界内部状态支配时,欧拉-拉格朗日系统的自适应控制具有挑战性。在此设定下,测得的闭环状态不再是马尔可夫的,标准的确定性等价自适应律可能会失去其收敛保证。
本文提出了一种元控制架构,其中计算力矩控制器的增益由一个自注意力块生成,该块处理最近运动历史的短窗口。注意力头的数量在策略训练之前通过沿时间窗口对记忆状态梯度自协方差进行替代分析来选定。该替代方法基于作者先前开发的增量秩跟踪框架的时序适应性改进。选定头数后被固定,并作为强化学习阶段的架构超参数使用,其中策略在屏蔽的可接受性约束下进行训练。
该方法在具有非线性摩擦和可变负载的2自由度机械臂上进行测试。在短记忆和匹配记忆机制下,单层纯注意力元控制器优于更深层的Transformer基线,追踪误差分别减少了12和19个百分点。报告的效应量较大,d分别约为-1.1和-2.1,且两种情况下的Mann-Whitney p值均小于0.05。
然而,在长记忆机制下,这一优势消失。十次训练运行中有四次出现发散或负载不变的政策崩溃,揭示了静态阶段一(Phase-1)头数规定的弱点。这促使将秩跟踪移至强化学习循环内部,允许在运行时修剪或增长注意力头,而不是在训练前固定。
查看缓存全文
缓存时间: 2026/05/11 07:01
# 用于具有不可观测记忆源的欧拉-拉格朗日系统自适应控制的时间注意力:来源:https://arxiv.org/html/2605.06877 \(2026年4月\)
###### 摘要 当摩擦动力学由一个在有限视界内衰减但不能直接从关节测量中观测的内部状态驱动时,欧拉-拉格朗日系统的自适应控制变得微妙。在这种机制下,闭环响应在测量状态下不再是马尔可夫的,标准的基于确定性等价原理的自适应律失去了其收敛性保证。本文提出了一种元控制架构,其中计算力矩律的增益由一个自注意力块产生,该块读取最近运动历史的短窗口。注意力块的头部数量在策略训练之前选定,通过对记忆状态梯度沿其时间窗口的自协方差进行代理分析来选择;该代理是作者早期工作中开发的增量秩跟踪框架的时间适应版本。得到的头部数量作为固定的架构超参数传递给强化学习阶段,在该阶段中,策略在继承自 companion 论文的屏蔽许可约束下进行训练。在一个具有非线性摩擦和可变负载的2自由度(2-DOF)机械臂上,在选定的头部数量下,单层仅注意力的元控制器在短期和匹配的记忆机制下,比更深的 Transformer 基线表现出统计上显著的优势:跟踪误差分别减少 12 和 19 个百分点,效应量大($d \approx -1.1$ 和 $-2.1$),且在两种情况下 Mann-Whitney $p < 0.05$。在长记忆机制下,优势在更大的样本上消失,十次训练运行中的四次表现出发散或负载不变的策略崩溃,这确定了静态的 Phase-1 头部数量处方与强化学习优化之间接口特有的失败模式。失败模式分析促使后续研究,其中秩跟踪动力学被移动到强化学习循环内部,运行时注意力的剪枝和生长取代了静态的 Phase-1/Phase-2 分离。关键词:自适应控制;欧拉-拉格朗日系统;摩擦;强化学习;自注意力;神经架构搜索;Lyapunov 安全性。
## 1 引言 在速度相关摩擦下跟踪参考轨迹的刚体机械臂构成了自适应控制最古老的测试平台之一。当摩擦可以写成已知回归量乘以未知参数向量时,Slotine 和 Li [17] 的基于无源性自适应律通过将确定性等价前馈与参数估计的梯度式更新相结合,实现了渐近跟踪。该论证基于两个结构属性:动力学在未知参数上的线性以及某个闭环算子的正实性。粘性摩擦和库仑摩擦都保留了这两个属性。当引入预滑动内部状态时(如在 Stribeck 和 LuGre 模型中 [4, 5]),这两个属性都不再存在:状态携带其自身的动力学,在有限视界内衰减,并且不能从关节运动学瞬时恢复。此时,闭环系统在测量状态下不再是马尔可夫的,标准自适应构造不再适用。 作者的一篇 companion 论文 [7] 通过安全的残差强化学习(RL)解决了相同的机制。计算力矩基线由一个 Soft Actor-Critic(SAC)策略 [12] 增强,该策略输出有界扭矩校正,同时学习的 Lyapunov 函数通过封闭形式投影在每个控制步骤上强制下降条件。该构造在经验上是有效的,但在结构上限制了强化学习代理两个方面。首先,动作空间是扭矩向量,其维度高于其增强的参数控制器。其次,代理仅观察瞬时状态:不可观测记忆的时间结构未暴露给策略。 这两项限制都通过单一设计选择得到解决:强化学习策略提升到控制器参数级别,其输入扩展到最近运动的窗口历史。因此,策略不是扭矩,而是从历史到增益的映射;其产生的控制器通过窗口具有记忆性,尽管其函数形式仍然是计算力矩律。该映射的架构是本文的主题。 核心的架构问题是处理历史窗口的注意力头部数量。头部太少,表示无法解析记忆的时间结构;头部太多,强化学习优化将在没有相应收益的高维参数空间中运行。提出的答案从记忆状态沿其时间窗口的梯度构建代理协方差算子,验证其有效秩是所需表示能力的压缩感知上限,并将由此产生的头部数量作为强化学习阶段的固定架构超参数。代理分析本身是 [8] 增量秩跟踪框架的时间适应版本,并在第 6 节中开发。强化学习阶段及其屏蔽许可机制继承自 [7],未经修改。这两个阶段之间的分离遵循神经架构搜索(NAS)中常见的“搜索-再训练”模式 [13, 16, 11];这种模式的采用在第 6.3 节中证明是合理的。
##### 贡献。 本文贡献了三个要素。首先,任何输入在测量状态下为马尔可夫的元控制器可实现的跟踪误差的定量下界。该下界随不可观测记忆的稳态方差缩放,并随着窗口长度超过记忆视界而消失(命题 5.12)。该下界在非正式意义上,其假设而非结构反映了成本和记忆动力学的正则性;假设在陈述旁边明确说明。其次,一个时间残差算子,其有效秩上界了表示记忆所需的注意力头部数量(命题 5.15)。该算子是从记忆沿窗口的梯度的样本构建的,且独立于强化学习目标;其有效秩在记忆视界上是非单调的,在视界与窗口时间乘积匹配时达到峰值(推论 5.16)。第三,对具有 Stribeck 摩擦的 2-DOF 机械臂的实验评估。在头部数量固定在代理值的情况下,单层仅注意力的元控制器在短期和匹配的记忆机制下,比更深的 Transformer 基线将跟踪误差提高 12-19 个百分点,效应量大($d \approx -1.1$ 和 $d \approx -2.1$),且在两种情况下 Mann-Whitney $p < 0.05$。这种优势不能归因于窗口大小调整:与 INCRT-1L 获胜者窗口相等的机制匹配 Transformer 基线的表现与原始 Transformer 基线不可区分,INCRT-1L 对其保持巨大优势($d = -2.02, p_U = 0.008$)。在长记忆机制下,优势在 $n=10$ 的样本上消失,十次 INCRT-1L 训练运行中的四次表现出发散或负载不变的崩溃,而任何一种 Transformer 变体最多只有一次;这种失败模式不对称性确定了长视界下静态 Phase-1/Phase-2 管道的局限性。伴随主要比较的消融确定了两个进一步的实证效应:没有前馈非线性的深度导致训练发散,且最佳窗口大小在记忆视界上不是单调的——这两者与 [9] 的秩压缩分析一致。
##### 未声明的内容。 两个理论结果的证明在第 5 节中在明确正则性假设下陈述,并在附录 A 中详细阐述;它们不是结构定理,即在最小假设下不成立。所提出的元控制器相对于 Transformer 基线的参数效率不是均匀的:在最短记忆视界上显著,在中间视界上缩小,在最长视界上逆转。$n=5$ 的试点研究建议在长记忆视界上对 Transformer 基线的优势,在 $n=10$ 的复制中未持续:第 7.5 节中确定的消失差距和失败模式集群构成了关于方法限制的最具信息量的单一结果。因此,长视界机制是所提出方法效果最不明显的地方,也是第 8 节概述的后续研究最有可能产生改进的地方。
##### 组织。 第 2 节回顾了本文所在的文献交叉点。第 3 节形式化了所解决的系统类别并固定了符号。第 4 节描述了参数级元控制器及其训练循环。第 5 节展示了两个理论结果及其假设。第 6 节开发了代理头部数量分析以及架构选择与策略训练阶段之间的分离。第 7 节报告了实验。第 8 节讨论了发现、限制和 companion 后续议程。证明出现在附录 A 中,实验协议在附录 B 中。
## 2 相关工作 这项工作涉及四个文献领域:具有摩擦的欧拉-拉格朗日系统的自适应控制、残差强化学习、具有 Lyapunov 保证的安全 RL 以及应用于控制任务的序列模型架构。我们引入的元控制器从每个领域借用,但位于它们交叉点的一个未被探索的区域。我们依次回顾每个领域,简要讨论与 RL 的神经架构搜索的关系,并以定位表结束,总结与最近先前工作的差异。
### 2.1 具有摩擦的自适应控制 具有速度相关摩擦的欧拉-拉格朗日系统的经典自适应控制拥有成熟的文献 [17]。主导范式将计算力矩前馈项与在线更新摩擦系数的参数估计循环相结合,通常在某些持续激励条件下 [5, 4]。LuGre 摩擦模型 [5] 引入了一状态内部变量以捕获预滑动动力学和粘滑现象,是此处处理的不可观测记忆状态 $z(t)$ 的最接近的经典类似物。Stribeck 曲线摩擦 [4] 添加了速度依赖包络,使记忆动力学在 $\dot{q}$ 上非线性。基于观察器的摩擦补偿方案,特别是中的双观察器设计家族,通过辅助动力系统重建内部状态以匹配摩擦记忆视界。这些方法在其有效范围内提供了强大的稳定性保证,但需要准确的摩擦参数模型(LuGre)或足够丰富的激励信号。我们的方法用从最近运动到控制器增益的学习窗口映射替换参数估计器,这不需要摩擦建模,但放弃了自适应控制的封闭形式收敛保证。第 5 节的屏蔽许可框架通过在元控制器输出级别强制 Lyapunov 下降约束部分恢复这些保证。
### 2.2 残差强化学习 残差强化学习——使用 RL 在基于模型的基线控制器之上学习校正项——在 [ ] 中引入,并在机器人操纵中看到了广泛应用。该范式具有吸引力,因为基线控制器处理大部分动力学,RL 策略仅处理未建模残差,给出样本高效的训练和探索期间的安全性。父工作 [7] 采用这种范式,具有计算力矩基线和 Lyapunov 屏蔽 SAC 策略,并解决了在高维机械臂中出现的可扩展性问题(屏蔽激活达到 ~70%)。我们的工作将残差 RL 范式扩展到两个方向。首先,RL 策略在元控制器级别(控制器*参数*)而非扭矩级别运行,这是更紧凑的动作空间,并将许可约束重构为凸多面体(引理 5.2)。其次,元控制器消耗窗口历史而非瞬时状态,反映问题的不可观测记忆结构(定义 5.10)。
### 2.3 具有 Lyapunov 保证的安全 RL 几个安全 RL 流派通过将 RL 与经典控制理论耦合来强制稳定性或约束满足。约束马尔可夫决策过程(CMDP)[2] 为累积成本约束引入对偶乘子公式,导致本工作中使用的 Lagrangian SAC 变体 [1, 19]。控制屏障函数(CBF)[3] 通过动作上的二次规划强制前向不变安全集;该方法已在 [ ] 中与 RL 结合。基于 Lyapunov 的 RL [6] 约束动作以保留预指定(或学习的)Lyapunov 下降条件——父工作 [7] 和本论文所属的家族。父工作的具体贡献是与屏蔽和策略联合训练的学习 Lyapunov 函数 $V_\psi$。我们直接继承这个对象。相似文章
面向对抗性航天器接近操作中自适应安全关键控制的记忆高效元强化学习
本文研究了记忆高效元强化学习架构在对抗性航天器接近操作中用于自适应安全关键控制的性能,发现与LSTM和GRU相比,使用PPO的状态空间模型(如Mamba)在任务完成度、安全性和燃料节约方面表现更优。
面向部分可观测性的时序知识图谱记忆的神经符号元策略
本文提出了一种面向部分可观测强化学习中时序知识图谱记忆的神经符号元策略,结合基于RDF的图表示与符号记忆管理启发式方法,实现了可检查且自适应的控制。
动态线性注意力
本文提出DLA,一种用于多状态线性注意力的动态内存建模框架,它能根据令牌信息变化自适应地合并状态,并维护固定大小的状态缓存,从而在无需标准注意力二次复杂度的前提下实现更好的长上下文表示。
时序距离JEPA:面向潜在世界模型预测控制的规划感知表示学习
提出时序距离JEPA(TD-JEPA),从离线轨迹中挖掘有向时序代价,以改进潜在世界模型预测控制,在机器人环境中实现了更高的成功率。
使用时间段模型进行预测和控制
OpenAI 推出了一种使用深度生成模型在时间段上学习复杂非线性系统动力学的方法,能够实现稳定的长期预测和可微分的轨迹优化以进行基于模型的控制。