神经启发的逆学习用于规划与控制
摘要
本文介绍了一种名为Inverter的神经启发式框架,该框架利用逆学习(Inverse Learning, IL)实现快速高效的规划与控制,在D4RL基准测试和量子门合成上取得了显著改进,推理计算量降低了数个数量级。
查看缓存全文
缓存时间: 2026/05/26 09:05
# 神经启发逆学习用于规划与控制 来源: https://arxiv.org/html/2605.24152 Tonio Ball通讯作者: tonio\.ball@neuromentum\.ai (https://arxiv.org/html/2605.24152v1/mailto:[email protected]) NeuroMentum AI IMBIT, 德国弗莱堡大学, 2026年5月 ###### 摘要 我们提出了一种用于具身规划与控制的神经启发框架。基于使哺乳动物大脑能够实现快速高效目标导向行为的三个原则——配对的顺向/逆向内模型、开环多步运动指令以及动作的顺序层次化组织——我们的*Inverter*框架使用通过学习得到的组件,通过*逆学习 (https://arxiv.org/html/2605.24152#A1.SS1.22.22.22) (IL (https://arxiv.org/html/2605.24152#A1.SS1.22.22.22))*进行端到端训练,并在自然情况下辅以分析或算法模块;我们形式化了IL (https://arxiv.org/html/2605.24152#A1.SS1.22.22.22),并将其与监督学习、强化学习和模仿学习区分开来。IL (https://arxiv.org/html/2605.24152#A1.SS1.22.22.22) 桥接了强化学习 (https://arxiv.org/html/2605.24152#A1.SS1.59.59.59) (RL (https://arxiv.org/html/2605.24152#A1.SS1.59.59.59)) 风格的摊销(单次前向传播但每次只输出一个动作)和最优控制 (https://arxiv.org/html/2605.24152#A1.SS1.48.48.48) (OC (https://arxiv.org/html/2605.24152#A1.SS1.48.48.48)) 风格的全轨迹序列规划(但需要迭代的测试时计算)。在 D4RL (https://arxiv.org/html/2605.24152#A1.SS1.13.13.13) 的所有 3 个 maze2d 和 6 个 antmaze 变体上,单层 Inverter 或层次化 n=2 的 Inverter 堆栈在性能上与离线 RL (https://arxiv.org/html/2605.24152#A1.SS1.59.59.59) 和扩散规划器基线持平或更优,平均提升 +24.2%(范围从 -1.9% 到 +78.2%),而推理计算时间却低一到两个数量级。特别地,通过在整个 T 步动作序列上优化顺向模型 (https://arxiv.org/html/2605.24152#A1.SS1.19.19.19) (FoM (https://arxiv.org/html/2605.24152#A1.SS1.19.19.19))——而不是逐步骤优化——使得 Inverter 能够生成平滑、目标一致、具有全局轨迹结构的控制策略,并且比训练数据本身的策略更接近分析最优解。我们还识别了 IL (https://arxiv.org/html/2605.24152#A1.SS1.22.22.22) 的一种失败模式:在训练数据覆盖范围狭窄的情况下会出现 FoM (https://arxiv.org/html/2605.24152#A1.SS1.19.19.19) 破解,我们通过使用覆盖范围更广的*随机*训练数据来缓解这一问题。作为一个应用示例,脉冲 Inverter 可以合成任意单量子比特量子门,其保真度与标准迭代数值基线 (GRAPE (https://arxiv.org/html/2605.24152#A1.SS1.21.21.21)) 相当,而每个门的计算时间降低了 1000 倍以上。总之,我们得出结论,IL (https://arxiv.org/html/2605.24152#A1.SS1.22.22.22) 实现了一类多功能的与世界交互的接口,尤其适用于延迟和资源敏感的具身 AI。 ## 1 引言 人类甚至在我们开始行动之前就能够生成多个时间尺度上的明确计划。例如,想象一下计划去巴黎旅行。甚至在动手之前,我们可能就已经在考虑预订火车和寻找酒店。我们可能也已经知道如何执行这些步骤中的每一个——例如,如何在我们选择的预订网站上导航以找到合适的住宿。而当我们伸手去拿笔记本电脑,急于开始时,我们的手可能会沿着一条平滑的、预先成型的轨迹扫过——这是一个完整规划的“弹道”运动。因此,人类的目标导向行为从根本上组织成一个跨越不同时间尺度的规划与控制层次结构,通常以某种形式在采取任何行动之前就已经制定好了。这种跨越多时间尺度、针对整个动作序列进行预优化的计划,并不是主导的连续控制学习范式(如 RL (https://arxiv.org/html/2605.24152#A1.SS1.59.59.59),它旨在每次输出一个反应性动作,或 OC (https://arxiv.org/html/2605.24152#A1.SS1.48.48.48),它旨在优化整个轨迹但通常在运行时迭代进行——这也是主动推理等相关框架的一个特性)的核心关注点。在这里,我们提出了一种学习规划与控制的范式,其原理受哺乳动物大脑的功能组织启发,其概念核心是快速有效地*预生成*这种层次化的、多时间尺度的计划和动作序列,以实现目标导向的具身行为。我们首先将大脑视为一个逆运算机器。见图注图 1:Inverter 规划与控制框架。(A) 两个不同抽象层级配对的 Inverter 示意图。*第一层 Inverter (控制)* gφ(sk−1, ck) → a1:T(k) 通过 IL (https://arxiv.org/html/2605.24152#A1.SS1.22.22.22) 经过 FoM (https://arxiv.org/html/2605.24152#A1.SS1.19.19.19) 进行训练,并在每个块的单次前馈传递中生成每个 T 步动作块——无需内部优化循环,无需自回归解码,无需迭代去噪。*第二层 Inverter (规划)* hψ(s0, G) → c1:K 发射一个由 K 个子目标组成的序列,每个块对应一个子目标。该框架自然地扩展到更深层次的层次结构 (n≥3,如展望中所述)。这些块在时间轴上平铺,最终驱动代理到达目标 G。(B) 示例性的单次生成示例。从起始状态 (•) 开始,Inverter 在单次前馈传递中发射完整的动作序列;绿色箭头是计划的逐步骤动作;曲线是通过环境动力学执行这些动作后产生的轨迹,瞬时速度用颜色编码。镜像了神经生物学运动控制的最优反馈控制理论 [94 (https://arxiv.org/html/2605.24152#bib.bib27)],因此我们的框架拒绝了“期望轨迹”的概念:观察到的运动特性是从动作序列中涌现出来的。#### 大脑作为逆运算机器。主流的贝叶斯大脑观点将大脑概念化为一个推理机器 [58 (https://arxiv.org/html/2605.24152#bib.bib3), 28 (https://arxiv.org/html/2605.24152#bib.bib4)]。我们首先将大脑概念化为一个*逆运算*机器:目标导向行为提出了一个逆问题“给定期望的结果,哪些动作可以实现它?”;解决这个逆问题可以最小化期望结果与实际结果之间的差距。其计算核心是逆运算一个关于世界如何响应动作的模型——这个问题存在丰富的实现空间:迭代或摊销(学习到的直接逆映射,单次前馈传递);概率或确定性的;在全可观测或部分可观测、单智能体或多智能体动力学下;具有连续、离散或混合的状态和动作空间;并通过闭式解、算法或学习组件实现。我们假设大脑灵活地使用任何适合任务、时间尺度和资源的解决方案 [32 (https://arxiv.org/html/2605.24152#bib.bib5), 66 (https://arxiv.org/html/2605.24152#bib.bib94), 33 (https://arxiv.org/html/2605.24152#bib.bib95)]。这里我们聚焦于摊销的、确定性的、单智能体和全可观测的直接映射变体,遵循 Jordan & Rumelhart 的远端教师框架 [50 (https://arxiv.org/html/2605.24152#bib.bib6)] 和 Kawato 的内模型理论 [53 (https://arxiv.org/html/2605.24152#bib.bib7), 98 (https://arxiv.org/html/2605.24152#bib.bib8)] 的经典运动控制概念。三个基本原则的组合构成了我们方法的核心: - •*配对的顺向模型 (https://arxiv.org/html/2605.24152#A1.SS1.19.19.19) (FoMs (https://arxiv.org/html/2605.24152#A1.SS1.19.19.19)) 和逆模型 (https://arxiv.org/html/2605.24152#A1.SS1.23.23.23) (IMs (https://arxiv.org/html/2605.24152#A1.SS1.23.23.23))*,其中 FoM (https://arxiv.org/html/2605.24152#A1.SS1.19.19.19) 提供指导性误差信号 [50 (https://arxiv.org/html/2605.24152#bib.bib6), 53 (https://arxiv.org/html/2605.24152#bib.bib7), 98 (https://arxiv.org/html/2605.24152#bib.bib8)]。 - •*开环多步运动指令*,以预规划的块的形式弹道式执行,速度快于感觉校正 [101 (https://arxiv.org/html/2605.24152#bib.bib107), 23 (https://arxiv.org/html/2605.24152#bib.bib9)]。 - •*动作的顺序层次化组织*,将行为分割成顺序的子计划,并在不同时间尺度和抽象层级上嵌套,高层级区域向下层循环发出子目标 [35 (https://arxiv.org/html/2605.24152#bib.bib10), 24 (https://arxiv.org/html/2605.24152#bib.bib11), 7 (https://arxiv.org/html/2605.24152#bib.bib12), 44 (https://arxiv.org/html/2605.24152#bib.bib106)]。 表 1:本文中的五个 Inverter。每个层级对不同的顺向过程进行逆运算,并在单次前馈传递中发射其多步输出序列;四个是通过 IL (https://arxiv.org/html/2605.24152#A1.SS1.22.22.22) 训练的神经 Inverter,一个是简单的算法 BFS (https://arxiv.org/html/2605.24152#A1.SS1.5.5.5) 路径 Inverter。 #### Inverter 规划与控制框架。我们将上述三个原则组织成一个规划/控制框架 (图 1 (https://arxiv.org/html/2605.24152#S1.F1)),该框架由 n=1,2,3,… 抽象层级的 Inverter 层次结构组成,所有 Inverter 共享相同的构建模块(通过 FoM (https://arxiv.org/html/2605.24152#A1.SS1.19.19.19) 的逆学习网络)。在本文中,我们聚焦于我们进行实证评估的两个层级 (表 1 (https://arxiv.org/html/2605.24152#S1.T1)): - •*第一层 Inverter (控制)*:发射动作序列——在我们的实验中是连续且物理的(电机扭矩、控制脉冲),或者是其他领域的离散信号(例如 API 调用)。 - •*第二层 Inverter (规划)*:发射由第一层使用的子目标序列。相同的递归形状自然扩展到 n≥3 个 Inverter,每个 Inverter 指定其下一层如何生成输出——例如通过选择一个子目标发射策略,通过组合子目标的序列的序列,或通过其他依赖于上下文的形式;我们此处不评估 n≥3 (见展望)。框架内使用的神经架构可能因领域而异——本文中所有迷宫 FoMs (https://arxiv.org/html/2605.24152#A1.SS1.19.19.19) 和 Inverter 都是 Transformer,而量子脉冲 Inverter 是一个多层感知器 (https://arxiv.org/html/2605.24152#A1.SS1.35.35.35) (MLP (https://arxiv.org/html/2605.24152#A1.SS1.35.35.35)),这适合其紧凑的目标,无需时间上下文。在分析或算法解决方案更自然且更有用的情况下,我们将其替换为神经网络 (https://arxiv.org/html/2605.24152#A1.SS1.46.46.46) (NN (https://arxiv.org/html/2605.24152#A1.SS1.46.46.46)): - •*作为 FoM (https://arxiv.org/html/2605.24152#A1.SS1.19.19.19) 的 Lindblad 通道* (脉冲 Inverter,第 4.5 节 (https://arxiv.org/html/2605.24152#S4.SS5)):有噪声的 transmon 动力学由已知的主方程支配,因此学习的 FoM (https://arxiv.org/html/2605.24152#A1.SS1.19.19.19) 只会近似我们已经拥有闭式解的物理过程。 - •*基于离线数据占用网格的广度优先搜索 (https://arxiv.org/html/2605.24152#A1.SS1.5.5.5) (BFS (https://arxiv.org/html/2605.24152#A1.SS1.5.5.5)) 路径 Inverter* (maze2d - medium/large,第 4.2 节 (https://arxiv.org/html/2605.24152#S4.SS2)):通过长走廊的路径点路由是一个离散的最短路径子问题,简单的算法 BFS (https://arxiv.org/html/2605.24152#A1.SS1.5.5.5) 已经在数据支持上解决了该问题,因此学习的第二层 Inverter 只会增加复杂性而无益处。这种策略对应于我们假设的大脑中的任务、时间尺度和资源依赖的灵活性 [32 (https://arxiv.org/html/2605.24152#bib.bib5), 66 (https://arxiv.org/html/2605.24152#bib.bib94), 33 (https://arxiv.org/html/2605.24152#bib.bib95)]。有趣的是,在实践中,这种实现方法在我们的几个 Inverter 中产生了神经符号模式——我们将在讨论 (第 5 节 (https://arxiv.org/html/2605.24152#S5)) 中将其作为第四个涌现的组织原则来重新审视。接下来,我们形式化 IL (https://arxiv.org/html/2605.24152#A1.SS1.22.22.22) 范式,包括训练规则。 ## 2 神经启发逆学习 作为一个*范式*,我们在这里形式化逆学习 (https://arxiv.org/html/2605.24152#A1.SS1.22.22.22)——通过学习的 FoM (https://arxiv.org/html/2605.24152#A1.SS1.19.19.19) (作为通过训练的 FoM (https://arxiv.org/html/2605.24152#A1.SS1.19.19.19) 进行自监督学习的一种形式) 对任务目标进行微分来训练网络,并与监督学习、强化学习和模仿学习区分开来 (表 2 (https://arxiv.org/html/2605.24152#S2.T2))。在*算法*层面,我们形式化当该范式应用于 Inverter 的角色规范时产生的具体训练规则 (方程 2 (https://arxiv.org/html/2605.24152#S2.E2))。通过行动实现目标可以直接表述为动作优化:给定状态 s0 和任务条件 c (框架中第一层的每块子目标 ck,第二层的总体目标 G),找到 a1:T∗ = arg min_{a1:T} J(s0:T, a1:T, c) (1) 约束条件: s1:T = f(s0, a1:T),这是一个经典的 OC (https://arxiv.org/html/2605.24152#A1.SS1.48.48.48) 离散时间 Bolza 问题 [77 (https://arxiv.org/html/2605.24152#bib.bib28), 12 (https://arxiv.org/html/2605.24152#bib.bib29)],由 (s0, c) 参数化,以分块形式给出(等价于逐步骤递归 st = f(st-1, at)),其中 J 是终端成本、运行奖励和动作正则化项的任何可微组合。J 中的每一项都可以是预测的状态-动作轨迹的闭式函数(例如,解析终端成本、支持区域指示器、动作正则化项)、一个额外的学习奖励模型——一个单独的可微批评器,或 FoM (https://arxiv.org/html/2605.24152#A1.SS1.19.19.19) 本身的专用奖励头——或任何此类项的总和。闭式和学习组件*在单个 J 内自由组合*;唯一的要求是对 a1:T 的可微性。这种组合自由让单个 Inverter 能够针对任意可微的多轴规范。Pontryagin 的协态方程——通过 f 的反向传播,早于其在神经网络中的使用——针对每个 (s0, c) 查询迭代地求解方程 (1) (https://arxiv.org/html/2605.24152#S2.E1),无需跨查询的学习摊销。相反,值迭代的 Bellman 方程 V*(s) = max_a [r(s,a) + γ V*(f(s,a))] [10 (https://arxiv.org/html/2605.24152#bib.bib30)] 不生成动作序列,而是每次只生成一个反应性动作。#### 摊销规划器。IL (https://arxiv.org/html/2605.24152#A1.SS1.22.22.22) 将经典的每次查询轨迹优化摊销为一个双组件*学习*
相似文章
Neurosymbolic Reasoning with Incremental Knowledge for Sample Efficient Hierarchical Reinforcement Learning
This paper proposes InK, a neurosymbolic hierarchical reinforcement learning approach that uses incremental knowledge for symbolic planning and reward-shaped low-level neural modules, achieving improved sample efficiency in navigation tasks.
通过双层优化实现交互场景的交互式逆向强化学习
本文介绍了交互式逆向强化学习(IIRL),这是一个学习者通过与专家主动互动来推断奖励函数的框架,其形式化为随机双层优化问题。作者提出了 BISIRL 算法,为该交互式学习范式提供了收敛性保证和实验验证。
通过学习深度逆动力学模型实现从仿真到真实世界的转移
# 通过学习深度逆动力学模型实现从仿真到真实世界的转移 来源: [https://openai.com/index/transfer-from-simulation-to-real-world-through-learning-deep-inverse-dynamics-model/](https://openai.com/index/transfer-from-simulation-to-real-world-through-learning-deep-inverse-dynamics-model/) ## 摘要 在仿真环境中开发控制策略通常比直接在真实世界中运行实验更加实际和安全。这适用于从强化学习中获得的策略
ACID:通过逆动力学实现世界模型规划中的动作一致性
本文提出ACID方法,通过逆动力学模型引入循环动作一致性,增强世界模型中的决策时间规划,确保预测的可实现性,并在多个任务中以更少的计算量提升规划效率。
基于强化学习的折纸超材料逆向结构设计与快速激光切割原型制作
本文介绍了 RL-Kirigami,这是一个结合最优传输条件流匹配和强化学习的框架,用于解决折纸超材料的逆向设计问题,实现了高精度并支持快速的激光切割原型制造。