拓扑必要条件:跨具身目标条件控制中的机制不变战略子目标

arXiv cs.LG 论文

摘要

本文介绍了一种方法,从离线轨迹中提取拓扑必要条件作为机制不变的子目标,从而实现目标条件强化学习中的跨具身转移,并在基准任务上取得了经验性改进。

arXiv:2609.11014v1 Announce Type: new Abstract: 长期目标条件强化学习将控制权委托给一个提出子目标的高层模块,但现有的子目标是价值函数或潜在动作的隐式副产品,与产生它们的执行器紧密相关。我们研究一种不同的对象:一个路线条件的、不可避免阶段的顺序,每个成功的执行器都必须遍历,可以从离线轨迹中恢复,且不属于任何一个执行器。其定义属性是拓扑性的:一个不可跳过的阶段是一个分离集,每条可接受的路径都必须穿过它,而自由空间中的一个循环强制进行路线选择。我们通过基于成功轨迹构建的传输加权载具上的0维和1维同调来解读这两者,产生一个具有壳级证书的可枚举门集;这些认证的门就是我们所谓的拓扑必要条件。认证的门作为递归拓扑门层级进入决策循环。在固定的、同构的自由空间下,该对象在执行器替换时仍然有效:在PointMaze数据上冻结的门无需重新训练即可转移到Ant和Humanoid,在统一接口下获得了最高的Humanoid聚合分数(96.1),在多路线任务上比地图特权参考高+36.0(p=1.4e-5);规划器在PointMaze上饱和(100+/-0),并在AntMaze(巨幅+22.9)和Kitchen(+15.8/+12.6)上匹配或超越最强基线。
查看原文
查看缓存全文

缓存时间: 2026/09/11 08:26

# 跨体目标条件控制中的机制不变战略子目标
来源:https://arxiv.org/html/2609.11014

## 拓扑必然性:跨体目标条件控制中的机制不变战略子目标

郝石(Hao Shi)  
所属机构:中国人民解放军陆军工程大学(石家庄校区),中国石家庄市  
电子邮件:[[email protected]](mailto:[email protected])

李希(Xi Li)  
所属机构:中国人民解放军陆军工程大学(石家庄校区),中国石家庄市  
电子邮件:[[email protected]](mailto:[email protected])

###### 摘要

长时域目标条件强化学习将控制委托给一个提出子目标的高层模块,但现有的子目标是价值函数或潜在动作的隐式副产品,与生成它们的执行器绑定。我们研究的是一个不同的对象:一个所有成功执行器都必须遍历的、基于路径的不可避免阶段顺序,该顺序可从离线轨迹中恢复,且不属于任何一个执行器。其定义属性是拓扑的:一个不可跳过的阶段是一个分离集,每条可行路径都必须穿过它;自由空间中的一个环路强制了一个路径选择。我们在由成功轨迹构建的传输加权载体上,通过维度0和1的同调来解读这两个属性,得到一个可枚举的、具有壳层级别证书的门控集;经认证的门控就是我们所谓的*拓扑必然性*。经认证的门控作为递归拓扑门控层次结构进入决策循环。在固定的同构自由空间下,该对象能够经受执行器替换:在PointMaze数据上冻结的门控无需重新训练即可迁移到Ant和Humanoid执行器,在统一接口下达到最高的Humanoid综合得分(96.1),在多路径任务上比具有地图特权的基准方法高出36.0($p=1.4\times10^{-5}$);规划器在PointMaze上达到饱和($100 \pm 0$),在AntMaze(giant +22.9)和Kitchen(+15.8/+12.6)上匹配或超越了最强基线。

††脚注:代码与数据:https://osf.io/wak7u/overview?view_only=70a3d17f63114468a43b2d7a918e47db

## 1 引言

离线数据集记录了其他执行器的大规模经验;无需新交互即可从该经验中获取任务,是离线目标条件强化学习(GCRL)的承诺(Schaul et al., 2015;Andrychowicz et al., 2017;Kostrikov et al., 2022)。我们研究的是目标到达任务,其中智能体必须执行它从未执行过的任务,仅使用其他执行器(可能是动力学与其自身不同的其他体)记录的静态数据。对于长时域任务,时间抽象是标准做法:一个高层模块提出子目标,一个低层策略执行它们(Sutton et al., 1999;Nachum et al., 2018;Park et al., 2023)。在大多数方法中,子目标是在拟合流水线内部产生的,由价值函数、潜在动作或策略输出生成。通过与特定执行器绑定的量定义的子目标可能会吸收执行器特有的变化;这种变化对于任务来说是噪声,并且当执行器或体改变时可能降低迁移性。当任务知识与执行它的实体绑定时,迁移任务意味着重新学习它;与执行器分离的任务知识可以直接共享和重用。是否存在此类独立于执行器的任务结构,以及是否能从他人的经验中恢复,决定了跨执行器学习是否可能。

完全移除执行器后,会留下一样东西:一个不可避免的阶段顺序。要到达目标,每个成功的行为都必须在自由空间的每个环路上选择一侧,然后按固定顺序遍历相应的区域;这个基于路径的顺序由任何成功执行器的轨迹传递,且不属于任何一个执行器。其定义属性是拓扑的:一个阶段不可跳过是分离性质,即从起始区域到目标区域的每条可行路径都必须穿过的区域(定理T3(b));自由空间中的一个环路强制路径选择是绕数性质。在本文研究的任务中,这是问题提出的两个非平凡的拓扑问题,通过维度0和1的同调来解读,而框架用最低维度的、能够表达它们的不变量来回答每个子问题。新意之处在于对象本身:该顺序的定义,以及使其定义明确的框架和载体;同调则作为与之匹配的读出工具。我们将离线数据集视为诱导出所观测策略空间的几何-拓扑表示,并直接分析该对象:机制不变的结构存在于所有成功轨迹共享的支撑集中,而任何拟合策略只是其中一个实现。经认证的实例,由载体而非任何控制器的参数定义,是*拓扑必然性*:可证伪的结构子目标,在固定同构自由空间内可在执行器或体改变时进行测试。

我们使用传输加权图和校正嵌入来构建载体,并通过一维子水平集过滤读出其目标相对的壳层度量场,得到一个具有壳层级别、载体相对证书的可枚举门控集。同一个载体支持对导致路径分叉的有界孔洞的多尺度立方体持久$H_1$读出(附录A.12)。经认证的门控作为递归拓扑门控层次结构进入决策循环:每个门控间的段落都被重新分析以寻找持久子瓶颈,产生纯粹的结构细化,执行器在分布内跟踪它(第3节)。预测作为证据链进行测试。

在标准的OGBench套件上,相同的结构在PointMaze的所有三个规模上达到饱和($100 \pm 0$),在AntMaze(giant +22.9)上匹配或超越了最强的协议匹配基线,并在Kitchen上超越了HIQL(+15.8/+12.6)。在无学习的网格世界中,通过受控的机制干预出现了战略子目标,并且经认证的门控在四个机制配置中持续存在。在PointMaze数据上发现一次并冻结的门控集,无需重新训练即可迁移到Ant和Humanoid执行器,在统一接口下达到最高的Humanoid综合得分(96.1),其优势集中在多路径任务上(+36.0,$p=1.4\times10^{-5}$);在Kitchen上,无监督读出与有监督事件标签上限匹配(96.5 对 94.3)。保留数据有效性的布局扰动可逐个门控地重现序列(18/18);使其无效的扰动会使冻结的序列崩溃(7.3),而在幸存数据上重新识别可恢复部署(92.0;附录A.10)。段级别的递归消除了决策循环中的过渡区停顿(在分叉任务上+26.0,$p=0.0029$)。

##### 贡献。
- • **任务级子目标**:将离线行为数据视为诱导出所观测策略空间的几何-拓扑表示;子目标定义为相对于载体的拓扑必然性,其基于路径的顺序在没有下游执行器的情况下计算,并且具有跨执行器和体的可证伪生存预测。
- • **认证构建**:传输加权的载体和校正嵌入;一个最小的检测器,其可枚举性、分离证书和机制不变性是被证明的而非启发式假设的;一个递归拓扑门控层次结构,将经认证的门控带入决策循环(第3节);形式化为T1-T6,并附有冻结的代码实现。
- • **维度匹配的分解**:瓶颈顺序通过$H_0$读出,路径分叉通过投影载体上的持久$H_1$签名读出;$H_1$分量进入决策循环,在判别性情况下实现零路径切换,在其他情况下则按设计回退(附录A.12)。
- • **证据链**:对战略子目标涌现、四机制配置下的机制不变性、零标签Kitchen瓶颈充分性、布局扰动对偶性和跨体冻结迁移的因果验证;监控、恢复、执行器可插拔性和敏感性分析见附录A。

## 2 相关工作

##### 离线GCRL与分层子目标发现。
带有事后重标记的目标条件价值函数构成了离线目标到达的基础层(Schaul et al., 2015;Andrychowicz et al., 2017;Ghosh et al., 2019;Kostrikov et al., 2022;Pong et al., 2018;Ma et al., 2022;Eysenbach et al., 2022)。QRL和HIQL使用价值或潜在表示作为高层动作(Wang et al., 2023;Park et al., 2023);选项、管理器-工作者层次结构和技能先验方法提供了更广泛的时间抽象(Sutton et al., 1999;Bacon et al., 2017;Dayan & Hinton, 1992;Vezhnevets et al., 2017;Nachum et al., 2018;Levy et al., 2019;Hafner et al., 2022;Pertsch et al., 2020;Ajay et al., 2021;Lynch et al., 2019;Bagaria et al., 2021)。子目标发现有着悠久的历史:多样密度地标(McGovern & Barto, 2001)、访问统计瓶颈(Stolle & Precup, 2002)、图割分区(Menache et al., 2002)、相对新颖性事件(Şimşek & Barto, 2004)和学习的子目标树(Jurgenson et al., 2020)。这些工作确立了显式定位的中间状态有益于长时域控制;它们的子目标是通过发现智能体自身的访问、价值或策略来定义的,因此是执行器的属性。与它们不同,我们在任务层面定义子目标:每个成功执行器都必须遍历的一个阶段顺序,从部署者以外的执行器数据中恢复,并且在执行器替换下是可证伪的。在检测方面,经典瓶颈发现使用与目标无关的访问或转移统计,而我们从诱导的几何-拓扑表示中读取目标相对的瓶颈,并明确载体和可行路径。

##### RL中的几何、基于图和拓扑结构。
基于图的RL通过割、谱或最短路径图读取转移结构;最近的规划器使用关键点、拟度量或学习的子目标序列(Menache et al., 2002;Mahadevan & Maggioni, 2007;Machado et al., 2017;Savinov et al., 2018;Eysenbach et al., 2019;Zhang et al., 2021;Shah et al., 2023;Nasiriany et al., 2019;Hong et al., 2022;Baek et al., 2025;Kobanda et al., 2026;Choi et al., 2026;Ahn et al., 2025;Venugopal et al., 2026;Hyeon et al., 2026;Jawaid, 2026)。BGSS(Liang et al., 2026)是最相关的方法,通过与目标无关的扩散块和依赖预算的粒度实现了强大的AntMaze和Kitchen综合表现。与BGSS不同,我们读取目标相对的测地线径向场,并从其持久谱中选择门控;区别在于认证的是什么:每条可行路径都必须穿过瓶颈是分离性的陈述,因此拓扑是证书的本然语言,而非工具选择。

##### 跨体的规划、监控和迁移。
规划、语言条件、防护、恢复和扩散策略方法处理相邻的规划或执行层(Hansen et al., 2022;Janner et al., 2022;Ahn et al., 2022;Liang et al., 2023;Brohan et al., 2023;Kim et al., 2024;Alshiekh et al., 2018;Thananjeyan et al., 2021;Chow et al., 2018;Chi et al., 2023;Frans et al., 2025)。体迁移方法迁移策略、表示、对应关系或学习到的接口,通常需要自适应(Barreto et al., 2017;Gupta et al., 2017;Chen et al., 2018;Tobin et al., 2017;Peng et al., 2018;Yang et al., 2024;Wang et al., 2025;Liu et al., 2025;Wang et al., 2026;He et al., 2025)。与它们不同,我们冻结从某个体的离线数据中提取的瓶颈集,并在无自适应的情况下测试它,利用机制持久性来评估其任务级结构内容。

## 3 读取数据诱导的策略空间

我们从成功的离线轨迹构建数据诱导的载体,并为每个状态分配一个目标相对的测地坐标(3.1)。壳层度量剖面的持久同调读出检测持久瓶颈候选,并且,在

相似文章

拓扑引导

arXiv cs.LG

拓扑引导是一种新框架,利用拓扑数据分析捕获激活空间中的全局结构,以控制大型语言模型行为,实现更稳健的行为控制。

面向目标无关的偏微分方程联合嵌入预测控制

arXiv cs.LG

本文提出了一种面向偏微分方程的目标无关控制框架,采用联合嵌入预测架构(JEPA),并配备轻量级2D ViT编码器和动作条件潜在动力学。研究表明,使用学到的物理可观测探针在控制任务中优于原始潜在距离。