TopoExplore:面向存档探索的拓扑判别
摘要
TopoExplore 使用拓扑检测封闭区域来增强 Go-Explore,避免在密封区域浪费预算,在 MiniGrid 和 HM3D 环境中实现了加速。
arXiv:2607.09971v1 公告类型:新
摘要:基于存档的探索方法(如 Go-Explore)通过访问稀有度来选择返回哪个已访问状态,而前沿方法则返回未知区域的边界;但两者都没有询问边界后的未探索区域是否可进入。探索不仅仅是为了寻找奖励——更是为了收集结构完整的经验,以供后续学习和规划。我们提出了 TopoExplore,它在 Go-Explore 的格子选择中增加了周期性拓扑检测:通过洪泛填充(即立方复形的 H1 类)检测已访问集占据网格中的封闭未探索区域(空洞),并仅在其严格入口(间隙或门格子)处放置一个衰减的选择奖励,从而从不定位密封区域,并使已进入的区域退役。在受控的 18 个环境 MiniGrid 测试套件(15 个随机种子,固定超参数)中,TopoExplore 相对于精确的 Go-Explore 消融实验,在首次进入的中位步数上取得了 1.52 倍的几何平均加速,而前沿基线为 1.37 倍;当出现密封诱饵结构时,前沿探索性能下降(诱饵环境中为 0.83–1.48 倍,而 TopoExplore 为 1.65–2.11 倍),而 TopoExplore 在困难的多次交互门环境中取得了最大优势(10.9 倍)。我们报告了在蒙特祖玛的复仇上的客观负面结论——在没有墙体知识的情况下,不可达的占据伪影会捕获奖励,随着伪影增长性能下降,从而将需感知墙体的入口测试隔离为核心组件;以及在 HM3D 扫描建筑上的初步正面结果,其中相对于 Go-Explore 的加速与场景难度相关(r=0.69),即使前沿选择主导了无差别覆盖。证据支持一个明确界定的结论:在需要区分封闭结构的环境中,拓扑感知选择是有价值的,而在开放覆盖(前沿方法最强的领域)中仍具有竞争力,尽管并未针对该场景进行调优。
查看缓存全文
缓存时间: 2026/07/14 04:18
# 基于存档探索的拓扑区分方法:初步报告
来源: https://arxiv.org/html/2607.09971
\(2026 年 7 月 (v1 — 初步结果; 扩展评估后续进行)\)
###### 摘要
基于存档的探索方法(如 Go-Explore)通过访问稀有度选择返回哪个已访问状态,而机器人学中的前沿方法则返回未知区域的边界;两者均未询问边界之后未探索区域是否*根本可进入*。探索不仅仅是关于寻找奖励——它是关于为下游学习和规划收集结构完整的经验。我们提出 TopoExplore,该方法为 Go-Explore 的单元格选择附加了一个周期性拓扑扫描:通过泛洪填充检测已访问集占据栅格中封闭的未探索区域(*空洞*)——即二进制立方体复形的 H1 类——并仅在其*严格入口*(间隙或门单元格)上放置一个衰减的选择奖励,从而密封区域永远不会成为目标,已进入区域则退役。在一个受控的 18 环境 MiniGrid 套件上(15 个种子,固定超参数),TopoExplore 在其中位数首次进入步数上相对于其精确的 Go-Explore 消融实现了 1.52× 几何平均加速,而同一框架上的强前沿基线为 1.37×;关键的是,前沿探索在出现密封诱饵结构时*性能下降*(诱饵环境上 0.83–1.48× 对比 TopoExplore 的 1.65–2.11×),而 TopoExplore 在困难的多次交互门上取得了最大胜果(10.9×)。我们报告了关于 Montezuma's Revenge 的诚实负面结果——在没有墙壁知识的情况下,不可到达的占据伪影捕获了选择奖励,性能随着奖励增长而下降,从而将墙壁感知的入口测试隔离为使方法有效的关键组件——以及在 HM3D 扫描建筑上的初步正面结果,其中相对于 Go-Explore 的加速与场景难度相关(r=0.69),尽管前沿选择在全面覆盖上占据主导。证据支持一个审慎限定的主张:拓扑感知的选择在需要区分封闭结构时具有优势,并且在开放覆盖(前沿方法最强处)上仍具竞争力,尽管并非针对该场景调整。
## 1 引言
困难探索方法通过代理指标回答“*代理下一步应该去哪里?*”这个问题:基于计数和好奇心的方法偏好少访问或难预测的状态 [2, 15, 4];Go-Explore [10] 将已访问细胞存档并返回到访问不足的细胞;前沿探索 [19] 驱动代理到已知与未知空间的边界。所有这些方法都将未探索区域视为无差异的。真实环境并非无差异:建筑物包含门后的房间,废墟区域包含空洞,并且——关键的是——许多封闭区域是*密封的*:有墙的口袋、封闭的容器、重建伪影。一个无法区分可进入封闭空间与密封空间的探索者会将预算浪费在永远无法带来回报的边界上,并且当只有一个间隙细胞实际允许进入时,其注意力会分散在广阔的边缘上。
这种失败模式的重要性超越了基准探索:导航规划者消耗的映射图,其有用内容正是路径、障碍和房间,而一个明确发现*哪些封闭区域存在、哪些可进入、以及其入口在哪里*的探索机制,在探索过程中自然会产生这种结构。
TopoExplore 使这一区别明确化。它保留了 Go-Explore 的外循环(选择一个存档细胞,返回它,随机探索,记录新细胞)并增加了一个周期性的*拓扑扫描*:检测已访问集占据栅格中封闭的未探索区域,并在实际执行动作进入这些区域的细胞——即它们的*严格入口*——上放置一个选择奖励,奖励由未探索区域面积加权,并根据已尝试的向内动作次数衰减。这种构造有三个后果。密封区域没有入口,因此永远不会获得奖励。大边缘无法稀释信号,因为只有少数实际允许进入的细胞符合条件。一旦区域被进入,或其入口被耗尽,该区域便退役,再也不会成为目标。
#### 贡献.
1. 1.据我们所知,这是首个利用*已访问集*的拓扑结构——其持续同调——来决定*下一步探索何处*的方法。机器人学长期以来将拓扑用于导航,但那是问题的另一面:拓扑地图和 Voronoi 图组织已探索空间,同调感知的规划器选择*如何*在路径类之间达到目标 [9, 3];强化学习描述性地使用拓扑(§6)。将同调转化为探索决策引擎本身,开辟了我们认为是探索研究的一个有前景的方向。
2. 2.一种用于基于存档探索的拓扑感知选择规则,对二进制占据栅格精确且廉价(scipy 泛洪填充;运行时无 TDA 依赖),包含严格入口测试和退役机制(§2)。
3. 3.一个受控的 18 环境套件,独立变化诱饵数量、腔室几何、嵌套和门难度,具有真实拓扑,针对包括同一存档/返回框架上的前沿方法在内的六种基线(§3)。
4. 4.一个诚实报告的负面结果(Montezuma's Revenge),包含精确二进制仪器化的尸检,识别*为什么*该机制在没有墙壁知识的情况下失效(§4),以及在 HM3D 扫描建筑上的初步正面结果(§5)。
5. 5.一个我们认为该领域在评估结构化探索时应采纳的范围界定结果:在免费存档返回的情况下,前沿选择对于*全面覆盖*接近最优(在 HM3D 上相对于 Go-Explore 为 2.58×)——拓扑感知方法的有趣场景是*在密封结构下的区分*,此时前沿方法性能下降而 TopoExplore 不会。
## 2 方法
### 2.1 设置与外循环
我们采用 Go-Explore 探索阶段 [10]:一个存档将离散化细胞映射到快照;每次迭代以与分数成比例的概率选择一个细胞,恢复其快照,并在固定步数内随机探索,添加新看到的细胞。我们的细胞是网格上的位置(MiniGrid;[8])、RAM 位置瓦片(Atari;[1])或(地面,0.5m×0.5m)姿态箱(Habitat;[18]);观测从不用于存档键。选择分数是 Go-Explore 的 CellScore 加上一个额外项:
Score\(c\) = \(\sum_{a} \mathrm{Cnt}(c,a) + \sum_{n} \mathrm{Neigh}(c,n) + \mathrm{Topo}(c) + 1\), (1)
其中 \(\mathrm{Cnt}(c,a) = w_a (1/(v(c,a)+\varepsilon_1))^{1/2} + \varepsilon_2\), \(\mathrm{Topo}(c) = \mathrm{mag}(V_c) w_{\mathrm{topo}} (1/(n_{\mathrm{in}}(c)+\varepsilon_1))^{1/2}\), (2)
这里 \(\mathrm{Topo}(c)\) 仅当 \(c\) 是活动空洞 \(V_c\) 的严格入口时才存在,\(\mathrm{mag}\) 是空洞未探索的自由内部的面积,\(n_{\mathrm{in}}(c)\) 是从 \(c\) 已执行的向内动作计数。设置 \(w_{\mathrm{topo}}=0\) 可*精确*恢复 Go-Explore(相同代码路径):下面的每次比较都是严格的单项消融。
### 2.2 拓扑扫描
令 \(M\) 为布尔型已访问细胞掩码。一个*空洞*是 \(\lnot M\) 中不与网格边界接触的连通分量。对于二进制掩码,这种泛洪填充定义并非近似:将每个已访问细胞视为粘合到其邻居的填充正方形,将 \(M\) 转化为一个形状(其*立方体复形*),而封闭的未访问分量正好是该形状的 H1 类——它的孔;我们在单元测试中通过与 GUDHI 立方体持续实现[13]验证一致性,并在所有实验中使用 scipy 泛洪填充。每个空洞记录其内部细胞、其边缘(与内部相邻的已访问细胞)及其面积。空洞在每个扫描中从头重新检测,因此我们通过内部重叠(IoU)将其与上一次扫描匹配;因此空洞在地图增长时保持稳定身份,一旦退役便保持退役。
### 2.3 严格入口与退役
在大边缘上,只有那些动作*实际进入*空洞的细胞获得奖励:细胞 \(c\) 是严格入口当且仅当它 4-邻接到一个未访问的*自由*(非墙)内部细胞,或邻接到空洞的门细胞。面向墙的动作从不合格。因此 (a) 密封空洞(实心环,无门)没有入口,从不成目标;(b) 奖励集中在间隙细胞上,而不是分散在边缘上;(c) \(n_{\mathrm{in}}\) 衰减在向内动作被消耗后使入口退役。墙壁/门知识在 MiniGrid 中来自环境的占据真实数据,在 Habitat 中来自导航网格;在 Atari RAM 中确实不可用——§4 显示正是这个缺失的组件导致方法失效,我们认为这证明了该机制(而非某些副作用)驱动了收益。
## 3 受控套件 (MiniGrid)
参见说明图 1: 18 个主要评估环境:一个可进入腔室(绿色,间隙或门入口)位于密封诱饵(橙色,实心环)之间,变化诱饵数量、腔室形状、嵌套深度和门交互次数。
#### 协议.
TopoExplore 的预设配置(\(w_{\mathrm{topo}}=100\),面积幅度,严格入口)是在保留的扫参数上选择并随后*固定*的;下面所有数字均使用此未修改配置。15 个种子,1.2M 步预算;指标:首次进入可进入腔室的中位步数。基线共享记录器;Go-Explore、前沿(在前沿细胞上均匀)和最近前沿共享相同的存档/返回框架,仅在选择上不同;计数奖励和 RND-贪婪是仅信号控制器;PPO+RND 和 PPO+ICM 是带有内在奖励的学习策略(附录 A1)。
表 1: 相对于 Go-Explore 消融的中位首次进入步数加速比(>1 有利于该方法;“—”表示在预算内从未进入;15 个种子)。每行加粗表示最佳的存档/返回方法。前沿在出现诱饵时*性能下降*(诱饵 1–5)以及在困难门(尝试 3–5)上;TopoExplore 在两个场景中都保持优势。
#### 发现.
(表 1.)(1) 区分是获胜条件。在每个具有 ≥1 个密封诱饵的环境中,TopoExplore 击败前沿(一个诱饵时 2.11 vs. 0.83;五个诱饵时 1.89 vs. 1.32);在没有诱饵的对照中,前沿获胜(1.47 vs. 1.18)。该机制在前沿基线本身可见:未访问的墙壁细胞与未探索空间无法区分,因此密封边缘是*永久前沿*,永远不会消除。(2) 入口持久性在困难门上很重要。需要三次交互的门产生了 TopoExplore 相对于前沿的最大胜果(10.9 vs. 2.1);仅信号基线从未进入。(3) 学习策略掌控顺序瓶颈。PPO+RND 在嵌套、同心门布局中占主导(高达 4.4×)——学习策略的持久性,而非选择,在那里是合适的工具;我们报告这一点而不是调整掉。(4) 优势对几何敏感。圆形腔室(在此分辨率下间隙/边缘比例差)是真正的损失(0.55);我们在 §7 中讨论分辨率耦合问题。
## 4 一个诚实的负面结果:Montezuma's Revenge
参见说明图 2: Montezuma 管线:ALE 帧;领域通用的降采样存档键 [10];每个房间的 RAM 瓦片占据网格,拓扑扫描在其上运行。注意封闭的未访问口袋:有些是真正的未探索空间,其他是不可到达的屏幕伪影——而 RAM 没有提供墙壁掩码来区分它们。我们将扫描移植到 Go-Explore-Atari(降采样图像存档键,ALE 快照恢复),方法是在每个房间的 RAM 位置占据网格上运行泛洪填充。严格入口测试*无法*移植:RAM 没有提供墙壁掩码,因此提名了整个空洞边缘,并通过选择计数进行衰减。我们报告在 3000 万帧(种子 0;存档循环位精确可重现,通过仪器化重新运行验证)下的完整权重扫描:
Go-Explore w=0.3 w=1 w=10 w=100 PPO+RND PPO+ICM
找到房间数 19 18 13 16 8 11
平均每房间覆盖率 0.92 0.90 0.75 0.94 0.61 ——
没有权重优于消融;损害随权重增长。瓦片级尸检解释了原因:每次运行的占据包含约 5–6 个*从未*消除的空洞——不可到达的屏幕伪影——在 w=100 时,这些空洞作为永久吸引子捕获了 94% 的选择。失败并非因为空洞不存在或它们无法消除(Go-Explore 在 1000 万帧时消除了其活动空洞中的 10/15);而是因为*无法消除的*空洞在没有墙壁知识的情况下无法退役。这隔离了严格入口测试作为承重组件,并预测了 §5 的设计。
## 5 初步结果:HM3D 扫描建筑
参见说明图 3: HM3D minival 场景的运行器栅格化视图(导航网格掩码的主楼层带)。左对:随机游走即可饱和的小型扫描,所有方法持平;右对:复杂的多房间扫描,TopoExplore 获胜(1.28×, 1.40×)。在 habitat-sim 中,在 HM3D 扫描建筑 [16] 上,我们恢复了缺失的组件:导航网格是真实的墙壁掩码,因此严格入口可以移植(边缘细胞在且仅当邻接一个*可导航*的未访问空洞细胞时合格),并且密封的重建伪影从不成目标。在 10 场景 minival 分割上(10 个种子,400k 步,生成和指标限制在最大的导航网格岛屿):TopoExplore 达到 95% 覆盖率的速度比 Go-Explore 快 1.12×(几何平均),每场景加速比与该场景的饱和难度相关(r=0.69 相对于 1 - AUC_{Go-Explore};最大胜果 1.40× 在最难场景上),并且选择痕迹是精确的(1–2% 的选择受拓扑影响;入口在房间被进入后退役)。
#### 范围界定结果:前沿拥有全面覆盖。
在同一框架上的前沿基线(在前沿细胞上均匀,具有相同的导航网格信息)达到 95% 覆盖率的速度比 Go-Explore 快 2.58×——在每个场景上都击败了 Go-Explore 和 TopoExplore。在免费存档返回和已知可导航性的情况下,“总是跳到未知边界”是接近最优的贪心*覆盖*,而全面覆盖不包含区分问题:HM3D 扫描很少有足够大的密封封闭区域看起来可到达以至于能欺骗一个了解导航网格的前沿。相似文章
EXPLORE: 使用语言模型进行模拟拓扑生成的引导式搜索探索
本文提出了EXPLORE,一个将模拟器引导的蒙特卡洛树搜索与基于Transformer的解码相结合的框架,用于模拟拓扑生成,在6组件基准测试中实现了65%的成功率,显著优于一次性生成和采样-过滤基线。
基于拓扑感知排序的图Mamba生存分析
本文提出TopoMamSurv,一种用于全切片图像生存分析的图Mamba框架,采用拓扑感知排序解决Mamba对输入顺序的敏感性问题,并融合双向Mamba和图卷积网络(GCN)实现空间上下文建模。
TopoPrimer:预测模型中缺失的拓扑结构上下文
TopoPrimer 是一个框架,通过将全局拓扑结构集成到现有模型中,提升了预测准确度,在诸如季节性峰值和冷启动等具有挑战性的场景中显示出显著提升。
TopoTuner: 大型语言模型的拓扑微调
介绍TopoTuner,一种拓扑引导的微调框架,通过持续图之间的Wasserstein距离测量拓扑漂移,从而选择性冻结注意力投影矩阵。该框架在仅训练1-2%参数的情况下,性能与全微调相当,并在大多数设置中优于LoRA。
Topolines
Topolines 是一个用于生成拓扑轮廓的工具。