基于局部线性嵌入和自适应特征融合的结构化表示学习
摘要
提出了一种强化学习框架,利用局部线性嵌入捕捉环境动态,并通过注意力机制自适应融合动态特定特征和奖励特定特征,受神经科学原理启发,提高了学习效率。
arXiv:2606.18469v1 公告类型:新
摘要:神经科学研究表明,大脑通过利用结构化、低维流形,并通过自适应门控机制动态融合多种信息来源来编码复杂行为。受这些原理启发,我们提出了一种新颖的强化学习(RL)框架,鼓励解耦动态特定特征和奖励特定特征,直接类比神经回路如何分离和整合信息以进行高效决策。我们的方法利用局部线性嵌入(LLEs)来捕捉许多环境固有的内在局部线性结构,模仿神经群体活动中观察到的局部平滑性,同时通过标准RL目标推导出奖励特定特征。一种类似于皮层门控的注意力机制,在每个状态基础上自适应地融合这些互补表示。在基准任务上的实验结果表明,我们的方法基于神经科学原理,相比传统RL方法提高了学习效率和整体性能,凸显了显式建模局部状态结构和自适应特征选择(如生物系统中观察到的那样)的优势。
查看缓存全文
缓存时间: 2026/06/18 05:43
# 基于局部线性嵌入与自适应特征融合的结构化表示学习 来源:https://arxiv.org/html/2606.18469 Somjit Nath([email protected]) 麦吉尔大学电气与计算机工程系 Mila – 魁北克人工智能研究所 Jackson J Cone([email protected]) 卡尔加里大学心理学系 生物医学工程系 加拿大计算行为神经科学二级研究主席 Derek Nowrouzezahrai([email protected]) 麦吉尔大学电气与计算机工程系 Mila – 魁北克人工智能研究所 加拿大CIFAR人工智能主席 Samira Ebrahimi Kahou([email protected]) 卡尔加里大学Schulich工程学院电气与软件工程系 Mila – 魁北克人工智能研究所 加拿大CIFAR人工智能主席 ###### 摘要 神经科学研究表明,大脑通过利用结构化低维流形以及通过自适应门控机制动态融合多源信息来编码复杂行为。受这些原理启发,我们提出了一种新的强化学习(RL)框架,该框架鼓励动力学特定特征与奖励特定特征的解耦,这与神经回路如何分离和整合信息以进行高效决策直接相似。我们的方法利用局部线性嵌入(LLE)来捕捉许多环境中固有的局部线性结构——反映了神经群体活动中观察到的局部平滑性——同时通过标准RL目标推导出奖励特定特征。一种类似于皮层门控的注意力机制,在逐状态基础上自适应地融合这些互补表示。在基准任务上的实验结果表明,我们的方法以神经科学原理为基础,相比传统RL方法提高了学习效率和整体性能,突显了显式建模局部状态结构以及生物系统中观察到的自适应特征选择的益处。 ## 1 引言 强化学习(RL)在游戏(Mnih等人,2015(https://arxiv.org/html/2606.18469#bib.bib1);Silver等人,2017(https://arxiv.org/html/2606.18469#bib.bib2))和机器人控制(Yuan等人,2025(https://arxiv.org/html/2606.18469#bib.bib17);Tang等人,2024(https://arxiv.org/html/2606.18469#bib.bib18);Sun等人,2021(https://arxiv.org/html/2606.18469#bib.bib19))等领域取得了显著成功。尽管取得了这些成就,RL中长期存在的挑战之一是开发不仅支持奖励最大化,而且还能忠实捕捉环境潜在动态的状态表示。许多传统方法优化一个整合了这两个方面的单一目标,通常导致表示主要调整到即时奖励信号,而可能忽略控制状态转换的内在结构(Mnih等人,2015(https://arxiv.org/html/2606.18469#bib.bib1);Schulman等人,2017(https://arxiv.org/html/2606.18469#bib.bib21);Haarnoja等人,2018(https://arxiv.org/html/2606.18469#bib.bib15))。 一个有前景的替代方案是使用无监督表示学习技术来增强RL框架(Jaderberg等人,2016(https://arxiv.org/html/2606.18469#bib.bib20))。在我们实验重点关注的模拟机器人领域,状态转换由底层物理原理支配,这意味着状态之间的移动表现出可预测且定义明确的局部关系。局部线性嵌入(LLE)(Roweis and Saul, 2000(https://arxiv.org/html/2606.18469#bib.bib4))是一种成熟的技术,用于保留局部邻域结构,并已广泛应用于降维和流形学习(Tenenbaum等人,2000(https://arxiv.org/html/2606.18469#bib.bib5);Belkin and Niyogi, 2003(https://arxiv.org/html/2606.18469#bib.bib6))。然而,其在RL背景下将状态表示分解为动力学特定特征的潜力尚未得到充分探索。 在本文中,我们提出了一种用于RL的双表示框架,该框架利用LLE显式提取动力学特定特征,同时通过传统RL目标并行学习奖励特定特征。通过鼓励这两个方面的解耦,我们的方法使代理能够形成更全面的环境内部模型,这种能力在我们研究的模拟机器人领域中特别有益。为了有效结合这些互补表示,我们使用了一种自注意力机制(Vaswani等人,2017(https://arxiv.org/html/2606.18469#bib.bib7))。该机制在逐状态基础上动态评估通过LLE提取的动力学特定特征与从RL目标中学到的奖励特定特征的相对重要性。此外,注意力权重可以可视化为注意力图,作为一种诊断工具,揭示代理在哪些状态下更依赖哪一组特征。这些可视化对于理解RL代理在复杂模拟环境中的决策过程非常宝贵。从神经科学的角度来看,这种双表示设计并非随意。动力学特定分支通过LLE捕捉局部线性结构,扮演了专用动力学流形的角色,类似于编码平滑低维神经活动轨迹的运动皮层和联合皮层。同时,奖励特定分支反映了对奖励敏感的回路(例如,多巴胺能通路和基底神经节),这些回路追踪任务结果和价值。基于注意力的融合模块则充当皮层门控机制,动态组合这些信息流,密切反映了大脑在决策过程中如何有选择性地路由和整合来自专门子系统的信息。 因此,我们的架构选择不仅出于工程便利的动机,而且明确与生物系统如何组织和组合动力学特定及奖励特定信息的方式一致。神经科学研究表明,大脑在群体活动的低维流形中调节运动、导航、决策和认知等复杂功能,其中神经状态之间的局部关系得以保留并随时间调整(Sabatini and Kaufman, 2024(https://arxiv.org/html/2606.18469#bib.bib34);Gallego等人,2018(https://arxiv.org/html/2606.18469#bib.bib36);Langdon等人,2023(https://arxiv.org/html/2606.18469#bib.bib41))。此外,大脑采用上下文敏感的门控和注意力机制——由前额叶皮层介导——以选择性放大相关特征并灵活整合多个信息流(Martinez-Trujillo, 2022(https://arxiv.org/html/2606.18469#bib.bib43);Bichot等人,2015(https://arxiv.org/html/2606.18469#bib.bib42))。这些见解推动了开发不仅最大化奖励而且显式捕捉环境潜在动态和结构的RL代理,如同其生物对应物一样。 传统RL方法常常混淆奖励驱动和动力学特定信息,导致可能忽略控制状态转换的内在结构的表示(Mnih等人,2015(https://arxiv.org/html/2606.18469#bib.bib1);Schulman等人,2017(https://arxiv.org/html/2606.18469#bib.bib21);Haarnoja等人,2018(https://arxiv.org/html/2606.18469#bib.bib15))。相比之下,大脑维护着用于表示环境动态、强化和认知的专门子系统,允许更灵活和鲁棒的学习。受此启发,我们提出了一个双表示框架,试图解耦这两个方面,利用LLE——一种保留局部几何关系的技术,类似于神经群体活动中观察到的局部平滑性——并通过类似于皮层门控的注意力机制与奖励特定特征融合。通过将我们的方法建立在神经科学原理之上,我们旨在赋予RL代理形成结构化和适应性内部模型的能力。我们在物理定律强制可预测状态转换的模拟机器人领域的实验表明,这种受生物学启发的特征分离和自适应融合导致了学习效率和整体性能的提升。 我们在各种模拟机器人任务上的实验评估表明,我们的框架不仅相比传统RL方法提高了学习效率,还增强了整体性能。从注意力图中获得的见解进一步表明,所提出的方法在动态和奖励表示之间提供了有用的平衡,能够灵活适应任务不同阶段的需求。 本文的其余部分组织如下。第2节(https://arxiv.org/html/2606.18469#S2)回顾了RL中状态表示学习的相关工作,并讨论了LLE等无监督方法。第3节(https://arxiv.org/html/2606.18469#S3)详细介绍了我们提出的框架及相关的训练流程。在第4节(https://arxiv.org/html/2606.18469#S4)中,我们展示了实验结果,第5节(https://arxiv.org/html/2606.18469#S5)总结了本文,并讨论了我们的发现和未来研究方向。 ## 2 相关工作 ##### 流形学习。 流形学习技术——包括局部线性嵌入(Roweis and Saul, 2000(https://arxiv.org/html/2606.18469#bib.bib4))及其变体(Ghojogh等人,2020(https://arxiv.org/html/2606.18469#bib.bib25))——已广泛用于静态数据集的降维和可视化。这些方法在假设高维数据位于低维流形上的前提下,擅长保留局部邻域结构。然而,由于动态状态分布和非平稳目标,在在线RL环境中直接应用此类技术具有挑战性。我们的工作通过纳入自适应更新机制(具有动态损失阈值和窗口大小考虑)来扩展局部线性性的思想,以从RL轨迹中提取鲁棒特征。我们将LLE特征集成到策略学习流程中,并通过自注意力与奖励驱动特征融合,从而实现更灵活和可解释的表示。 与此相关,有几种方法显式建模环境结构以支持泛化和决策。例如,rSLDS(Glaser等人,2020(https://arxiv.org/html/2606.18469#bib.bib52))用潜在离散状态建模切换线性动态机制;DeepSynth(Hasanbeig等人,2021(https://arxiv.org/html/2606.18469#bib.bib53))将结构编码在指导RL的离散自动机中;SWMPO(Cano等人,2025(https://arxiv.org/html/2606.18469#bib.bib54))构建了一个显式表示动态结构的神经符号世界模型。相比之下,我们的方法不推断离散机制、合成自动机或学习显式世界模型;相反,它提供了一个轻量级的*表示级归纳偏置*,在嵌入中保留局部邻域几何(通过LLE),并通过自适应融合与奖励驱动特征结合。这种视角与显式结构学习方法互补,并有可能与之结合。 ##### 注意力机制。 注意力已成为深度学习中的强大工具,应用范围从自然语言处理到计算机视觉。在RL中,早期的尝试如工作表明,自监督注意力可以通过突出任务相关特征来提高任务性能。较新的方法,例如用于表格学习的自强化注意力机制(Amekoe等人,2023(https://arxiv.org/html/2606.18469#bib.bib27)),试图纳入注意力以促进结构化数据的可解释性。我们的方法利用自注意力不仅是为了重新加权特征,而是为了在两个不同的表示之间执行学习到的融合:捕捉局部几何的无监督嵌入和奖励特定特征。这种显式分离及随后的自适应融合,将我们的方法与在单一网络架构内编码注意力的方法区分开来,并提供了改进的性能。 ##### 辅助损失和解耦表示学习。 辅助损失在RL中的有效性已在最近的工作中得到证明,这些工作自动搜索或手动设计额外的目标以提高表示质量(Lange等人,2024(https://arxiv.org/html/2606.18469#bib.bib29))。 自监督学习(SSL)和对比方法显著推进了表示学习,特别是在依赖高维感官输入(如图像)的RL任务中。诸如对比无监督表示用于强化学习(CURL)(Srinivas等人,2020(https://arxiv.org/html/2606.18469#bib.bib23))、无监督视觉表示学习的动量对比(MoCo)(He等人,2020(https://arxiv.org/html/2606.18469#bib.bib28))和视觉表示对比学习的简单框架(SimCLR)(Chen等人,2020(https://arxiv.org/html/2606.18469#bib.bib30))等技术利用对比学习来增强特征区分性,确保相似状态的表示被拉近,而不同状态的表示被推远。类似地,数据增强方法如数据正则化Q学习(DrQ)(Kostrikov等人,2021(https://arxiv.org/html/2606.18469#bib.bib33);Yarats等人,2021(https://arxiv.org/html/2606.18469#bib.bib32))和增强数据强化学习(RAD)(Laskin等人,2020(https://arxiv.org/html/2606.18469#bib.bib31))将变换应用于原始视觉输入,提高了样本效率和鲁棒性。对比动力学聚焦方法如深度双模拟控制(DBC)(Zhang等人,2021(https://arxiv.org/html/2606.18469#bib.bib51))试图强制跨转换的不变性,但这些方法对状态空间的精确局部几何结构仍不可知。 然而,这些方法主要针对基于图像的RL设计,其中原始像素必须被处理为有意义的状态表示。在状态表示已经表现出内在结构的环境中,例如基于物理的机器人任务,表示学习不需要从头开始推断结构,而是可以利用状态空间中存在的固有局部关系。我们的方法通过利用LLE(一种旨在保留局部几何一致性的技术)来利用这一点。我们的方法不依赖于增强或对比目标,而是将表示学习建立在底层系统动态之上,确保学习到的嵌入保持对控制状态转换的物理原理的忠实性。 此外,虽然基于对比的SSL方法需要大量负采样或数据增强来形成有意义的潜在空间,但我们的LLE方法直接从状态空间中的局部邻域信息构建表示。这消除了显式增强的需要,而是允许表示自然地反映潜在的转换动态。此外,通过注意力机制将LLE与奖励驱动特征集成,我们的模型在训练的不同阶段动态优先考虑状态的最相关方面。这种自适应性确保了代理在探索和利用之间保持适当平衡。
相似文章
基于层的联邦表示学习
本文介绍了基于层的联邦表示学习(SFRL),这是一个通过可学习的层限制映射和二次粘合正则化器来对齐异构局部表示的框架,无需假设共享的全局潜在空间。提出了一种具有收敛保证的分散式算法(Sheaf-FRL),并证明其在与数据异构和模型异构下的协作分类中优于基线方法。
表示学习助力可扩展多任务深度强化学习
本文认为,表示学习(而非基于模型的规划)是可扩展多任务深度强化学习的关键。文章介绍了MR.Q,一种简单的无模型算法,通过辅助预测目标,在多种连续控制任务上优于之前基于世界模型的方法。
RL^2-VLA:面向视觉-语言-动作模型的自适应强化学习潜在组合引导与测试时缩放
本文介绍了RL^2,一种用于视觉-语言-动作模型的自适应推理时引导框架,它利用潜在表示上的离线强化学习来组合动作流,并且仅在预测到失败时激活引导。在SIMPLER和PolaRiS基准上,它实现了最高+17.3%的成功率提升,并展示了真实世界的迁移能力。
利用局部动态规律实现离线分层强化学习中的可复用技能
本文介绍了CARL,一种利用局部动态规律学习可复用技能的离线分层强化学习方法。该方法将需要相似动作序列的状态-目标对进行聚类,从而实现更有效的技能复用,并在复杂的人形机器人任务上提升了性能。
FedQHD:闭式函数空间联邦强化学习
本文提出FedQHD,一种新颖的联邦Q学习方法,使用超维随机特征状态编码器和线性读出器实现闭式函数空间聚合,解决了异构客户端编码器导致的联邦差距。