通用AI控制:迈向多用途自适应算法
摘要
提出了一种新颖的通用控制器,采用注意力机制和专家混合,使单个神经网络无需针对特定系统进行调优即可控制多种动态系统。在25个不同系统上,其性能与传统控制器相当。
arXiv:2607.16313v1 Announce Type: new
摘要:传统控制器是为特定系统设计的,无法在不同系统阶次和动态之间迁移。我们提出了一种通用控制器,一种基于学习的控制器,能够控制不同阶次和动态的系统。该方法引入了一种新颖的动态状态空间表示,使用带有掩码的注意力机制,使得单个经过一次性训练的神经网络能够处理不同维度的系统,而无需修改架构,只需为每个系统分配一个系统标签。我们从25个不同的系统中生成了314,630个演示,包括稳定、不稳定、最小相位和非最小相位动态,涵盖线性和非线性系统,从自主水下航行器和航空航天器到机械系统和化工过程。该模型通过多尺度时间处理和专家混合架构学习跨系统控制策略。仿真结果表明,所提出的通用控制器在所有测试系统上(包括非最小相位和不稳定动态等具有挑战性的情况)均达到了与特定系统的LQI控制器相当的性能,同时在未见过的工况下(包括执行器饱和、噪声、干扰以及训练中未遇到的目标轨迹)也能泛化。这项工作是在特定动态系统族中实现通用控制策略的重要一步,展示了使用单一学习策略无需针对特定系统调优即可有效控制一系列不同阶次和动态的单输入单输出(SISO)系统。
查看缓存全文
缓存时间: 2026/07/21 06:38
# 通用AI控制:迈向多用途自适应算法 来源:https://arxiv.org/html/2607.16313 Pouria Sarhadi 赫特福德郡大学物理、工程与计算机科学学院,Hatfield,英国(电子邮件:[email protected],[email protected]) ###### 摘要 传统控制器是为特定系统设计的,无法在不同系统阶次和动力学特性之间迁移。我们提出了一种通用控制器,这是一种基于学习的控制器,能够控制不同阶次和动力学特性的系统。该方法引入了一种新颖的动态状态空间表示,利用带有掩码的注意力机制,使得单个神经网络能够在一次训练后,通过为每个系统分配一个系统标签,处理不同维度的系统,而无需修改架构。我们从25个不同的系统生成了314,630个示范数据,包括稳定、不稳定、最小相位和非最小相位动力学,涵盖从自主水下航行器和航空航天器到机械系统和化学过程的线性和非线性系统。该模型通过多尺度时间处理和混合专家架构学习跨系统控制策略。仿真结果表明,所提出的通用控制器在所有测试系统上均能达到与特定系统LQI控制器相当的性能,包括非最小相位和不稳定动力学等具有挑战性的情况,同时能够泛化到训练中未遇到的操作条件,如执行器饱和、噪声、干扰和参考轨迹。这项工作朝着定义的一类动力学系统中的通用控制策略迈出了重要一步,展示了使用单一学习策略(无需特定系统调优)来控制一系列不同阶次和动力学的单输入单输出(SISO)系统的有效性。 ###### 关键词: 自主车辆,通用控制,自适应控制,多用途控制,LSTM 本文为发表在《Control Engineering Practice》上的文章接受稿。最终出版版本可查阅:https://doi.org/10.1016/j.conengprac.2026.106915。 © 2026 作者。本作品采用知识共享署名4.0国际许可协议授权:https://creativecommons.org/licenses/by/4.0/。 ## 1 引言 控制工程学科正处于一个转折点,传统的基于模型的设计范式正被数据驱动的方法所补充。经典控制方法论Mayne等人(2000 (https://arxiv.org/html/2607.16313#bib.bib15)); Astrom和Wittenmark (1994 (https://arxiv.org/html/2607.16313#bib.bib4)); Doyle (1996 (https://arxiv.org/html/2607.16313#bib.bib22))已在塑造我们日常生活的无数应用中证明了其有效性。 然而,这些方法需要精确的系统模型,并且每次部署都需要单独设计控制器。对于许多实际系统或动态特性表征较差的系统,获取和维护精确模型既困难又昂贵。这促使研究者使用基于学习的控制器,直接从示范中获取控制行为,而非依赖解析模型。虽然此类方法已相当成熟Pomerleau (1988 (https://arxiv.org/html/2607.16313#bib.bib17)); Mandlekar等人 (2021 (https://arxiv.org/html/2607.16313#bib.bib14)); Argall等人 (2009 (https://arxiv.org/html/2607.16313#bib.bib3)); Schaal (1999 (https://arxiv.org/html/2607.16313#bib.bib21)),但它们通常为每个系统训练单独的策略。我们提出了一种基于学习的通用控制器,这是一个单一的策略,在来自不同系统的示范上进行训练,无需逐系统调优。关键是,该框架与示范来源无关:它可以从基于模型的专家(如果存在精确模型)学习,也可以从人类遥操作和记录的操作数据学习,将这两种场景统一在一个可部署的策略下。 基础模型在人工智能领域的变革性影响引发了人们对其在控制系统中应用的极大兴趣。在自然语言处理领域,Brown等人 (2020 (https://arxiv.org/html/2607.16313#bib.bib9))等模型通过在海量文本语料库上进行预训练,展示了卓越的少样本泛化能力,并应用于自主车辆的高层决策制定Agyei等人 (2025a (https://arxiv.org/html/2607.16313#bib.bib1))。与我们领域最相关的是,机器人领域已经出现了专门针对具身智能的基础模型,这表明类似的范式可能会彻底改变控制理论本身。Octo Model Team等人 (2024 (https://arxiv.org/html/2607.16313#bib.bib16))是一个基于Transformer的策略,在来自不同机器人形态的80万条机器人轨迹上训练,证明了通过大规模预训练可以实现跨机器人泛化。在此之前,Reed等人 (2022 (https://arxiv.org/html/2607.16313#bib.bib18))提出的DeepMind多模态、多任务、多形态通用智能体,能够使用单一神经网络权重集控制多个机器人,同时执行语言任务和玩Atari游戏。Brohan等人 (2022 (https://arxiv.org/html/2607.16313#bib.bib8))和Zitkovich等人 (2023 (https://arxiv.org/html/2607.16313#bib.bib25))已实现了对新任务和环境的零样本泛化,通过视觉-语言-动作模型弥合了高级指令与低级控制之间的语义鸿沟。英伟达最近宣布的GR00T N1Bjorck等人 (2025 (https://arxiv.org/html/2607.16313#bib.bib6))代表了人形机器人的通用模型,它具有受人类认知启发的双系统架构,能够实现跨不同形态的通用推理和操作技能。 然而,这些模型从根本上是在感知-动作层面运作,而非解决底层的控制理论挑战。像Octo Model Team等人 (2024 (https://arxiv.org/html/2607.16313#bib.bib16))和Reed等人 (2022 (https://arxiv.org/html/2607.16313#bib.bib18))这类模型将控制策略与视觉表示联合学习,创建了纠缠的表示,其中控制决策可能与视觉特征相关联。这种视觉-运动耦合可能会带来一些根本性的限制。如果没有摄像头输入,这些模型可能效果不佳,使其不太适用于实际的控制问题。 与这些发展并行的是,模仿学习和行为克隆Pomerleau (1988 (https://arxiv.org/html/2607.16313#bib.bib17)); Bratko等人 (1995 (https://arxiv.org/html/2607.16313#bib.bib49)); Zare等人 (2024 (https://arxiv.org/html/2607.16313#bib.bib50))已成为从示范中获取控制策略的强大范式。这些方法相比基于模型的控制设计有几个优点:它们可以捕获难以解析推导的复杂控制策略,在部署时不需要显式的系统模型,并且可以利用现有的专家控制器或人类演示。然而,大多数模仿学习方法为每个系统训练单独的策略,未能利用不同动力学系统之间共享的结构。 本文介绍了通用控制器,这是一种学习型控制器,通过学习能够跨不同维度及动力学特性的系统迁移的控制策略,来解决这一根本性差距。与专注于任务级或感知级泛化的现有方法不同,所提出的通用控制器在控制理论层面运作,学习为不同阶次的系统跟踪参考信号。这种方法的关键洞察在于,在状态空间层面进行控制代表了一种在众多物理系统中高度可迁移的控制知识形式。虽然视觉特征在不同的机器人和环境中差异巨大,但动力学系统的基础数学是不变的。一个质量-弹簧-阻尼器系统,无论作为车辆悬架、建筑物隔震器还是微尺度MEMS器件实现,都表现出相同的二阶动力学。通过直接在状态空间中学习控制策略,我们捕获了这些超越特定形态或感官模态的基本动力学模式。该方法引入了多项技术创新以实现跨阶次泛化。我们开发了一种带有注意力掩码的动态状态空间表示,允许单个神经网络通过填充处理不同阶次的系统。通过多尺度时间处理和混合专家架构Shazeer等人 (2017 (https://arxiv.org/html/2607.16313#bib.bib32)),控制器学会识别和响应不同的动力学机制,从稳定的一阶响应到复杂的振荡行为。该通用控制器在来自25个不同系统的314,630个专家示范上进行训练,实现了与特定系统线性二次型积分(LQI)控制器相当的性能。虽然本研究更广泛的动机受到近期基础模型方法的启发,但当前研究的范围更为具体。在本文中,我们专注于SISO动力学系统。 这项工作的意义超越了传统控制领域的技术成就,更具体地说,超越了用于控制应用的模仿学习领域。通过证明控制知识在预训练系统家族内的不同系统动力学之间是可迁移的,并且不局限于单一类别的系统,我们实现了多系统控制策略,这些策略可能不需要逐系统重新调优。这代表了从为特定系统设计控制器的传统方法,向学习体现适用于整个系统类别的通用原理的控制器的范式转变。随着工业面临对灵活自动化、快速重构以及在各种操作条件下稳健性能日益增长的需求,通用控制器为传统设计方法提供了一种引人注目的替代方案。 在正式定义问题之前,我们澄清一下本文中使用的术语“通用”的含义。“通用”一词是出于实用意义使用的,与近期基于学习的机器人和基础模型文献一致,其中单个参数化策略在来自多个任务或系统的数据上进行训练Reed等人 (2022 (https://arxiv.org/html/2607.16313#bib.bib18)); Octo Model Team等人 (2024 (https://arxiv.org/html/2607.16313#bib.bib16))。将此概念适应到控制工程,我们将通用控制器定义为在多个动力学系统的示范上训练,并在部署时无需逐系统重新调优的单一控制策略。这项工作的新颖之处不在于引入新的学习范式,因为类似的想法早已在行为克隆(BC)和模仿学习(IL)中考虑过Pomerleau (1988 (https://arxiv.org/html/2607.16313#bib.bib17)); Bratko等人 (1995 (https://arxiv.org/html/2607.16313#bib.bib49)); Zare等人 (2024 (https://arxiv.org/html/2607.16313#bib.bib50))。相反,利用深度神经网络的最新进展,我们证明了单一策略可以有效地跨具有不同阶次和动力学特性的异构系统重用控制结构,而无需任何系统特定的调优。需要注意的是,控制器需要输入一个系统标签来指示正在控制哪个系统。它不能仅从观测中推断系统身份,也无法泛化到训练集中未包含的系统。这类似于人类适应行为,可以在训练后控制系统,并且在遇到不同系统时不会盲目开始。 本文的其余部分组织如下。第2节回顾了自适应、鲁棒和控制泛化方面的相关工作。第3节形式化了问题并定义了学习目标。第4节介绍了所提出的通用控制器架构。第5节描述了训练框架和数据生成。第6节报告了仿真和硬件结果,包括与经典LQI控制器的比较。第7节提供了消融研究,分析了关键架构组件的作用。第8节总结了论文并讨论了局限性和未来方向。 ## 2 相关工作 本节回顾了先前实现跨多系统控制的方法,涵盖经典的自适应和鲁棒控制、控制理论中的泛化方法以及近期基于学习的方法。我们突出了现有方法在处理不同阶次和动态特性的系统时的局限性,从而激发了我们的方法:从不同系统的示范中学习单一策略。 ### 2.1 经典自适应与鲁棒控制理论 经典自适应控制为处理不确定性提供了理论框架,但侧重于在固定系统结构内适应参数变化。模型参考自适应控制(MRAC)Ioannou和Fidan (2006 (https://arxiv.org/html/2607.16313#bib.bib13))调整控制器参数以匹配特定被控对象的参考模型行为。自校正调节器Astrom和Wittenmark (1994 (https://arxiv.org/html/2607.16313#bib.bib4))在线估计系统参数并相应地更新控制律。神经自适应控制Selmic和Lewis (2002 (https://arxiv.org/html/2607.16313#bib.bib45))将神经网络与基于Lyapunov的自适应律相结合。虽然这些方法对于参数不确定性有效,但它们假设已知的系统阶次和结构,当应用于具有不同动态特性的系统时需要重新设计。 鲁棒控制通过最坏情况设计来处理不确定性。H∞H\_\{\\infty\}控制Zhou等人 (1996 (https://arxiv.org/html/2607.16313#bib.bib46))最小化从干扰到输出的最坏情况增益。μ\\mu\-综合Doyle (1982 (https://arxiv.org/html/2607.16313#bib.bib11))处理结构化不确定性。虽然提供了强有力的理论保证,但鲁棒控制器是保守的,并且需要不确定性的界。最近关于基于学习的鲁棒控制的研究Berkenkamp等人 (2017 (https://arxiv.org/html/2607.16313#bib.bib5)); Richards等人 (2018 (https://arxiv.org/html/2607.16313#bib.bib19))结合了数据驱动方法和鲁棒控制理论,但仍局限于特定的系统类别。同时镇定Vidyasagar (2022 (https://arxiv.org/html/2607.16313#bib.bib47))代表了另一种有前景的方法,以解决传统控制器的可泛化性问题。其目标是综合一个能够镇定多个被控对象的单一控制器。然而,这些控制器仅限于具有特定结构特性的被控对象,例如具有相同数量的不稳定极点或满足奇偶交错条件。在实践中,这些理论限制也转化为大量的工程工作,因为经典的自适应和鲁棒控制器通常需要为每个新被控对象进行仔细的、特定于系统的建模、综合和调优。 这项工作通过学习一个跨具有不同结构和阶次系统运行的单一控制策略来解决这些限制。 ### 2.2 控制系统中的泛化 控制中的泛化挑战超越了参数不确定性,涵盖了结构变化、变化的目标和多样的操作条件。Koop
相似文章
面向AI控制的集成监控:多样信号胜于更多算力
本文提出用于AI控制的集成监控方法,结合多样化的监控器以改进对行为偏差的检测。实验表明,多样化的集成优于同质化集成,且微调后的监控器具备独特的检测能力。
Artificial Adaptive Intelligence:狭义与通用智能之间的缺失阶段
本文提出Artificial Adaptive Intelligence (AAI)作为狭义与通用AI之间的缺失中间阶段,认为自适应性(而非规模或通用性)是弥合这一差距的关键能力。
弱到强的泛化
OpenAI的Superalignment团队介绍了弱到强的泛化,这是一个新的研究方向,用于通过解决能力较弱的人类监督者如何可靠地控制和引导智能远超自身的AI系统这一根本性问题,来实证对齐超人类AI模型。
借助AI的表亲:储层计算解锁软体机器人控制
本文讨论了储层计算(一种简化的神经网络,常被称为AI的表亲)如何被应用于控制软体机器人,提供高效且自适应的控制方案。
用于具有不可观测记忆状态的欧拉-拉格朗日系统自适应控制的时序注意力
本文提出了一种利用时序自注意力进行元控制的架构,旨在对具有不可观测记忆状态的欧拉-拉格朗日系统进行自适应控制。在2自由度机械臂上的实验表明,该方法在追踪性能上优于基线方法,同时揭示了在长记忆机制下的失效模式。