非线性动态系统中的基于脉冲的信念传播

arXiv cs.AI 论文

摘要

本文提出了一种贝叶斯控制框架,将基于脉冲的动态与概率推断相结合,用于非线性动态系统的自适应控制,并使用一个脉冲神经网络模型在基准问题上进行了演示。

arXiv:2608.19907v1 Announce Type: new 摘要:本文提出了一种贝叶斯控制框架,将基于脉冲的动态与概率推断相结合,用于自适应控制。贝叶斯推断被广泛认为是大脑功能的核心计算原理,为不确定性下的感知、决策和学习提供了规范性框架。通过将一个受生物学启发的脉冲神经模型与贝叶斯推断原理相结合,我们提出了一种能够在不确定环境中操作的类脑控制算法。我们使用 mountain car parking problem 作为具有非线性动态的基准问题。我们的结果表明,所提出的控制器能够通过脉冲驱动动态实时更新状态并生成目标导向的行动计划。这些结果突显了所提出模型作为计算神经学和概率控制理论之间桥梁的潜力。
查看原文
查看缓存全文

缓存时间: 2026/08/21 10:10

# 非线性动力系统中的脉冲式信念传播
来源:https://arxiv.org/html/2608.19907

cev\[2\]\\fix@cev\#1\+\\m@th\#1\\fix@cev\#1−\\m@th\#1\#2\\fix@cev\#1\+→\\m@th\#1\\vec\{\\reflectbox\{$\\fix@cev\{\#1\}\{\-\}\\m@th\#1\#2\\fix@cev\{\#1\}\{\+\}$\}\}\\fix@cev\#1\- cev\[2\] \#22mu

Sepideh Adamiat OrcID:0009-0009-7269-1596 (https://orcid.org/0009-0009-7269-1596) Affiliation:电气工程系,埃因霍温理工大学,荷兰埃因霍温 Hongye Wang Affiliation:生物医学信号与系统组,电气工程、数学与计算机科学学院(EEMCS),特温特大学,荷兰恩斯赫德 Wouter M. Kouw OrcID:0000-0002-0547-4817 (https://orcid.org/0000-0002-0547-4817) Affiliation:电气工程系,埃因霍温理工大学,荷兰埃因霍温 Bert de Vries OrcID:0000-0003-0839-174X (https://orcid.org/0000-0003-0839-174X) Affiliation:电气工程系,埃因霍温理工大学,荷兰埃因霍温

###### 摘要

本文提出一个将脉冲式动力学与概率推断相结合的贝叶斯控制框架,用于自适应控制。贝叶斯推断被广泛视为大脑功能的核心计算原则,为在不确定环境下的感知、决策和学习提供了一种规范性框架。通过将受生物启发的脉冲神经模型与贝叶斯推断原理相结合,我们提出了一种能够在不确定环境中运行的类脑控制算法。我们使用具有非线性动力学的山地汽车泊车问题作为基准测试。结果表明,所提出的控制器能够通过脉冲驱动的动力学实时更新状态,并生成目标导向的行动方案。这些结果突显了该模型在计算神经科学与概率控制理论之间架起桥梁的潜力。

###### 关键词:

贝叶斯控制 信念传播 类脑计算 神经形态计算 脉冲神经网络 状态估计

## 1 引言

对人脑的建模仍然是现代科学的核心挑战,部分原因是生物智能的显著效率。人类以远低于现代人工系统的能量和数据进行学习和适应;例如,大脑运行功耗约为20瓦[1 (https://arxiv.org/html/2608.19907#bib.bib1)],而现代AI系统通常需要高出许多个数量级的计算资源。

计算神经科学已从详细的生物物理模拟发展为解释高级认知的理论框架。这些方法大致可分为自上而下和自下而上两类。自上而下的方法,如贝叶斯大脑假说[2 (https://arxiv.org/html/2608.19907#bib.bib2)]和自由能原理[3 (https://arxiv.org/html/2608.19907#bib.bib3)],提供了感知和决策的规范性解释,其中“规范性”指规定了理想智能体应如何在不确定性下进行最优推断和行动。然而,这些方法通常抽象掉了生物约束。自下而上的方法,包括脉冲神经网络(SNNs)[4 (https://arxiv.org/html/2608.19907#bib.bib4)],强调神经动力学和生物物理现实性。SNNs因其事件驱动计算而有望提高能效,即仅在产生脉冲时进行处理,从而实现稀疏通信和降低功耗,特别是在神经形态硬件上[5 (https://arxiv.org/html/2608.19907#bib.bib5)]。

近期的工作旨在通过开发将原则性推断与神经实现相结合的类脑算法来弥合这些视角[6 (https://arxiv.org/html/2608.19907#bib.bib6), 7 (https://arxiv.org/html/2608.19907#bib.bib7), 8 (https://arxiv.org/html/2608.19907#bib.bib8), 9 (https://arxiv.org/html/2608.19907#bib.bib9)]。本文遵循这一方向,将贝叶斯推断与脉冲神经网络相结合。

为了实现可扩展的推断,我们采用了因子图上的分布式消息传递形式[10 (https://arxiv.org/html/2608.19907#bib.bib10)],也称为信念传播(BP)。该方法将全局推断分解为局部计算,与神经系统的并行和去中心化组织相符。BP已应用于非线性控制和多智能体系统[11 (https://arxiv.org/html/2608.19907#bib.bib11), 12 (https://arxiv.org/html/2608.19907#bib.bib12), 13 (https://arxiv.org/html/2608.19907#bib.bib13)],并且非常适合事件驱动(反应式)实现[14 (https://arxiv.org/html/2608.19907#bib.bib14)]。

一些研究探索了在SNNs中实现BP[8 (https://arxiv.org/html/2608.19907#bib.bib8)]。文献[15 (https://arxiv.org/html/2608.19907#bib.bib15)]确立了BP与神经动力学模型之间的密切关系。然而,该工作仅限于马尔可夫随机场,这是因子图的一个子集。此外,所考虑的形式化方法专注于二值变量。Steimer等人[7 (https://arxiv.org/html/2608.19907#bib.bib7)]通过使用互连的液态机网络[16 (https://arxiv.org/html/2608.19907#bib.bib16)]在SNNs中实现了BP,从而扩展了这种方法。尽管如此,这些方法主要关注二值变量。

许多现实世界的推断和控制问题涉及连续值状态,如位置和速度,需要高斯信念表示。文献[17 (https://arxiv.org/html/2608.19907#bib.bib17)]引入了一个用于高斯BP的脉冲式框架,通过线性因子节点演示了信念更新,并实现了两个基本的贝叶斯推断问题:卡尔曼滤波和线性回归。然而,该框架仅限于线性运算,不支持多变量信念更新。

本文的主要贡献是:

1.  将脉冲式节点函数集成到事件驱动的BP框架中,能够实时进行状态估计和行动规划。
2.  针对山地汽车问题[18 (https://arxiv.org/html/2608.19907#bib.bib18)],提出了多变量和非线性信念更新的脉冲式消息传递实现。

所提出的框架成功地通过因子图上基于消息传递的推断解决了山地汽车问题,并朝着弥合因子图上概率推断的算法层面与通过脉冲神经动力学实现的层面迈出了具体一步。

## 2 问题陈述

山地汽车问题是控制理论和强化学习中的一个经典基准。该环境包括一辆位于两座山丘之间山谷中的汽车,旨在到达目标位置。图1 (https://arxiv.org/html/2608.19907#S2.F1)(左)展示了该环境的示意图,说明了山的轮廓和汽车的位置。本文使用文献[19 (https://arxiv.org/html/2608.19907#bib.bib19)]中引入的公式。

在这个问题中,假设车辆的发动机力量有限。图1 (https://arxiv.org/html/2608.19907#S2.F1)(右)展示了持续施加最大朝向目标力时的汽车轨迹。如图所示,由于功率不足,汽车无法到达目标位置。

图1:(左)山地汽车环境;(右)当智能体在每个时间步天真地施加最大向前发动机力时的汽车位置轨迹。橙色曲线显示了随时间变化的位置,而绿色虚线表示目标位置。此策略无法达到目标状态;参见第2节 (https://arxiv.org/html/2608.19907#S2)。要成功到达目标,控制策略必须首先将汽车驶向相反方向(朝向左侧山丘)以积累足够的动量。积累的动能随后可以推动汽车朝向右侧山丘,最终到达目标位置。

为了解决这个问题,我们遵循文献[11 (https://arxiv.org/html/2608.19907#bib.bib11)]提出的概率框架。我们考虑一个智能体,其内部状态定义为 st=[xt, xt ̇]s_{t}=[x_{t},\dot{x_{t}}],其中 xt x_{t} 和 xt ̇ \dot{x_{t}} 分别表示智能体在时间步 t 时的位置和速度。在每个时间步,智能体对环境施加一个动作 ut u_{t} 并接收到一个观测值 yt y_{t}。智能体维护对其内部状态、观测值和动作的概率信念,所有这些都被建模为高斯随机变量。

为了描述隐藏状态、观测值和动作之间的关系,我们采用了一个生成模型,该模型提供了观测值如何生成的概率描述。在本文中,生成模型中变量之间的概率依赖关系通过因子图以图形方式表示。生物智能体持续与其环境交换信息,并更新其模型的内部状态,以最小化关于感觉观测的预期惊讶[20 (https://arxiv.org/html/2608.19907#bib.bib20)]。

遵循这一框架,我们设计了一个合成智能体,该智能体根据传入的观测持续更新其关于隐藏状态和控制变量的信念,从而选择增加实现期望观测可能性的动作。这些信念更新是通过在生成模型的因子图表示上进行BP[21 (https://arxiv.org/html/2608.19907#bib.bib21)]来执行的。

这项工作的主要目标是弥合因子图上的BP与生物神经系统中观察到的脉冲式动力学之间的差距。BP算法执行的分布式局部计算促使人们将其研究作为神经信息处理和概率推断的合理模型[21 (https://arxiv.org/html/2608.19907#bib.bib21), 22 (https://arxiv.org/html/2608.19907#bib.bib22)]。特别是,我们的主要贡献是实现了一个在高斯信念上运行的非线性和多变量状态转移因子 p(s_t|s_{t-1}, u_t)p(s_{t}\mid s_{t-1},u_{t}) 的脉冲式实现。该因子反映了山地汽车环境的动力学,是BP过程中最具挑战性的组成部分之一。

因此,本文解决的主要问题是:

1.  信念参数的脉冲式表示(第3.5节 (https://arxiv.org/html/2608.19907#S3.SS5))。
2.  非线性和多变量状态转移因子的脉冲神经实现(第4.2节 (https://arxiv.org/html/2608.19907#S4.SS2))。
3.  将该神经因子集成到基于BP的推断框架中(第4.4节 (https://arxiv.org/html/2608.19907#S4.SS4))。

## 3 技术背景

本节介绍所提出模型所需的技术背景。第3.1节 (https://arxiv.org/html/2608.19907#S3.SS1)、3.2节 (https://arxiv.org/html/2608.19907#S3.SS2)、3.3节 (https://arxiv.org/html/2608.19907#S3.SS3) 分别描述概率表示、推断算法和控制算法。第3.4节 (https://arxiv.org/html/2608.19907#S3.SS4)、3.5节 (https://arxiv.org/html/2608.19907#S3.SS5)、3.6节 (https://arxiv.org/html/2608.19907#S3.SS6) 则介绍了神经动力学、信念在脉冲域中的编码和解码,以及使用脉冲神经元网络实现所需功能的方法。

### 3.1 基于因子图的模型表示

为了实现高效且可扩展的贝叶斯推断,我们采用了因子图表示,它表达了一个分解的概率模型,并支持通过局部消息(信念)传递进行推断。这种结构促进了模块化,并且与神经计算自然对齐,其中局部交互对应于消息交换。

我们使用Forney风格因子图(FFGs),其中边表示变量,节点表示因子[23 (https://arxiv.org/html/2608.19907#bib.bib23)]。由于每条边最多连接两个节点,因此引入了分支(相等)节点来建模出现在两个以上因子中的变量[24 (https://arxiv.org/html/2608.19907#bib.bib24)],从而为任何分解概率模型提供了图形表示。

考虑一个状态空间模型,

p(s_t, y_t, u_t, s_{t-1}) = \underbrace{p(y_t \mid s_t)}_{\text{观测}}\,\underbrace{p(s_t \mid s_{t-1}, u_t)}_{\text{状态转移}}\underbrace{p(u_t)p(s_{t-1})}_{\text{先验}},(1)
该模型描述了连续状态 s_{t-1} 和 s_t、输出 y_t 以及控制变量(动作)u_t 之间的关系。在时间步 t,选择了动作 u_t=\hat{u}_t 并观测到 y_t=\hat{y}_t 后,该模型的FFG表示如图2 (https://arxiv.org/html/2608.19907#S3.F2) 所示。

g = \delta(u_t - \hat{u}_t)
h = \delta(y_t - \hat{y}_t)
\mathcal{N}
p(s_{t-1})
s_{t}'
u_t
s_{t}''
y_t
s_t

图2:由公式(1) (https://arxiv.org/html/2608.19907#S3.E1) 定义的状态空间模型一个时间步的FFG表示,受 u_t=\hat{u}_t 和 y_t=\hat{y}_t 约束。此FFG包含四种类型的节点。数据节点(小黑框)表示对具有已知值的变量的δ约束。例如,具有测量值 \hat{y}_t 的观测变量 y_t 由因子 \delta(y_t - \hat{y}_t) 表示。高斯因子节点编码了由其均值和协方差参数化的高斯分布。相等(分支)节点强制连接变量之间的一致性,并支持贝叶斯信念更新。s_t 的相等节点由

f_=(s_t, s_t', s_t'') = \delta(s_t - s_t')\delta(s_t - s_t'').(2)
给出。此相等节点确保 s_t、s_t' 和 s_t'' 上的后验信念相同。

最后,节点 g 和 h 分别表示状态转移模型 p(s_t \mid s_{t-1}, u_t) 和观测模型 p(y_t|s_t)。

虽然FFG边本质上是无向的,但我们采用固定的方向约定,后来我们用它来指示图中消息传播的方向。

### 3.2 基于消息传递的推断

我们使用消息传递算法在FFG上执行推断。消息沿边传播并在连接的节点中局部更新。在本文中,我们采用和-积更新规则[21 (https://arxiv.org/html/2608.19907#bib.bib21)]。由于消息可以沿边双向传播,我们将沿指定边方向传播的消息称为*前向消息*,记为 \overrightarrow{\mu},而反向传播的消息称为*后向消息*,记为 \overleftarrow{\mu}。

在和-积消息传递中,对于一个通用因子节点 f(y, x_1,...,x_n),其传入消息为 \overrightarrow{\mu}_{x_i}(x_i),则传递给 y 的传出消息为[10 (https://arxiv.org/html/2608

相似文章

使用时间段模型进行预测和控制

OpenAI Blog

OpenAI 推出了一种使用深度生成模型在时间段上学习复杂非线性系统动力学的方法,能够实现稳定的长期预测和可微分的轨迹优化以进行基于模型的控制。