反射布朗运动平稳分布的深度学习方法

arXiv cs.LG 论文

摘要

本文提出一种深度学习方法,利用基本伴随关系学习高维反射布朗运动(RBM)平稳分布的拉普拉斯变换。该方法在无法获得解析解的高维场景下展现出近乎完美的预测能力。

arXiv:2607.08091v1 公告类型:新发布 摘要:反射布朗运动(RBM)的平稳分布在高维随机系统分析中扮演重要角色,但其闭式解仅在少数特殊情形下已知。计算尾部概率等重要性能指标更为棘手,尽管这些指标具有实际应用价值。本文开发了一种深度学习方法,基于基本伴随关系(BAR)准确且高效地学习高维RBM的拉普拉斯变换。我们的框架结合了精心设计的损失函数、训练数据采样流程及神经网络架构。我们使用已知真实尾部概率的RBM实例评估所提方法,在髙维设臵中展现出近乎完美的预测能力,凸显其作为分析超越解析可处理范围的随机系统通用工具的潜力。代码见 https://github.com/zhangz73/NN4MGF。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:18

# 反射布朗运动平稳分布的深度学习方法
来源:https://arxiv.org/html/2607.08091
张展浩 运筹学与信息工程系,康奈尔大学,zz564@cornell\.edu

###### 摘要

反射布朗运动(RBM)的平稳分布在高维随机系统分析中起着重要作用,然而其封闭形式解仅在少数特殊情况下已知。计算诸如尾部概率等重要性能指标更是棘手,尽管它们具有实际意义。在本文中,我们开发了一种深度学习方法,基于基本伴随关系(BAR)精确且高效地学习高维RBM的拉普拉斯变换。我们的框架结合了精心设计的损失函数、训练数据采样流程和神经网络架构。我们在已知真实尾部概率的RBM实例上评估了所提出的方法,并展示了在高维设置下的近乎完美预测,突显了其作为分析超出解析可处理范围的随机系统的通用工具的潜力。我们的代码可在 https://github.com/zhangz73/NN4MGF 找到。

## 1 引言

反射布朗运动(RBM)在多类队列网络分析中扮演着重要角色,它通常作为重流量下的扩散近似出现。在这种情况下,RBM的平稳分布为基础队列网络的稳态行为提供了有用的近似。平稳分布的封闭形式表达式仅对少数特殊类别的RBM已知。本文开发了一种可扩展的深度学习方法,用于计算高维RBM平稳分布的拉普拉斯变换。计算得到的拉普拉斯变换可用于估计尾部概率,这些尾部概率是重要的性能指标,例如队列网络的尾部延迟。

我们考虑一个与数据 \( \Sigma, \mu, R \) 相关联的 \( d \) 维 RBM \( Z = \{Z(t), t \geq 0\} \),它满足以下方程:

\[
Z(t) = Z(0) + X(t) + R Y(t), \qquad t \geq 0,
\]
其中 \( X = \{X(t), t \geq 0\} \) 是一个 \( d \) 维布朗运动,具有协方差矩阵 \( \Sigma \) 和漂移 \( \mu \),
\[
Y(0) = 0, \quad Y(\cdot) \text{ 是非递减的},
\]
\[
\int_0^{\infty} Z_k(t) dY_k(t) = 0, \qquad k = 1, \dots, d.
\]
\( d \times d \) 矩阵 \( R \) 称为反射矩阵。我们假设 RBM 是良好定义的且具有唯一的平稳分布 \( \pi \),例如当 \( R \) 是 \( M \)-矩阵且 \( R^{-1} \mu < 0 \) 时满足(Harrison-Williams 1987)。定义 \( Z \) 在稳态下的拉普拉斯变换为

\[
\varphi_0(\theta) = \mathbb{E}_\pi \left[ e^{\langle -\theta, Z(0) \rangle} \right], \qquad \theta \in \mathbb{R}^d_+
\]
\[
\varphi_k(\theta) = \mathbb{E}_\pi \left[ \int_0^1 e^{\langle -\theta, Z(t) \rangle} dY_k(t) \right], \qquad k = 1, \dots, d,
\]
其中 \( Z(0) \) 服从平稳分布 \( \pi \)。文献[12]的引理1表明,拉普拉斯变换 \( \varphi \) 和 \( \varphi_k \) 由基本伴随关系(BAR)的拉普拉斯版本唯一刻画:

\[
\gamma_0(\theta) \varphi_0(\theta) = \sum_{k=1}^d \gamma_k(\theta) \varphi_k(\theta), \tag{1}
\]
其中 \( \gamma_0(\theta) = -\frac{1}{2} \langle \theta, \Sigma \theta \rangle + \langle \mu, \theta \rangle \) 且 \( \gamma_k(\theta) = -\langle R^{(k)}, \theta \rangle \)。这里,\( R^{(k)} \) 表示 \( R \) 的第 \( k \) 列。在文献[12]中,作者证明了拉普拉斯版本的 BAR (1) 等价于最初由 Harrison-Williams (1987) 提出的 PDE 版本的 BAR。

与文献[8]相比,该文献开发了一种高效估计高维RBM稳态期望的方法,我们的工作针对的是其平稳分布的拉普拉斯变换。由于拉普拉斯变换可以通过数值反演恢复尾部概率,更广泛地说,恢复完整的平稳分布[2],因此它提供了对系统性能更丰富的刻画。据我们所知,这是第一个估计高维RBM拉普拉斯变换 \( \varphi_k(\cdot) \) 的框架。主要的方法论贡献在于,通过结合针对BAR和拉普拉斯变换结构特性精心设计的损失函数、有针对性的训练数据采样方案以及可训练参数数量不随维度 \( d \) 扩展的神经网络架构,将BAR刻画转化为一个可扩展的学习问题。这为在超出解析可处理范围的大规模随机系统中评估尾部概率和尾部延迟等重要性能指标,提供了一种精确且高效的计算工具。

##### 文献综述。

随着计算能力的提升,人们对开发随机系统数值方法的兴趣日益增长。例如,文献[17]提出了一种深度学习方法来计算马尔可夫链的收敛速度,文献[18]将该框架扩展到估计李雅普诺夫函数、求解泊松方程和近似平稳分布。然而,这些方法目前仅限于低维设置(例如二维)。将深度学习方法扩展到高维随机系统仍然更具挑战性,并推动了随机控制和扩散近似领域的研究。

我们的工作与将深度学习应用于高维随机系统的文献密切相关。特别是,深度BSDE框架[14,13]通过利用抛物型PDE与倒向随机微分方程之间的联系,为解决高维随机控制问题提供了一种强大方法。该框架已成功应用于各种设置,包括匹配[5]、调度[6]、脉冲控制[7]、漂移控制[4]和奇异控制[3]。我们的工作也受随机系统的启发,因为方程(1)刻画了反射布朗运动的平稳行为。然而,我们的设置本质上是不同的:与这些通常利用随机表示(如Feynman-Kac表示)将高维PDE重写为随机微分方程的方法不同,(1)描述的是平稳关系,并且不允许这样的重写。

我们的工作也与将深度学习应用于高维偏微分方程(PDE)的大量文献相关;参见[22]的综述。特别是,先前的工作研究了使用深度学习从变分公式中产生的PDE[9,23,19]。我们的方法基于(1)的平方残差构建损失函数,这与[9,19]中使用的最小二乘公式类似。然而,由于泛化性和数值稳定性问题,在我们的设置中直接最小化该残差是不够的。为了解决这个问题,我们设计了一个结构化的损失函数,其中包含额外的正则化项,以强制执行拉普拉斯变换的关键性质。此外,我们提出了一种专门设计的采样方案和神经网络架构,能够有效扩展到高维问题。

## 2 深度学习方法

在本节中,我们使用复数域中的前馈神经网络来近似(1)中 \( k = 0, \dots, d \) 的 \( \varphi_k(\cdot) \),因为(1)通过解析延拓仍然成立。在复数域中工作是必要的,因为稳健的数值反演方法(如塔尔博特方法[20]和相关方法[21,1])在计算尾部概率时会在复数自变量上评估拉普拉斯变换。设 \( \theta = \theta^{\mathrm{Re}} + i \theta^{\mathrm{Im}} \in \mathbb{C}^d \) 是一个 \( d \) 维复数向量,其中 \( \theta^{\mathrm{Re}}, \theta^{\mathrm{Im}} \in \mathbb{R}^d \)。我们专注于在如下有界区域上进行精确近似:

\[
\Theta := [\underline{\theta}^{\mathrm{Re}}, \bar{\theta}^{\mathrm{Re}}]^d \times [-\bar{\theta}^{\mathrm{Im}}, \bar{\theta}^{\mathrm{Im}}]^d.
\]
一种朴素的方法是使用浅层前馈神经网络来近似函数 \( \varphi_k(\cdot) \),然后通过最小化(1)左侧和右侧之间的均方误差来更新网络参数,其中训练样本从 \( \Theta \) 中均匀抽取。然而,这个简单的框架存在几个基本困难。

##### 泛化能力差。

方程(1)刻画了平稳分布的拉普拉斯变换,该变换是解析的且沿实轴单调。然而,朴素训练框架仅最小化(1)的有限样本残差,并不强制执行解析性或单调性。因此,神经网络可能很好地拟合采样训练点,但同时违反这些结构性质,并在未见过的输入上产生显著偏差。

##### 数值稳定性。

由于拉普拉斯变换 \( \varphi_k(\theta) \) 随 \( \theta \) 呈指数变化,它们的值在 \( [\underline{\theta}, \bar{\theta}]^d \) 内可能相差多个数量级,当 \( \theta \) 较小或较大时会导致数值精度问题。

##### 训练数据不平衡。

随着 \( d \) 增长,从高维盒子中均匀抽取 \( \theta \) 的实部和虚部的样本很少落在角点区域,即多个坐标同时接近其极值的情况。相反,典型样本包含各维度上小坐标值和大坐标值的混合。因此,朴素采样方案未能充分代表拉普拉斯变换呈现大幅度或强振荡行为的区域,使得训练算法难以准确学习这些区域。

##### 可扩展性差。

标准前馈网络将完整向量 \( \theta \in \mathbb{C}^d \) 作为输入,因此其输入层的大小随 \( d \) 线性增长。结果,第一层包含与各个输入坐标相关的参数,而这些参数必须从能够捕获所有 \( d \) 维上 \( \theta \) 足够变异性的样本中学习。随着 \( d \) 增加,实现这样的覆盖需要大幅增加样本量,使得朴素架构对高维RBM的可扩展性较差。

在本节的剩余部分,我们将描述如何通过精心设计损失函数、训练数据采样和神经网络架构来解决这些问题。

### 2.1 损失函数

我们不直接学习拉普拉斯变换 \( \varphi_k(\cdot) \),而是使用神经网络参数化其对数。具体来说,网络输出函数 \( f_k(\cdot) \),使得

\[
\varphi_k(\theta) = \exp(f_k(\theta)), \qquad k = 0, \dots, d.
\]
这种对数参数化提高了数值稳定性,并允许我们在评估BAR方程时处理量级相当的值。

对于任意 \( \theta \in \Theta \),我们定义损失函数

\[
\mathcal{L}(\theta) := \mathcal{L}_{\rm BAR}(\theta) + \lambda_{\rm pair} \cdot \mathcal{L}_{\rm pair}(\theta) + \lambda_{\rm mono} \cdot \mathcal{L}_{\rm mono}(\theta) + \lambda_{\rm CR} \cdot \mathcal{L}_{\rm CR}(\theta) + \lambda_{\rm zero} \cdot \mathcal{L}_{\rm zero}, \tag{2}
\]
其中 \( \lambda_{\rm pair}, \lambda_{\rm mono}, \lambda_{\rm CR}, \lambda_{\rm zero} > 0 \) 是平衡各损失分量相对重要性的超参数。第一项强制执行BAR方程,而其余项则融入拉普拉斯变换已知满足的结构性质。

#### 2.1.1 归一化BAR误差。

主要目标是强制执行BAR方程(1)。然而,直接比较方程两侧可能导致数值不稳定性,因为拉普拉斯变换可能随 \( \theta \) 呈指数变化。为了缓解这个问题,我们引入一个归一化因子。

对于任何输入 \( \theta \in \Theta \),我们首先计算归一化因子 \( \nu(\theta) \):

\[
\nu(\theta) := \max_{k = 0, \dots, d} \{ \log |\gamma_k(\theta)| + f_k^{\mathrm{Re}}(\theta) \}.
\]
这种归一化在评估两者差异之前,将BAR方程两侧重新缩放到可比较的量级。然后我们计算

\[
\kappa_l(\theta) = \gamma_0(\theta) \cdot \exp\Big( f_0(\theta) - \nu(\theta) \Big),
\]
\[
\kappa_r(\theta) = \sum_{k=1}^d \gamma_k(\theta) \cdot \exp\Big( f_k(\theta) - \nu(\theta) \Big).
\]
最后,归一化BAR误差为

\[
\mathcal{L}_{\rm BAR}(\theta) := \left( \frac{|\kappa_l(\theta) - \kappa_r(\theta)|}{|\kappa_l(\theta)| + |\kappa_r(\theta)| + \epsilon} \right)^2, \tag{3}
\]
其中 \( \epsilon > 0 \) 是一个非常小的常数,以避免除零。这种归一化...

相似文章

用于分布强化学习的路径耦合贝尔曼流

arXiv cs.LG

本文介绍了路径耦合贝尔曼流(PCBF),这是一种连续时间的分布强化学习方法,它使用流匹配来建模回报分布,而无需启发式投影。它通过将当前回报流和后续回报流通过共享的基础噪声耦合在一起,解决了以往基于流的方法中存在的边界不匹配和高方差问题。