大规模MST-Direct:基于Sinkhorn最优传输的多元条件地质统计模拟
摘要
本文扩展了MST-Direct方法(一种使用Sinkhorn最优传输进行多元地质统计模拟的方法),从双变量无条件小网格设置扩展到多元、条件和大规模设置,精确保持联合分布,并优于现有方法。
arXiv:2606.07578v1 公告类型:新
摘要:本文扩展了MST-Direct(一种基于Sinkhorn传输匹配的多元地质统计模拟方法),从原始的双变量、无条件、小网格形式扩展到多元、条件和大网格设置。我们解决了原始工作中确定的三个主要限制:(i) 通过稀疏、候选受限的Sinkhorn匹配器实现可扩展到数千个节点以上,内存复杂度为O(nC);(ii) 通过将目标值元组匹配到独立的FFT-MA高斯骨干上扩展到多个变量,该骨干能够再现指定的变差函数;以及(iii) 硬数据条件化,通过固定观测数据元组在其空间位置,同时通过克里金对骨干进行条件化。由于传输计划仍然是目标元组的排列,多元联合分布被精确保留。
该方法使用与直接多元模拟(DMS)相同的六变量、异方差、强非线性参考分布进行验证,在无条件(200x200)和条件(100x100,200个硬数据样本)场景下进行测试,并与投影追踪多元变换(PPMT)进行基准比较。结果表明,MST-Direct以零直方图误差再现联合分布,精确尊重硬数据,并准确再现指定的空间相关结构,而PPMT仍然是一种近似。
索引术语:最优传输,Sinkhorn算法,地质统计模拟,多元模拟。
查看缓存全文
缓存时间: 2026/06/09 08:46
# 2603.18036),该文在二元、无条件、小网格设置中引入了 MST-Direct;本文贡献了可扩展的、多变量和条件扩展。
来源:https://arxiv.org/html/2606.07578
## MST-Direct 规模扩展:通过 Sinkhorn 最优传输实现多变量和条件地质统计模拟††感谢:本文是作者先前工作(arXiv:2603.18036)的后续,该文在二元、无条件、小网格设置中引入了 MST-Direct;本文贡献了可扩展的、多变量和条件扩展。
###### 摘要
本文将 MST-Direct(通过 Sinkhorn 传输进行匹配的多变量地质统计模拟方法)从原始公式的二元、无条件、小网格设置扩展到*多变量*、*条件*和*大网格*模式。我们解决了该工作中识别的三个开放限制:(i) 通过具有 O(nC) 内存的稀疏、候选限制 Sinkhorn 匹配器,可扩展到数千节点以上;(ii) 扩展到多个变量,通过将目标值元组匹配到承载指定变差函数的独立 FFT-MA 高斯骨架上;(iii) 硬数据条件化,通过将数据元组固定到其位置,同时通过克里金法对骨架进行条件化。由于传输计划仍然是目标元组的排列,因此多变量联合分布得以*精确*保持。我们在与直接多变量模拟(DMS)相同的 6 变量、异方差、强非线性参考分布上验证了该方法,包括无条件(200×200)和条件(100×100,200 个硬数据)设置,并与投影寻踪多变量变换(PPMT)进行了基准比较。MST-Direct 以零直方图误差重现了联合分布,精确地符合硬数据,并重现了指定的空间相关性,而 PPMT 仍然是一个近似值。
## I. 引言
地质统计模拟生成地质模型的多重实现,这些模型重现数据的空间特征并支持不确定性量化[5 (https://arxiv.org/html/2606.07578#bib.bib14), 2 (https://arxiv.org/html/2606.07578#bib.bib13)]。许多地质关系是强非线性和异方差的,无法用经典多变量方法依赖的线性相关系数来描述。逐步条件变换(SCT)[7 (https://arxiv.org/html/2606.07578#bib.bib5)]、投影寻踪多变量变换(PPMT)[1 (https://arxiv.org/html/2606.07578#bib.bib4)]和直接多变量模拟(DMS)[4 (https://arxiv.org/html/2606.07578#bib.bib1)]通过将变量变换到高斯空间并返回来解决这一问题;该变换仅在渐近情况下精确,且误差随变量数量增加而增长。
在先前的工作中,我们引入了 *MST-Direct*(通过 Sinkhorn 传输进行匹配)[10 (https://arxiv.org/html/2606.07578#bib.bib2)],该方法将模拟视为一个熵正则化最优传输(OT)问题[12 (https://arxiv.org/html/2606.07578#bib.bib23), 8 (https://arxiv.org/html/2606.07578#bib.bib22), 3 (https://arxiv.org/html/2606.07578#bib.bib21)]:目标值元组通过 Sinkhorn 算法[11 (https://arxiv.org/html/2606.07578#bib.bib20)](增加了关系 k 近邻项)被*匹配*到空间模板上,所得排列在精确保持联合分布的同时重现了空间结构。该公式在五个复杂的*二元*关系上实现了 100% 的形状保持,但仅在与高斯-连接函数和 LU 分解基线的对比中在 25×25 网格上进行了展示,并明确留下了三个开放问题[10 (https://arxiv.org/html/2606.07578#bib.bib2)]:扩展到超过约 10,000 个节点、扩展到两个以上变量,以及带有硬数据的条件模拟。
本文解决了这三个限制,并在 DMS 验证问题上对该方法进行了基准测试。我们的贡献是:
1. 1. 一个*可扩展的* MST-Direct 匹配器——稀疏、候选限制的 Sinkhorn 与贪心双射补全——在远小于一分钟的时间内运行 200×200(40,000 节点)和 100×100 网格;
2. 2. 一个*多变量*公式,将目标云匹配到承载指定变差函数的独立 FFT-MA 高斯骨架[6 (https://arxiv.org/html/2606.07578#bib.bib9)]上,在六个变量上进行了演示;
3. 3. *条件*模拟,通过固定数据元组并通过简单克里金法对骨架进行条件化,精确地符合硬数据;
4. 4. 与 DMS [4 (https://arxiv.org/html/2606.07578#bib.bib1)] 相同的 6 变量、异方差、非线性参考分布上,与 PPMT 的头对头验证。
## II. 方法
我们首先总结在 [10 (https://arxiv.org/html/2606.07578#bib.bib2)] 中引入的 MST-Direct 原理;本节的其余部分介绍构成当前贡献的三个扩展(可扩展匹配、多变量骨架和条件化)。设 \(\{z^{(k)}\}_{k=1}^{N}\),\(z^{(k)} \in \mathbb{R}^{d}\),是来自一个目标 \(d\) 变量非参数分布 \(p(z_1, \dots, z_d)\) 的 \(N\) 个元组的样本(数据或代表性训练集),要放置在一个包含 \(n=N\) 个位置的网格上,使得实现重现 \(p\) 和指定的空间协方差。将目标元组和一个空间模板 \(\{g_j\}\) 写为离散测度,一个实现是一个将每个元组分配给每个位置的耦合;MST-Direct 通过熵正则化最优传输问题[3 (https://arxiv.org/html/2606.07578#bib.bib21)] 选择它:
\[\min_{M \in \Pi} \; \langle C, M \rangle - \frac{1}{\beta} H(M),\] (1)
在传输多面体 \(\Pi = \{M \ge 0: M\mathbf{1} = \frac{1}{n}\mathbf{1}, M^{\top}\mathbf{1} = \frac{1}{n}\mathbf{1}\}\) 上,其中 \(C_{ij} = \lVert \tilde{g}_i - \tilde{z}^{(j)} \rVert^2\) 是每个变量标准化空间中的平方距离,\(H\) 是熵,\(\beta\) 是正则化参数。解 \(M = \mathrm{diag}(\mathbf{r}) K \mathrm{diag}(\mathbf{c})\),\(K = \exp(-\beta C)\),通过对数域中的 Sinkhorn 不动点[11 (https://arxiv.org/html/2606.07578#bib.bib20)] 求得。
然后,一个关系 k 近邻奖励增强成本,使得空间相邻的位置匹配到相互相似的元组[10 (https://arxiv.org/html/2606.07578#bib.bib2)];设 \(A\) 为行归一化的网格邻接矩阵:
\[M_{ij} \propto \exp\big(\beta(-C_{ij} + \lambda [AMA^{\top}]_{ij})\big),\] (2)
通过交替进行奖励 \(AMA^{\top}\) 和 Sinkhorn 归一化求解。软耦合通过贪心赋值(按置信度递减顺序)舍入为排列 \(\pi\)。由于 \(\pi\) 是到目标元组的双射,因此实现 \(z_i^{*} = z^{(\pi(i))}\) 是*相同的多重集合*的元组:每个边缘分布和每个非线性交叉依赖关系都被精确重现。OT 仅决定*每个元组去哪里*。
模板承载指定的空间结构。与 DMS 一样,我们通过 FFT-MA[6 (https://arxiv.org/html/2606.07578#bib.bib9)] 生成 \(d\) 个*独立*的标准高斯场,具有目标(球状)变差函数:\(g^{(c)} = \mathcal{F}^{-1}\{\sqrt{S(\omega)} \mathcal{F}\{W^{(c)}\}\}\)。相邻位置接收相似的特征向量,并在匹配后接收相似的元组,将变差函数传递到每个变量。匹配本身*不*施加各向同性或平稳性要求:所选高斯模拟器可接受的任何协方差——包括各向异性模型——都可以在骨架中使用;我们仅为了与 DMS [4 (https://arxiv.org/html/2606.07578#bib.bib1)] 的可比性而采用各向同性球状模型。
密集耦合在内存上是 \(O(n^2)\),每次关系迭代约为 \(O(n^3)\),在 \(n=40,000\) 时不可行[10 (https://arxiv.org/html/2606.07578#bib.bib2)]。我们改为将每个位置限制到其 \(C\) 个最近的目标元组(通过 k-d 树),因此耦合具有 \(O(nC)\) 个非零元素,并且 Sinkhorn 更新变为对候选边列表的段规约。贪心舍入产生排列;少数没有空闲候选的位置通过最近未使用赋值修复,保证完整的双射。关系项 (2) 作为几次细化传递应用,将每个查询拉向 \(\overline{Z}_{\mathcal{N}(i)}\),即当前分配给位置 \(i\) 的空间 k 近邻 \(\mathcal{N}(i)\) 的平均元组(算法 1)。
**算法 1:可扩展 MST-Direct**
1. 1. 输入目标元组 \(Z \in \mathbb{R}^{n \times d}\);坐标;变差函数;硬数据(可选)。
2. 2. 标准化 \(Z\);构建骨架 \(G\)(如果存在硬数据,则进行克里金条件化)。
3. 3. 将硬数据位置固定到其元组;从池中排除。
4. 4. 候选:每个 \(G_i\) 的 \(C\) 个最近 \(Z\) 行(k-d 树)。
5. 5. 在候选边上进行稀疏对数域 Sinkhorn (1)。
6. 6. \(r\) 次关系传递 (2):\(G_i \leftarrow (1-\lambda)G_i + \lambda \overline{Z}_{\mathcal{N}(i)}\),重新匹配。
7. 7. 贪心舍入为排列 \(\pi\);修复剩余位置。
8. 8. 返回 \(z_i^{*} = Z_{\pi(i)}\)(\(Z\) 的一个排列)。
位于位置 \(\{\ell\}\) 的硬数据 \(\{z_{\ell}^{\mathrm{d}}\}\) 分两步处理。首先,通过简单克里金法[6 (https://arxiv.org/html/2606.07578#bib.bib9)] 对骨架进行数据条件化(在匹配空间中),以便它插值数据并在其他地方保持指定的协方差。其次,数据位置被*固定*:它们的元组被固定并从池中移除,只有其余位置进入 (1)。因此,实现精确地符合数据,而克里金骨架保持周围环境的一致性。
## III. 实验设计
我们重现了 DMS [4 (https://arxiv.org/html/2606.07578#bib.bib1)] 的两个实验,使用*相同*的 6 变量目标分布,该分布是强非线性和异方差的(图 1 和 3 的左面板)。在每个比较中,目标(*真实*)分布与 PPMT 和 MST-Direct 的实现一起按顺序显示;对角线是边缘分布,非对角线是双变量直方图。我们通过实验直方图与参考直方图之间的均方误差(MSE)来量化两种方法的重现程度,并通过实验变差函数评估空间重现性。我们以 PPMT [1 (https://arxiv.org/html/2606.07578#bib.bib4)] 为基准,而不是二元研究[10 (https://arxiv.org/html/2606.07578#bib.bib2)] 中使用的高斯-连接函数或 LU 分解基线:那些基线本质上是高斯的,因此无法重现复杂的非线性联合关系,这将使比较失去信息性,而 PPMT 是一种非参数多变量变换,正是为此类分布设计的。PPMT 通过投影寻踪高斯化实现,并使用相同的 FFT-MA 骨架。无条件网格为 200×200,球状变差函数范围 40;条件网格为 100×100,包含 200 个均匀分布的硬数据,从数据拟合的球状变差函数(范围 ≈ 16,而 [4] 中为 18)。
## IV. 结果
对于无条件实验(200×200 网格,球状范围 40),图 1 比较了实验分布。MST-Direct 实现(右)与参考(左)无法区分——这是相同元组的空间排列——而 PPMT(中)恢复了大致结构但扭曲了精细的非线性联合关系。表 I 报告了两种方法的直方图 MSE:MST-Direct 为零,PPMT 的数量级为 \(10^{-6}\) 到 \(10^{-5}\)。图 2 显示两种方法都重现了施加的范围 40 模型;MST-Direct 精确地匹配基台(其方差通过构造等于参考),而 PPMT 超出 10-20%。可扩展双射留下了一个轻微的短滞后分量,通过关系传递减少了。
(图 1 标题:无条件实验分布:*真实*(左)、PPMT(中)、MST-Direct(右)。MST-Direct 与参考相同;PPMT 扭曲了精细的非线性联合关系。)
(表 I 标题:无条件直方图 MSE 与参考的比较(×10^{-5}):MST-Direct(左)和 PPMT(右)。对角线:边缘分布;非对角线:双变量直方图。)
(图 2 标题:无条件实验变差函数:MST-Direct(蓝色)和 PPMT(红色)对比施加的球状模型(范围 40,虚线)。)
对于条件实验,参考模型构建为 100×100 网格上的无条件实现,其中 200 个节点成为硬数据。两种方法都符合数据——MST-Direct 通过固定精确符合(在 200 个位置和所有六个变量上最大绝对误差为 0),PPMT 达到机器精度(约 \(10^{-14}\))。图 3 比较了分布(同样 MST-Direct 精确,PPMT 近似),MSE 见表 II。图 4 显示了三个实现的地图(参考 / PPMT / MST-Direct),所有都符合数据;图 5 验证了精确的数据重现(测量值与模拟值在 45°线上)。图 6 显示两种方法都近似重现了参考变差函数,MST-Direct 精确跟踪基台,PPMT 略微低于基台——与 [4] 一致。
(图 3 标题:条件实验分布:*真实*(左)、PPMT(中)、MST-Direct(右)。)
(图 4 标题:100×100 网格上的条件实现,行:*参考 / PPMT / MST-Direct*,列:\(z_1\)–\(z_6\)(每列共享颜色尺度)。黑点标记 200 个硬数据位置,所有方法都符合。)
(图 5 标题:条件 MST-Direct:200 个硬数据位置的测量值与模拟值。所有点都在 45°线上(最大绝对误差 0)。)
(图 6 标题:条件实验变差函数:参考模型(黑色)、MST-Direct(蓝色)、PPMT(红色)。)
(表 II 标题:条件直方图 MSE 与参考的比较(×10^{-5}):MST-Direct(左)和 PPMT(右)。)
## V. 讨论
实验解决了 [10] 中留下的三个限制。*可扩展性*:稀疏候选限制相似文章
A Local Sinkhorn Framework for Conditional Distribution Reconstruction of Multidimensional Random Fields
This paper proposes a scalable local Sinkhorn divergence framework for training stochastic neural networks to reconstruct multidimensional random fields, with theoretical generalization error bounds and numerical demonstrations for uncertainty quantification.
动态广义Gromov-Wasserstein最优传输
本文介绍了TP-DATE,一个无需模拟的动态Gromov-Wasserstein最优传输框架,增强了空间转录组数据中的空间结构保持和连续动力学重建。
基于最优传输势的多边缘流匹配
提出OTP-FM,一种新颖的多边缘流匹配方法,利用最优传输势来软性地引导流通过中间边缘分布,在单细胞RNA测序、海洋学和气象学数据集上实现了最先进的性能。
使用子采样马尔可夫链蒙特卡罗的潜变量模型大规模不确定性量化
本文针对SGLD-Gibbs发展了标度极限理论,为大规模潜变量模型中实现有意义的不确定性量化提供原则性的超参数调优指导。
SegTSim:一种面向异构多元系统的大数据驱动分段时序模拟框架
本文介绍了SegTSim,一种用于异构多元系统的大数据驱动分段时序模拟框架,并在美日汽车贸易数据上进行了验证。