MOSAIC:通过稀疏可加可识别因果学习在科学时间序列中进行模块发现
摘要
本文介绍了 MOSAIC,这是一种用于科学时间序列中模块发现的方法,它将因果表征学习与稀疏可加可识别因果学习相结合。其目标是在无需事后对齐的情况下,恢复可解释的潜在变量及其关联观测值,并在分子动力学和气候数据等领域进行了验证。
arXiv:2605.05524v1 公告类型:新论文
摘要:因果表征学习(CRL)旨在恢复具有可识别性保证的潜在变量,通常在适当的假设下,这种可识别性最多限于排列和逐分量重参数化。然而,可识别性并不意味着可解释性:潜在语义通常是通过与已知真实因子进行事后对齐来分配的。这一局限性在科学时间序列中尤为突出,因为其中的底层机制未知,而发现可解释的结构是一个主要目标。相比之下,科学观测(例如残基对距离、气候指数或过程传感器)本质上是语义化的,因为它们对应于有名称的物理量。这提出了一个关键问题:观测的可解释性是否可以转移到可识别的潜在空间?我们提出了 MOSAIC(通过稀疏可加可识别因果学习进行模块发现),这是一种稀疏时序变分自编码器(VAE),它将时序因果表征学习的可识别性与观测变量上的支持恢复相结合。MOSAIC 通过机制条件化的时序变化来识别潜在变量,并通过加性解码器为每个潜在变量恢复一组稀疏的关联观测值,从而实现模块级别的可解释性。我们表明,在一般的平滑混合函数下,方差分析(ANOVA)主效应支持是可识别的,并为一种易于处理的稀疏加性变体提供了有限样本恢复保证。实证研究表明,MOSAIC 在 RNA 分子动力学、太阳风、ENSO 气候、田纳西伊士曼过程以及合成托卡马克基准中恢复了与领域一致的变量组,从而实现了科学时间序列中潜在机制的可解释发现。
查看缓存全文
缓存时间: 2026/05/08 07:52
# 通过稀疏加性可识别因果学习进行科学时间序列的模块发现
来源:https://arxiv.org/html/2605.05524
Shicheng Fan¹, Nour Elhendawy², Jianle Sun³, Ke Fang¹, Kun Zhang³,⁴, Yihang Wang², Lu Cheng¹
¹伊利诺伊大学芝加哥分校 ²凯斯西储大学 ³卡内基梅隆大学 ⁴阿布扎比莫哈末·本·扎耶德人工智能大学
{sfan25, kfang10, lucheng}@uic.edu, {nae47, yihang.wang4}@case.edu, {jianles, kunz1}@cmu.edu
###### 摘要
因果表征学习(CRL)旨在在适当的假设下恢复具有可识别性保证的潜在变量,通常仅限于排列和分量级重新参数化。然而,可识别性并不隐含可解释性:潜在语义通常是通过与已知真实因素的对齐来事后分配的。这一局限在科学时间序列中尤为突出,因为其底层机制未知,而发现可解释的结构是主要目标。相比之下,科学观测值(如残基对距离、气候指数或过程传感器)具有内在的语义,因为它们对应于命名的物理量。这提出了一个关键问题:观测值的可解释性能否转移到可识别的潜在空间?
我们提出了 **MOSAIC**(**M**odule discovery via **S**parse **A**dditive **I**dentifiable **C**ausal learning,即通过稀疏加性可识别因果学习进行模块发现),这是一种稀疏时序变分自编码器(VAE),它将时序 CRL 的可识别性与观测变量上的支持恢复相结合。MOSAIC 通过 regime-条件化的时序变化来识别潜在变量,并通过加性解码器为每个潜在变量恢复一组稀疏的相关观测值,从而实现模块级别的可解释性。我们证明,在一般的平滑混合函数下,方差分析(ANOVA)主效应支持是可识别的,并针对一种易于处理的稀疏加性变体提供了有限样本恢复保证。在实证研究中,MOSAIC 在 RNA 分子动力学、太阳风、ENSO 气候、Tennessee Eastman 过程以及合成托卡马克基准测试中恢复了与领域一致的变量组,从而实现了科学时间序列中潜在机制的可解释发现。
[1] 开源代码:https://github.com/shichengf/mosaic
## 1 引言
因果表征学习(CRL)(Schölkopf et al., 2021; Zhang et al., 2024)旨在唯一地恢复潜在变量(仅相差平凡变换),这一特性被称为可识别性。特别是,基于 regime-条件化动态的时序 CRL(Hyvarinen and Morioka, 2016; Yao et al., 2022)实现了在排列和分量变换意义下的可识别性。然而,仅靠可识别性并不能保证科学上的可解释性。在标准的 CRL 设置中,学到的潜在变量的含义通常是通过将其与已知的真实因素对齐来事后分配的,而不是由模型直接推断出来的。
科学领域的时间序列提供了一个互补但不同的设置。它们的观测变量通常是命名的物理量(例如,蛋白质系统中的残基对距离),因此 inherently 携带领域语义。相比之下,支配这些观测值的潜在变量对应于通常未知的底层物理机制,揭示这些机制对于科学分析至关重要。现有的科学表征学习方法(例如 Wang et al., 2023)利用观测变量的语义结构,但并未为发现的潜在机制提供可识别性保证。因此,科学数据提供了可解释的观测值,但缺乏可识别的潜在变量;而 CRL 提供了可识别的潜在变量,却缺乏内在的科学解释。
这表明应将 CRL 引入科学时间序列,但直接应用现有的时序 CRL 方法仍然不足。诸如 TDRL(Yao et al., 2022, 2021; Song et al., 2024; Fan et al., 2026)等方法可以识别潜在变量,但依赖于密集神经网络解码器,无法揭示每个潜在变量控制哪些命名的观测值。因此,科学观测值的语义并未转移到潜在空间。
为了弥补这一差距,我们提出了 **MOSAIC**(Module discovery via Sparse Additive Identifiable Causal learning),这是一种稀疏时序 VAE,将时序 CRL 与命名观测值上的支持恢复相结合。MOSAIC 首先通过 regime-条件化时序变化识别潜在变量,然后通过加性解码器为每个潜在变量恢复一组稀疏的相关观测值。这将匿名但可识别的潜在变量转化为物理上可解释的潜在机制。
核心思想是 MOSAIC 使用一个加性解码器,结构上将每个潜在变量对观测值的贡献分离开来:每个潜在变量控制其自身映射到观测空间的小网络,因此它影响的观测值集合是明确且可读的。我们表明,即使真实的混合函数是非加性的,这种加性拟合也能恢复正确的每个潜在变量的影响模式(命题 1),因此恢复的支持集并非建模限制的伪影。
为了扩展到高维科学数据,MOSAIC 还引入了一种并行转移先验,消除了先前时序 CRL(Yao et al., 2022; Song et al., 2024; Li et al., 2024)中的顺序瓶颈。
**图 1:RNA 发夹示例。**
(A) cUUCGg RNA 发夹;颜色标记了三个结构区域(Stem, Closing Pair, Loop)。
(B) 四个学习到的潜在变量的 regime-关联评分(Cohen's $d$);$z_3$ 被选中。
(C1, C2) MOSAIC (C1) 和 TDRL (C2) 下 $z_3$ 的影响列;彩色条纹与 (A) 中的区域匹配。
图 1 在一个折叠成发夹形状的 RNA 分子上说明了这一点。它的 14 个残基分为图 1A 中可见的三个结构区域:茎(配对的碱基)、闭合对(铰链)和环(灵活的尖端)。每个观测变量 $D=28$ 测量一个残基的距离行为,因此变量名称具有物理意义。MOSAIC 根据 regime-关联评分(图 1B)对四个学习到的潜在变量进行排序,并选出 $z_3$,在检查其影响列之前它是匿名的。在 MOSAIC 下(图 1C1),影响集中在环残基上,将 $z_3$ 解释为跟踪环的灵活性。在 TDRL 下(图 1C2),影响散布在所有组中,导致 $z_3$ 不可解释。
关键点是普遍的:可识别的潜在变量必须锚定到命名的观测变量才能产生科学解释。
我们的贡献有四方面:
1. **问题形式化**。我们将科学时间序列的可解释性形式化为恢复可识别的潜在变量、它们的观测变量支持集以及 regime-关联因子的物理解释。
2. **理论**。我们证明了 ANOVA 主效应支持的总体恢复,$\rho=0$ 时的模块和 regime-关联可识别性,以及组 Lasso 变体的有限样本界;对于熵正则化,我们给出了集中度和 top-$k$ 陈述。
3. **架构**。我们引入了一种具有两阶段课程学习和并行转移先验的稀疏时序 VAE。
4. **实验**。MOSAIC 在受控的合成基准测试、RNA 动力学中的 UUCG 环相关因子(图 1)以及 OMNI 太阳风、ENSO 气候、TEP 和受托卡马克启发的基准测试上的 regime-关联因子上恢复了局部化模块。
## 2 相关工作
**时序因果表征学习。**
没有辅助信息的情况下,非线性 ICA 是不可识别的(Hyvärinen and Pajunen, 1999; Locatello et al., 2019),如今成熟的文献通过时序结构(Hyvarinen and Morioka, 2016; Khemakhem et al., 2020; Yao et al., 2022, 2021; Brehmer et al., 2022)、未知非平稳性(Song et al., 2023, 2024)、瞬时依赖性(Li et al., 2024)、连续机制演化(Fan et al., 2026)或潜在空间中的机制和结构稀疏性(Lachapelle et al., 2022, 2024; Zheng et al., 2022; Zheng and Zhang, 2023)恢复了可识别性。所有这些方法在识别潜在变量的同时,保持潜在到观测的映射平坦且无结构;没有任何方法产生对命名观测变量的模块划分。我们的实验 CRL 基线(TDRL, iVAE, SlowVAE, $\beta$-VAE, 和 CtrlNS)涵盖了最相关的设置:给定清晰的 regime(TDRL, iVAE)、弱时序监督(SlowVAE, $\beta$-VAE)和自动 regime 发现(CtrlNS);在我们的实验中,它们都表现出相同的支持恢复局限性。
**科学时间序列的因果发现。**
观测空间方法(Granger 因果性、传递熵、收敛交叉映射、PCMCI;综述见 Gong et al., 2024)恢复了命名变量之间的成对依赖性,LPCMCI 检测未命名的潜在混淆因子;最近的工作从时空数据中恢复潜在因果图(Wang et al., 2024),但未解决潜在到观测的支持问题。这些方法与 MOSAIC 互补:成对因果发现工具可以在 MOSAIC 在降低维度后识别的模块内部或之间操作。
**科学表征学习与稀疏统计方法。**
VAMPnets、SPIB 和 TICA 产生了科学时间序列有用的低维摘要,但没有可识别性,没有显式的潜在到观测支持,也没有 regime-关联解释协议。SPIB 是我们的实验基线,因为它将 regime 标签明确纳入其学习的表征中;VAMPnets 和 TICA 针对慢模式动力学而非 regime 对比。稀疏 PCA 和 ICA 在近线性混合下产生可读的稀疏载荷,但单个线性投影无法拟合同一因子的饱和和扩展非线性响应,且它们缺乏时序或 regime-条件化结构。
## 3 问题形式化
我们在由科学领域的时间序列 motivate 的设置下工作,其中每个观测变量都是携带领域语义的科学量。在每个时间步,我们观测 $\mathbf{x}_t \in \mathbb{R}^D$,其中每个 $x_i$ 对应这样一个命名的变量。$\mathbf{x}_t$ 上的这种语义结构使得可以通过其观测变量支持来解释恢复的潜在变量。
设 $\mathbf{x}_t$ 由 $n$ 个潜在因子 $\mathbf{z}_t \in \mathbb{R}^n$ 通过平滑、单射的混合函数 $g(\cdot)$ 生成:
$$
\mathbf{x}_t = g(\mathbf{z}_t) + \boldsymbol{\epsilon}_t, \quad g: \mathbb{R}^n \to \mathbb{R}^D, \quad \boldsymbol{\epsilon}_t \sim \mathcal{N}(\mathbf{0}, \sigma_{\epsilon}^2 \mathbf{I}), \quad (1)
$$
对 $g(\cdot)$ 没有限制为加性。
潜在模块遵循 regime-依赖的有限滞后转移模型:
$$
z_{t,j} \mid \mathbf{z}_{t-1:t-L}, c_t \sim p_j(z_{t,j} \mid \mathbf{z}_{t-1:t-L}, c_t), \quad (2)
$$
其中 $c_t \in \{0, 1\}$ 表示 regime(例如,RNA 动力学中的折叠 vs 未折叠)。跨 regime 转移动态不同的模块是 *regime-变化的*;动态不变的模块是 *regime-不变的*。
**作为可识别目标的主效应支持。**
由于 $g(\cdot)$ 不必是加性的,单个变量 $x_i$ 可能以与其他方式不可还原地纠缠的方式依赖于潜在因子 $z_j$。为了定义一个可恢复的目标,我们在归一化潜在因子的乘积参考测度 $\mu(\mathbf{z}) = \prod_{j=1}^n \mu_j(z_j)$ 下工作,这是 Hoeffding ANOVA 的标准设置。在此参考测度下,任何平方可积的 $g$ 都有分解:
$$
g(\mathbf{z}) = g_0 + \underbrace{\sum_{j=1}^n g_j(z_j)}_{\text{主效应}} + \sum_{j_0 < j_1} \dots
$$
当 $\rho > 0$ 时,那些对 $z_j$ 的依赖完全存在于高阶项中的变量位于 $\mathcal{S}_j$ 之外。
**恢复目标。**
从 $\{(\mathbf{x}_t, c_t)\}$ 我们旨在恢复:
(i) 潜在因子 $\mathbf{z}_t$(在排列和分量可逆变换意义下),
(ii) 每个恢复的潜在因子的主效应支持 $\mathcal{S}_j$,以及
(iii) 与 regime 对比最相关的潜在因子的身份。
## 4 可识别性理论
本节确立了第 3 节的恢复目标在适当意义上是可达到的:对于任何平滑混合函数,主效应支持是可识别的(命题 1),且在 $\rho=0$ 时,整个模块划分以及 regime-关联的身份可以精确恢复(定理 1 和推论 1)。对于有限样本,我们给出了主效应的 $O(N^{-4/5})$ 估计率(命题 3)以及每通道的样本复杂度...相似文章
MOSAIC:结构化代理智能与组合的模块化编排框架
MOSAIC 提出了一种用于自动化数据科学的结构化代理框架,该框架基于记忆驱动的模型选择和工作流构建,并在金融时间序列任务上得到验证。其性能优于 AutoML 及其他基于代理的基准方法。
MOSAIC:通过层次语义对齐编排协作知识追踪
MOSAIC是一种新颖的框架,利用冻结的大语言模型生成语义嵌入和层次化预测提示用于知识追踪,在多个基准上取得了最先进的结果。
基于倒置自注意力的多元时间序列因果发现
本文提出了一种利用倒置自注意力机制进行多元时间序列因果发现的新框架,引入了因果自注意力模块(CSAM)和全局因果算法,以识别潜在因果联系并减少虚假相关。
准确高效的LLM智能体长期记忆
MOSAIC是一个结构化、具备冲突感知能力的LLM智能体长期记忆框架,它采用实体类型化图存储、哈希加速检索和主动冲突检测,在长对话问答和事实冲突检测任务上实现了高准确率和高效率。
CausaLab: 面向AI科学家的可扩展交互式因果发现环境
CausaLab 是一个可扩展的环境,用于评估LLM智能体在交互式因果发现中的表现,同时衡量预测准确性和对潜在因果机制的忠实复现。实验揭示了预测与机制复现之间的差距,突显了当前LLM智能体作为实验性因果推理者的局限性。