Fuzzy-MoE:可解释的状态条件化专家路由用于非平稳多变量时间序列预测

arXiv cs.LG 论文

摘要

Fuzzy-MoE是一种新颖的基于模糊逻辑的混合专家模型,通过可解释的专家路由规则提高了非平稳多变量时间序列预测的准确性和可解释性。

arXiv:2608.20761v1 公告类型:新 摘要:在非平稳多变量时间序列中,不同变量和样本通常表现出异质的潜在动态状态,而现有的深度预测模型通常将其压缩为统一的端到端映射,导致对时间变化动态的建模次优,以及在不同潜在状态下激活哪种预测机制的可解释性有限。为克服这些限制,我们将时间序列预测重新表述为潜在时间状态识别和可解释专家路由的统一框架,并提出Fuzzy-MoE,一种基于模糊逻辑的动态混合专家模型。Fuzzy-MoE由多个并行专家映射网络和双视角模糊路由器组成。通过联合利用局部卷积动态和全局分段统计,路由器推断潜在时间状态,并通过可学习的高斯隶属函数计算专家激活强度,实现基于显式IF-THEN规则的专家选择。这种细粒度路由策略允许同一序列内的不同变量激活不同的专家,有效捕捉异质时间动态,同时提高模型可解释性。在多个公开时间序列基准数据集上的实验结果表明,Fuzzy-MoE在预测精度上显著优于主流预测方法。此外,模糊隶属度和规则激活提供了可解释的路由诊断,证明了所提框架在预测性能和机制透明度方面的有效性。与使用黑箱路由的传统MoE模型不同,Fuzzy-MoE的路由基于清晰、可解释的模糊规则,使专家选择透明且可追溯。
查看原文
查看缓存全文

缓存时间: 2026/08/24 04:33

# Fuzzy-MoE:面向非平稳多元时间序列预测的可解释体制条件专家路由
来源:https://arxiv.org/html/2608.20761  
肖杰、苏昭、沈军、李浩然、马慧霞、周庆国、永彬彬  
致谢:通讯作者:永彬彬(邮箱:[email protected])

###### 摘要

在非平稳多元时间序列中,不同变量和样本常表现出异质的潜在动态状态,而现有深度预测模型通常将其压缩为统一的端到端映射,导致时变动态建模次优,且难以解释不同潜在状态下激活的预测机制。为克服这些局限,我们将时间序列预测重新定义为潜在时态状态识别与可解释专家路由的统一框架,并提出Fuzzy-MoE——一种基于模糊逻辑的动态混合专家模型。Fuzzy-MoE由多个并行专家映射网络和双视角模糊路由器组成。路由器通过联合利用局部卷积动态和全局分段统计,推断潜在时态状态,并通过可学习的高斯隶属函数计算专家激活强度,实现基于显式IF-THEN规则的专家选择。这种细粒度路由策略允许同一序列内的不同变量激活不同专家,在有效捕捉异质时序动态的同时提升了模型可解释性。在多个公共时间序列基准数据集上的实验结果表明,Fuzzy-MoE在预测精度上显著优于主流预测方法。此外,模糊隶属度和规则激活提供了可解释的路由诊断信息,证明了该框架在预测性能和机制透明度上的有效性。与传统使用黑箱路由的MoE模型不同,Fuzzy-MoE的路由基于清晰、可解释的模糊规则,使专家选择过程透明且可追溯。

## 引言

非平稳多元时间序列预测是众多实际应用的基础[9](https://arxiv.org/html/2608.20761#bib.bib9)、[4](https://arxiv.org/html/2608.20761#bib.bib10)、[10](https://arxiv.org/html/2608.20761#bib.bib11),但其固有的异质性仍是主要障碍。在此类数据中,潜在时态动态不仅在不同时间段(样本级)变化,还在同一观测窗口内的不同变量间(通道级)变化。这种多样性意味着没有单一的统一映射函数能充分捕捉所有共存的动态体制;将所有输入强制塞入一个通用的端到端模型必然导致次优预测性能[26](https://arxiv.org/html/2608.20761#bib.bib1)、[29](https://arxiv.org/html/2608.20761#bib.bib21)、[17](https://arxiv.org/html/2608.20761#bib.bib2)、[13](https://arxiv.org/html/2608.20761#bib.bib4)、[24](https://arxiv.org/html/2608.20761#bib.bib20)、[16](https://arxiv.org/html/2608.20761#bib.bib15),因为模型无法显式识别当前输入受哪个潜在状态支配[20](https://arxiv.org/html/2608.20761#bib.bib13)。

**图1**:经典黑箱MLP门控与本文可解释模糊门控的比较。(a) 传统MLP门控生成不可解释的路由logit,缺乏可追溯的决策规则;(b) 本文的模糊门控融合局部与全局时序线索,通过高斯模糊隶属度计算专家权重,生成可读的IF-THEN路由规则,实现细粒度的变量级专家分配。

为应对这种异质性,近期研究转向混合专家架构,采用多个专家网络覆盖不同的模式子空间。然而,这些模型中的路由机制(决定输入如何分配给专家)仍是关键瓶颈[28](https://arxiv.org/html/2608.20761#bib.bib14)、[21](https://arxiv.org/html/2608.20761#bib.bib22)。现有绝大多数预测器依赖黑箱线性投影后接Softmax门控,如图1(a)所示。此类设计不仅缺乏可解释性(权重无法揭示哪些时序特征驱动了特定专家的选择),而且易出现门控崩溃——少数专家主导所有输入,其余专家退化。因此,尽管拟合能力强,这些模型无法为决策提供透明依据,严重限制了其在关键领域的信任度与可部署性。标准MoE存在问题:它输出路由权重却无法解释原因,无法回答“为何选择此专家”,导致模型难以信赖。

我们通过根本性地重构预测任务来解决这些挑战。我们不学习单一的直接映射,而是提出范式转变:先识别潜在时态状态,再进行可解释的专家路由。核心理念是模型应首先诊断每个输入的潜在动态体制,然后显式选择最适合该体制的专家网络。此分解将不透明的端到端预测转化为两阶段可检查过程:状态推理与条件预测。我们的方法不同于标准MoE,不将路由权重隐藏于内部,而是创建清晰的IF-THEN规则,您可以明确看到选择了哪个专家及其原因。

本文提出Fuzzy-MoE(基于模糊逻辑的动态混合专家模型),如图1(b)所示。它通过双视角路由器提取互补的状态线索,捕捉局部卷积动态和全局分段统计。这些线索被投影到低维模糊空间,其中路由权重通过可学习的高斯隶属函数和显式IF-THEN规则生成。关键的是,路由器在样本-通道级操作,允许同一序列内的不同变量激活不同专家——这种细粒度适应性反映了现实世界的异质性。乘积T-范数聚合和温度缩放Softmax在保持每个规则激活物理意义的同时确保数值稳定性,形成完全可追溯的决策路径。每条规则很简单:IF模糊变量在范围[μ−σ, μ+σ]内,则激活专家k。无需查看权重即可理解规则。

综上所述,我们的贡献如下:

- •我们将非平稳多元预测从传统序列到序列映射重新定义为可解释的状态条件专家路由问题。此形式化将贡献扩展到单一预测任务之外,指向异质数据动态下更通用的自适应推理范式。
- •我们提出一种透明的路由架构,提取局部与全局状态线索,并通过可学习的高斯隶属函数和显式IF-THEN规则生成专家权重,使潜在状态识别成为可检查和可解释的中间过程。
- •我们的模型在样本-通道级分配专家,从而允许同一序列内的不同变量调用不同的预测机制。此外,框架产生多层次诊断信号,包括模糊隶属度、专家权重和规则激活,共同揭示模型的置信度、不确定性以及每个专家选择背后的具体原理。

## 相关工作

### 时间序列预测

时间序列预测是数据挖掘领域的核心问题,长期受到广泛关注[18](https://arxiv.org/html/2608.20761#bib.bib24)、[27](https://arxiv.org/html/2608.20761#bib.bib25)。以自回归移动平均为代表的传统方法在处理平稳线性数据时表现良好,但缺乏拟合非线性复杂模式的能力。支持向量回归等机器学习方法通过非线性核或集成策略提升了预测能力,但仍依赖人工设计特征,难以自动发掘深层时序表示。

近年来,深度学习模型在时间序列预测方面取得显著进展。基于Transformer的模型利用自注意力机制捕捉全局依赖关系,已成为主流范式之一。代表工作包括:PatchTST[17](https://arxiv.org/html/2608.20761#bib.bib2)和iTransformer[13](https://arxiv.org/html/2608.20761#bib.bib4),采用倒置架构将独立变量序列嵌入注意力机制以更好地建模多元相关性;TimesNet[25](https://arxiv.org/html/2608.20761#bib.bib3)通过傅里叶变换将一维时序转换为二维张量,捕捉周期内和周期间变化;Autoformer[26](https://arxiv.org/html/2608.20761#bib.bib1)用自相关机制替代标准自注意力以显式建模序列周期性;FEDformer[32](https://arxiv.org/html/2608.20761#bib.bib5)引入频域增强模块以提升长期预测性能。然而,所有这些模型都依赖单一映射网络从过去到未来进行转换[6](https://arxiv.org/html/2608.20761#bib.bib18)、[14](https://arxiv.org/html/2608.20761#bib.bib19)、[3](https://arxiv.org/html/2608.20761#bib.bib23),难以适应非平稳时间序列中不同变量和片段的异质动态状态。

### 时间序列预测的可解释性

深度模型的黑箱性质长期限制了其在金融、医疗等高风险领域的应用[14](https://arxiv.org/html/2608.20761#bib.bib19)、[8](https://arxiv.org/html/2608.20761#bib.bib26)、[5](https://arxiv.org/html/2608.20761#bib.bib27)。现有可解释性研究主要沿两条路径[15](https://arxiv.org/html/2608.20761#bib.bib29):一是事后解释,如通过注意力权重可视化分析已训练模型的行为。然而,事后解释常与模型实际决策存在差异,甚至可能产生误导。二是内在可解释模型[23](https://arxiv.org/html/2608.20761#bib.bib28),通过自解释结构使推理过程透明化。时间融合Transformer通过静态变量编码和可解释的多头注意力提供决策支持。尽管这些方法提供了某种程度的解释,但其解释通常止步于输入重要性的归因层面,未解决模型在何种条件下使用何种预测机制的深层问题。

### 混合专家

混合专家通过多个专家网络的协同决策扩展模型容量,允许不同专家处理不同的数据子集。近年来,它在大规模预训练模型中表现卓越。例如,谷歌的Switch Transformer和GLaM使用MoE将模型参数扩展到万亿级别,同时保持计算成本几乎不变。

在时间序列预测领域,MoE架构已得到初步探索[30](https://arxiv.org/html/2608.20761#bib.bib12)。部分研究设计不同专家为具有不同感受野的循环或卷积网络以处理多尺度时序模式;另一些研究将MoE与Transformer结合,使用稀疏门控选择不同的注意力头或前馈网络。然而,现有MoE预测器的门控机制本质上是黑箱线性投影后接Softmax归一化[19](https://arxiv.org/html/2608.20761#bib.bib16)、[12](https://arxiv.org/html/2608.20761#bib.bib17)。它们未能生成样本-通道级的模糊条件规则以实现细粒度的变量级专家分配。模式特定和分布偏移感知的专家模型通过将样本分组到不同的动态聚类并为每个聚类分配专用专家来缓解时序异质性,但其可解释性限于简单的聚类-模式匹配,未提取互补的局部卷积和全局分段统计状态线索,或多尺度时序信号映射到可追溯的IF-THEN路由规则,而这些正是Fuzzy-MoE专门为非平稳多元预测任务设计的。

## 提出方法

本节详细阐述提出的Fuzzy-MoE框架。

**图2**:提出的Fuzzy-MoE框架整体流程。它集成了输入分割、双视角状态提取、模糊路由、残差专家池和输出恢复。双视角模糊路由器输出样本-通道级专家权重,辅助可视化模块提供模糊嵌入、门控归因和显式模糊规则,实现完全路由可解释性。

### 整体:从序列映射到体制条件路由

传统深度预测模型将多元时间序列预测视为端到端的序列映射问题:学习统一函数 $f: \mathcal{X} \mapsto \mathcal{Y}$,直接将历史观测窗口转换为未来时域。这种“一刀切”范式隐含假设单一参数集能充分捕捉所有时序动态模式。但在非平稳时间序列中,不同变量和片段常处于异质动态体制,使该假设在实际中失效。

本文将预测任务重构为**体制条件的专家路由问题**。核心思想是模型不应直接学习单一映射;而应先识别当前输入的潜在时态体制,再选择最适合该体制的专家网络完成预测。形式化地,给定历史序列 $\mathbf{X} \in \mathbb{R}^{L \times C}$(其中 $L$ 为回看窗口长度,$C$ 为变量数),模型从多视角提取状态线索,模糊路由机制决定专家选择:

$$ \hat{\mathbf{Y}} = \sum_{k=1}^{K} \mathbf{w}_k \cdot \mathcal{E}_k(\mathbf{X}_{\text{seg}}) $$

其中 $K$ 为专家总数,$\mathbf{w}_k$ 是由模糊路由器生成的具有明确物理语义的门控权重,$\mathcal{E}_k$ 表示第 $k$ 个专家网络,$\mathbf{X}_{\text{seg}}$ 为分段输入。此形式化将预测过程分解为两个独立可检查的阶段:**体制识别**(模糊路由)和**专家预测**(专家网络),为后续可解释性设计奠定基础。

### 模型架构概述

Fuzzy-MoE的整体架构包含五个核心模块:输入归一化与分割、双视角状态特征提取、双视角模糊路由、专家映射网络、加权融合与输出恢复。图2

相似文章

通过有限专家库实现通信高效的专家路由

arXiv cs.LG

本文提出了一种针对稀疏混合专家(MoE)模型中通信高效专家路由的信息论框架,将门控机制视为随机信道,并推导实用的互信息估计器以分析有限专家库上的准确率-速率权衡。

用于交通预测的图条件图神经网络专家混合模型

arXiv cs.LG

提出了GC-MoE,一种用于交通预测的图条件专家混合框架,该框架根据图拓扑和近期输入为每个节点分配个性化的冻结预训练时空图神经网络专家组合,仅训练一个轻量级路由模块(约1.7万个参数),并在四个基准数据集上取得了有竞争力的性能。

粘性路由:训练MoE模型以实现内存高效推理

arXiv cs.LG

StickyMoE提出了一种可微的路由一致性损失函数,鼓励相邻token在MoE模型中激活相同的专家,从而在边缘设备推理过程中将专家交换开销和缓存未命中率降低高达3.92倍,同时改善困惑度。