MoFE:一种基于傅里叶神经算子的新型专家混合框架用于加密货币预测

arXiv cs.LG 论文

摘要

本文提出MoFE,一种新型深度学习框架,将傅里叶神经算子集成到专家混合架构中,以解决加密货币价格预测中的挑战,在比特币价格预测上实现了最先进的性能。

arXiv:2608.17342v1 公告类型:新 摘要:预测加密货币价格仍然是一项艰巨的挑战,由于其固有的非平稳性、突变机制转变和多尺度随机依赖性。传统深度学习模型往往难以捕捉复杂的潜在动态,常导致持续的相位滞后预测。为解决这些局限性,我们提出MoFE,一种新型深度学习框架,将傅里叶神经算子(FNOs)集成到专家混合(MoE)架构中。基于随机微分方程的理论框架,MoFE将加密货币波动性概念化为多频率分量的叠加,包括基于用户网络的基本增长、挖矿成本和减半机制引起的季节性波动,以及市场情绪引发的混沌。具体而言,专门的自适应FNO(AFNO)和卷积双域专家学习连续函数到函数的映射,以封装全局谱趋势、周期性调整和微观结构,而基于动态门控的MoE机制使得在不同市场机制下实现自适应策略切换。在跨越2020年1月至2025年12月的比特币数据集上进行的广泛实验表明,MoFE在T+1和T+5预测时间范围内均实现了最先进的(SOTA)性能。值得注意的是,该模型有效缓解了相位滞后效应,提供了卓越的方向准确性(DA)和信息系数(IC)。在高保真模拟交易环境中,这些预测收益转化为显著的超额回报和稳健的风险调整后性能,其特点是高Sharpe比率。
查看原文
查看缓存全文

缓存时间: 2026/08/19 10:26

# 一种结合傅里叶神经算子的新型混合专家框架在加密货币预测中的应用
来源:https://arxiv.org/html/2608.17342
## MoFE:一种结合傅里叶神经算子的新型混合专家框架在加密货币预测中的应用
致谢:© 2026 IEEE。允许个人使用本材料。在任何当前或未来的媒体中,包括为广告或促销目的转载/再版本材料、创建新的集体作品、用于转售或分发至服务器或列表,或在其他作品中重用本作品的任何受版权保护的组件,均需获得IEEE的许可。DOI: 10.1109/ICBC67748.2026.11575439

Bowen Liu  机构:罗彻斯特大学艺术与科学学院 美国罗彻斯特 [email protected]
Mingming Sun  机构:北京数学科学与应用研究所AGI实验室 中国北京 [email protected]

###### 摘要

由于固有的非平稳性、突然的机制转换和多尺度随机依赖性,加密货币价格预测仍然是一项艰巨的挑战。传统深度学习模型常常难以捕捉复杂的底层动态,经常导致持续的相位滞后预测。为了解决这些局限性,我们提出了MoFE,一种新型深度学习框架,它将傅里叶神经算子集成到混合专家架构中。基于随机微分方程的理论框架,MoFE将加密货币波动性概念化为多频率成分的叠加,这包括基于用户网络的基本增长、由挖矿成本和减半机制引起的季节性波动,以及由市场情绪引发的混沌。具体来说,专门的自适应傅里叶神经算子和卷积双域专家学习连续的函数到函数映射,以封装全局谱趋势、周期性调整和微观结构,而基于动态门控的混合专家机制使得在不同市场机制间进行自适应策略切换成为可能。在2020年1月至2025年12月的比特币数据集上进行的广泛实验表明,MoFE在T+1和T+5预测时间范围都实现了最先进的性能。值得注意的是,该模型有效减轻了相位滞后效应,提供了优越的方向准确性和信息系数。在高保真模拟交易环境中,这些预测优势转化为显著的超额回报和稳健的风险调整后表现,其特点是较高的夏普比率。

###### 索引术语:

加密货币预测、傅里叶神经算子、混合专家。

## I 引言

加密货币价格预测是计算金融中的一个关键前沿,正日益从启发式技术分析转向复杂的数据驱动机器学习范式。稳健的预测能力对于增强市场透明度以及为机构投资者和监管利益相关者提供明智决策基础至关重要。

与基于基本面收益的传统资产不同,加密货币由算法稀缺性和网络驱动的估值所支配——这种动态通常由符合梅特卡夫定律的基本增长引导,由挖矿成本和减半机制驱动的季节性波动,以及由市场情绪引发的混沌所建模。缺乏内在的估值锚点使得市场容易受到情绪驱动波动的影响,这常常使传统的均值回归框架失效。由于固有的非平稳性、突然的机制转换和多尺度随机性,开发稳健的预测模型仍然是一项艰巨的挑战。此外,与股票市场数个世纪的数据相比,加密货币相对短暂的历史导致了“数据稀缺”问题,尤其是在分析四年一度的“减半”事件等低频周期模式时。

加密货币价格预测领域已从启发式技术分析转向复杂的数据驱动机器学习范式。最初,经典的统计和集成框架利用历史惯性来建模市场趋势。同时,一些研究引入了基于情绪的方法,基于链上数据和社交媒体心理来量化超出内生价格行为的市场价值。然而,这些方法主要捕捉线性动态或非固有动态,通常不足以应对加密货币市场普遍的非平稳性。

最初,经典的统计框架(例如,ARIMA和GARCH)和集成模型利用历史惯性来建模市场趋势。

目前,深度表征学习定义了最先进的方法,利用非线性优化来解码复杂的依赖关系。这种演变涵盖了用于时间建模的循环神经网络,以及用于长程依赖性建模的Transformer和状态空间模型,后者旨在捕捉跨周期的随机波动。尽管取得了成功,但传统的深度学习模型主要通过回归最小化逐点统计误差。因此,它们常常无法内化市场的连续谱动态,导致显著的相位滞后和无法适应快速的机制转换。

许多现有方法主要优化逐点回归误差,这常常导致相位滞后和对快速市场机制转换的适应能力弱。此外,纯时域模型往往对高频市场噪声敏感,这在加密货币市场中尤为常见。

除了传统架构,傅里叶神经算子通过在频域学习连续的函数到函数映射重新定义了序列建模。值得注意的是,自适应傅里叶神经算子通过频率稀疏化优化了这一过程,允许进行对输入分辨率不变的连续全局卷积。频域混合专家方面的进一步进展在建模复杂的偏微分方程系统和非平稳时间序列方面表现出卓越的性能。受这些谱方法成功的启发,这项工作引入了一个受频域启发的混合专家-傅里叶神经算子框架。通过将加密货币波动性建模为多频率成分的叠加,我们的框架捕捉了数字资产固有的多尺度随机性,以提高收益率预测的准确性。

所提出的MoFE框架通过结合频域和时域建模来补充这些方法。全局傅里叶神经算子部分捕捉长程依赖性和周期性市场动态,而卷积分支则提取短期时间微观结构。

本研究的主要贡献如下:

- •我们设计了一个针对加密货币市场定制的新型混合专家-傅里叶神经算子框架,能够通过多专家分解和非线性优化建模非平稳波动性和突然的机制转换。
- •我们引入了一个自适应傅里叶神经算子-卷积双域算子,能够同时捕捉频域中的全局周期模式和时域中的瞬时局部微观结构,以解决金融数据的多尺度特性。
- •我们提出的模型MoFE在统计指标和金融指标上都实现了最先进的性能。高保真的回测显示了显著的风险调整后回报和稳健的预测一致性。

## II 相关工作

比特币作为去中心化加密货币的先驱,已成为全球金融市场中波动最大、受关注度最高的资产之一。与股票和债券等传统金融工具不同,比特币独立于中央货币当局运行,其估值受到市场流动性、挖矿成本、宏观经济变化和投资者情绪等因素复杂相互作用的影响。这种极端波动性、结构性不稳定性以及固有的非线性使得比特币价格预测异常困难。因此,建立一个稳健的预测框架对于提高市场透明度和为机构投资者及监管者提供严谨、数据驱动的决策基础至关重要。

关于加密货币预测的现有文献通常分为三个不同的范式。第一类是统计方法,其预测基于线性动态系统和随机过程——例如ARIMA和GARCH。这些模型在平稳性和历史自相关的强假设下运行。然而,这种方法本质上局限于捕捉局部或单变量特征。因此,这些传统架构通常无法同时解决高波动性市场中的全局频域模式和局部时间动态。第二类是基本面和情绪分析范式,试图通过链上网络采用指标(例如库存-流量模型)和行为指标来量化资产内在价值。这些方法的前提是信息传播和社交媒体讨论是随后价格波动的先行指标。

近年来,深度学习方法通过利用非线性优化来捕捉金融数据集中的高维依赖关系,建立了新的最先进的水平。循环神经网络变体,特别是长短期记忆网络和门控循环单元,采用复杂的门控机制来刻画时间动态。具体来说,门控循环单元架构通过将长短期记忆网络的遗忘门和输入门合并为一个更新门,提高了计算效率,通常在比特币波动性建模中促进更好的收敛性。除了循环范式,梯度提升框架(如XGBoost)在最小化平均偏差误差方面相对于传统的长短期记忆网络表现出竞争力。最近,基于自注意力的Transformer架构通过利用全局长程依赖关系取得了显著的性能提升。尽管取得了这些进展,一个根本性的限制仍然存在:这些主要属于时域的模型——包括长短期记忆网络和Transformer——对高频噪声高度敏感,这常常掩盖了加密货币市场固有的潜在低频趋势。此外,最近的研究强调,仅依赖传统逐点回归损失函数的模型容易出现结构性相位滞后,从而无法在数字资产极端非平稳性下捕捉特定机制的动态。虽然像Smamba和CryptoMamba这样的当代创新试图通过增强结构泛化能力来缓解这些问题,但无法在频域中解耦复杂动态仍然是实现稳健泛化的一个关键障碍。然而,它们在非平稳波动性存在时常常难以进行多尺度特征提取。

频域方法,如傅里叶分析和傅里叶神经网络,通过利用谱表示固有的时间-频率对偶性,在时间序列预测中显示出显著的有效性。与此同时,混合专家框架通过专门专家的动态协调推动了金融预测建模。虽然像FreqMoE这样的混合架构已成功地将傅里叶神经算子与混合专家结合,用于解决复杂的偏微分方程系统,但混合专家驱动的专家协作与基于傅里叶神经算子的函数到函数映射在加密货币市场背景下的协同应用基本上尚未被探索。因此,在利用这些结合范式来解决数字资产动态中固有的普遍非平稳性、突然机制转换和多尺度随机性挑战方面,存在一个显著的研究空白。

## III 方法论

### III-A 架构概述

参见标题图1:MoFE模型的整体架构。输入特征在专家内部通过并行的全局和局部路径处理,并由门控网络动态加权。
所提出的MoFE模型的架构如图1所示。该过程从一个包含线性层的主干块开始,该线性层将输入数据序列投影到维度为d_model的高维潜在空间中。随后,这些特征由K个并行专家和一个门控网络同时处理。每个专家被设计为一个时-频双域特征提取模块。具体来说,全局傅里叶神经算子路径采用自适应傅里叶神经算子,通过频域中的稀疏多层感知机捕捉全局周期性波动特征,而局部上下文路径利用n×1卷积(例如,n=3)在时域中提取局部微观结构特征。同时,门控网络通过多层感知机和Softmax层回归专家权重。然后,这些权重通过批量矩阵乘法应用于专家输出,以动态重新加权它们的贡献。最后,聚合的特征通过一个Pr

相似文章

Transformer 中的专家混合模型 (MoEs)

Hugging Face Blog

Hugging Face 的博客文章,介绍 Transformer 中的专家混合模型 (MoEs) 架构,涵盖从密集模型到稀疏模型的转变、权重加载优化、专家并行计算以及基于 MoE 的语言模型训练技术。

用于交通预测的图条件图神经网络专家混合模型

arXiv cs.LG

提出了GC-MoE,一种用于交通预测的图条件专家混合框架,该框架根据图拓扑和近期输入为每个节点分配个性化的冻结预训练时空图神经网络专家组合,仅训练一个轻量级路由模块(约1.7万个参数),并在四个基准数据集上取得了有竞争力的性能。