从纯合成数据学习时空基础模型
摘要
本文提出了NeoST,这是第一个仅在程序化生成的合成数据上预训练的时空基础模型。它引入了一种潜空间推理架构,能够生成并迭代优化多个未来轨迹,在真实世界基准测试中优于现有的STFMs。
arXiv:2607.16251v1 Announce Type: new
摘要:时空基础模型(STFMs)旨在学习跨空间和时间的复杂动态系统的通用表示。然而,现有方法受限于真实世界预训练数据中的分布偏差、自回归或扩散范式的结构瓶颈,以及在噪声观测空间中过度强调逐点重构的目标。我们提出\textbf{NeoST},这是第一个仅在程序化生成的合成系统上预训练的时空基础模型。NeoST引入了一个可扩展的合成预训练语料库以缓解真实世界偏差,一个潜空间推理架构,能够生成并迭代优化多个未来轨迹而无需顺序误差累积,以及强调结构动力学的潜空间目标,从而在分布偏移下实现推理时校正。在多种真实世界基准测试上的大量实验表明,NeoST在多种真实世界时空系统中持续优于现有STFMs,实现了更优的长周期稳定性和推理效率。
查看缓存全文
缓存时间: 2026/07/21 06:47
# 从纯合成数据学习时空基础模型
来源:https://arxiv.org/html/2607.16251
Yutong Feng12, Shiyuan Piao3, Yutong Xia2, Xu Liu2, Wenqi Fan4, Fugee Tsung3, See\-Kiong Ng2, Yuxuan Liang1
1香港科技大学(广州)2新加坡国立大学3香港科技大学4香港理工大学
ytfeng\.caspian@163\.com; shiyuan\.piao@connect\.ust\.hk
yuxliang@outlook\.com
工作完成于香港科技大学(广州)。Y. Liang为通讯作者。邮箱:yuxliang@outlook\.com
###### 摘要
时空基础模型(STFMs)旨在学习复杂动力系统在空间和时间上的可泛化表征。然而,现有方法面临真实世界预训练数据中的分布偏差、自回归或扩散范式的结构瓶颈,以及在噪声观测空间中过度强调逐点重建的目标函数等挑战。我们提出NeoST,这是首个仅基于程序生成的合成系统进行预训练的时空基础模型。NeoST引入了一个可扩展的合成预训练语料库以减轻真实世界偏差,一种潜在空间推理架构——生成并迭代优化多个未来轨迹而无需顺序误差累积,以及强调结构动力学并能在分布偏移下实现推理时校正的潜在空间目标函数。在 diverse 真实世界基准上的大量实验表明,NeoST在多样化的真实世界时空系统中持续优于现有STFMs,实现了更优的长程稳定性和推理效率。
## 1 引言
时空基础模型(STFMs)[29 (https://arxiv.org/html/2607.16251#bib.bib1),10 (https://arxiv.org/html/2607.16251#bib.bib3),14 (https://arxiv.org/html/2607.16251#bib.bib2)] 是大型预训练模型,它们从多样且异构的时空数据中学习时空依赖关系的可泛化表征,使得单个统一骨干网络能够通过零样本或轻量自适应方式支持多个跨领域下游任务。与传统的针对每个数据集和目标独立训练的任务特定时空模型[19 (https://arxiv.org/html/2607.16251#bib.bib4)]不同,STFMs旨在将空间和时间的通用结构先验提炼为可扩展的参数化形式,将范式从“每任务一模型”的工程转变为基础层面的表征学习。STFMs统一了碎片化的建模范式,实现了标签高效的跨域迁移,并在分布偏移下实现鲁棒泛化。此外,通过提炼复杂动态系统[11 (https://arxiv.org/html/2607.16251#bib.bib5)]的结构演化,STFMs为数据驱动的世界模型[41 (https://arxiv.org/html/2607.16251#bib.bib7),59 (https://arxiv.org/html/2607.16251#bib.bib6)]建立了关键基础。
尽管前景广阔,但STFMs的发展在整个建模流程中面临根本性挑战,首先从可用训练数据的质量和多样性开始[10 (https://arxiv.org/html/2607.16251#bib.bib3)]。在特定真实世界数据集上预训练的模型往往会过拟合到那些特定传感器部署的独特拓扑结构和时间节奏,从而阻碍了其对未见场景的泛化能力。这种不平衡在预训练期间引入了强烈的分布偏差,导致模型过拟合领域特定模式,并在迁移到代表性不足的系统时表现不佳。此外,真实世界时空数据常受传感器噪声、不规则采样和大量缺失值困扰[46 (https://arxiv.org/html/2607.16251#bib.bib12)]。这些缺陷不仅降低了表征质量,还将系统固有动力学与测量伪影纠缠在一起,使得STFMs难以提取清晰且通用的时空结构先验。
除了数据限制,当前的STFMs主要建立在自回归[28 (https://arxiv.org/html/2607.16251#bib.bib8),5 (https://arxiv.org/html/2607.16251#bib.bib13),31 (https://arxiv.org/html/2607.16251#bib.bib14)]或基于扩散的范式[54 (https://arxiv.org/html/2607.16251#bib.bib15),53 (https://arxiv.org/html/2607.16251#bib.bib16),48 (https://arxiv.org/html/2607.16251#bib.bib17),17 (https://arxiv.org/html/2607.16251#bib.bib18)]之上,每种范式都引入了结构瓶颈。自回归模型顺序生成未来状态,每个预测都依赖于先前生成的输出。虽然概念上直接,但这种范式容易出现误差累积:早期预测错误会在长时间范围内传播并放大,阻碍稳定的长期预测,并限制模型进行全局推理和修正的能力。基于扩散的模型通过迭代去噪建模复杂分布,缓解了部分顺序依赖问题,但它们通常在推理时需要数十到数百个采样步骤。这种计算开销在时间敏感场景(如灾害响应或实时城市管理)中是不可接受的,因为这些场景需要快速且可靠的预测。
训练目标和推理范式进一步带来了挑战[10 (https://arxiv.org/html/2607.16251#bib.bib3)]。时空信号在原始时域中往往表现出稀疏或弱语义,逐点损失[18 (https://arxiv.org/html/2607.16251#bib.bib19)]鼓励模型关注局部波动,而忽略了趋势、周期性和潜在动力学机制[7 (https://arxiv.org/html/2607.16251#bib.bib20),22 (https://arxiv.org/html/2607.16251#bib.bib21)]等全局结构。因此,直接在观测空间中优化可能会使模型偏向短期保真度,而非结构理解。此外,大多数现有STFMs缺乏有效的测试时自适应能力。当面对分布偏移(如源于季节变化、政策干预或传感器重新部署)时,这些模型通常将观测到的输入序列视为固定上下文,而不显式建模或修正偏移。在推理时无法利用新到达的观测来重新校准预测,严重限制了其在开放世界中的鲁棒性和泛化能力。
参见标题
图1:范式对比:NeoST vs. 近期STFM。
为应对这些挑战,我们提出NeoST,这是首个仅基于合成时空数据进行预训练的时空基础模型。我们的主要贡献可总结为以下三个方面:
- •在**数据**方面,我们摒弃了传统上对大规模但有偏的真实世界数据集的依赖,转而构建一个规模几乎无限、多样性可控的合成预训练语料库。通过程序生成覆盖广泛动力学范围、噪声水平和结构模式的时空系统,我们减轻了分布偏差,并避免了低质量预训练数据中缺失值和测量噪声的有害影响。
- •在**架构**方面,我们为STFMs提出了一种潜在空间推理范式,取代了主流的自回归和基于扩散的公式。我们的模型直接在潜在空间中生成多个候选未来轨迹,并通过补丁级和轨迹级修正机制进行迭代优化。通过将推理与逐步生成解耦,NeoST能够在固定计算预算下对替代未来进行更深入的思考。
- •在**训练与推理**方面,NeoST在潜在空间而非原始时域中计算损失。这种方法鼓励模型学习和推理时空系统的底层演化动力学和结构模式,而非仅仅拟合表层的数值细节。此外,潜在推理过程自然支持基于观测输入的推理时修正,增强了在分布偏移下的鲁棒性。
## 2 相关工作
大规模预训练在自然语言处理中的成功启发了时间序列和时空数据领域的类似工作[20 (https://arxiv.org/html/2607.16251#bib.bib36),39 (https://arxiv.org/html/2607.16251#bib.bib54)]。时间序列基础模型(TSFMs)[28 (https://arxiv.org/html/2607.16251#bib.bib8)],如TimesFM[8 (https://arxiv.org/html/2607.16251#bib.bib37)]、Chronos[1 (https://arxiv.org/html/2607.16251#bib.bib38)]、Moirai[50 (https://arxiv.org/html/2607.16251#bib.bib39),35 (https://arxiv.org/html/2607.16251#bib.bib40),32 (https://arxiv.org/html/2607.16251#bib.bib41)]、UniTime[34 (https://arxiv.org/html/2607.16251#bib.bib42)]、MOMENT[15 (https://arxiv.org/html/2607.16251#bib.bib43)]和Time\-MOE[44 (https://arxiv.org/html/2607.16251#bib.bib44)],将多个预测任务整合到单个预训练骨干网络中,展示了基础规模时间表征学习的可行性。然而,这些模型忽略了真实世界系统中存在的丰富的空间结构。
新兴的STFMs将这一范式扩展到空间解析领域[29 (https://arxiv.org/html/2607.16251#bib.bib1),14 (https://arxiv.org/html/2607.16251#bib.bib2)]。OpenCity[27 (https://arxiv.org/html/2607.16251#bib.bib46)]集成了Transformer-GNN混合模型,并在异构交通数据集上预训练,以实现零样本城市预测。UniST[56 (https://arxiv.org/html/2607.16251#bib.bib45)]引入了知识引导的提示,用于在少样本和零样本设置下进行统一的城市时空预测。UrbanGPT[26 (https://arxiv.org/html/2607.16251#bib.bib48)]将时空编码器与LLM提示相结合,用于在有限监督下进行基于指令的空间推理。在气候科学领域[30 (https://arxiv.org/html/2607.16251#bib.bib10),12 (https://arxiv.org/html/2607.16251#bib.bib11)],如Pangu\-Weather[6 (https://arxiv.org/html/2607.16251#bib.bib51)]和ClimaX[38 (https://arxiv.org/html/2607.16251#bib.bib52)]等模型将大型Transformer架构应用于全球再分析数据,实现了跨物理领域的时空通用性。
尽管前景广阔,现有STFMs存在共同的局限性:它们依赖有领域偏差和噪声的真实世界数据,采用易出错的顺序自回归解码或计算密集的扩散采样,并在观测空间中直接优化而缺乏结构抽象。相关工作的扩展版本见附录A (https://arxiv.org/html/2607.16251#A1)。
## 3 合成时空数据
我们通过显式参数化定义在图G=\(V,E\)(\|V\|=N)上的一族随机图动力系统来构建合成数据引擎。设A∈R^N×N为邻接矩阵,L为相应的归一化图拉普拉斯矩阵。在每个时间步t,潜在动力学状态表示为H_t∈R^N×d_h,其中d_h表示潜在通道维度。可观测信号x_t∈R^N通过对H_t的随机线性投影获得,而潜在状态本身在训练期间完全可访问。进一步分析见附录B (https://arxiv.org/html/2607.16251#A2)。
参见标题
图2:合成数据流水线。
**图采样与算子构建。** 为促进结构多样性,图拓扑从随机图族中动态采样,包括Erdős–Rényi和泊松度模型。添加自环以稳定谱。给定A,我们计算归一化拉普拉斯矩阵L = I − D^{−1/2} A D^{−1/2},其中D是度矩阵。为以原则性方式建模空间交互,我们利用重新缩放拉普拉斯矩阵的切比雪夫多项式。设L̂为谱归一化拉普拉斯矩阵,定义T_1 = L̂,T_2 = 2L̂^2 − I。这些算子提供了局部化但表达力强的谱滤波器,无需在序列生成过程中进行特征分解。为确保尺度泛化,我们从广泛分布中动态采样系统配置,包括图大小N、潜在维度d以及时间范围(T, L),使模型暴露于高度异构的空间尺度和时间区间。
**随机潜在动力学。** 时间演化遵循随机递归:
H_{t+1} = a H_t + μ(H_t, H_{t-1}, A) + σ(H_t, H_{t-1}, A) ⊙ ε_t + b, (1)
其中a ∈ (0,1)控制系统耗散,ε_t ∼ N(0, I)引入随机激励,b是样本级偏置项,⊙表示逐元素乘法。漂移项μ和扩散项σ参数化为:
μ(·) = tanh([T_1 H_t ∥ T_2 H_{t-1}] W_1) W_2, σ(·) = sigmoid([T_1 H_t ∥ T_2 H_{t-1}] W_3), (2)
其中W_1, W_2, W_3 ∈ R^{d_h×d_h}是生成器的可学习参数,[·∥·]表示通道级拼接。该公式将一阶和二阶谱响应与非线性变换耦合,产生丰富的时空行为,包括类似扩散的平滑、振荡传播和随机扰动。值得注意的是,生成器参数为每个样本随机初始化,从而产生动力系统分布而非单个固定模拟器。因此,预训练语料库覆盖了具有异构谱特性和稳定性区间的图耦合随机过程的广泛流形。
**观测生成。** 可观测信号通过随机线性投影获得:x_t = H_t w,其中w ∈ R^d按实例采样。该投影引入了部分可观测性,模拟了真实世界中从高维潜在状态捕获低维测量的感知过程。为近似真实数据的不完美性,同时保持对生成机制的完全控制,我们以可控比率随机掩码X_{1:T}中的条目。由于这些损坏是外部施加的且独立于底层动力学,模型原则上可以将内在演化模式与观测伪影分离开。
**输出增强。** 为弥合理想合成信号与不完美真实相似文章
地理空间基础模型的新兴范式:从预训练到智能体推理
本文综述了地理空间基础模型(GeoFMs)的新兴范式,这些模型在海量地理空间数据集上进行预训练,以实现对卫星和航空影像的快速微调和零样本分析。内容涵盖范式转变、模型适配策略,以及以大语言模型(LLMs)为编排器的智能体地理空间推理的前瞻性愿景。
VGenST-Bench:通过主动视频合成进行时空推理的基准测试
VGenST-Bench是一个基准测试,利用生成模型主动合成受控的时空推理场景,配备多智能体流水线和人工质量控制,用于评估多模态大语言模型。
使用零样本时间序列基础模型进行功能MRI和合成信号的预测与因果关系分析
本文介绍了一种零样本时间序列基础模型,应用于功能MRI与合成信号的预测和因果关系分析。
用于时间序列预测的仅解码器基础模型
本文介绍了一篇关于时间序列基础模型(TimeFM)的研究论文,这是一种仅解码器模型,通过借鉴大型语言模型技术,在多样化的时间序列数据集上实现了近乎最佳的零样本性能。
嵌套时空时间序列预测
本文提出一种嵌套时空预测框架,利用谱聚类构建语义一致的宏观区域,为细粒度的微观预测提供自上而下的指导。在高维数据集上的实验表明,该方法始终优于最先进的基线模型。