一种基于GAN的卫星互联网观测数据鲁棒合成框架

arXiv cs.AI 论文

摘要

提出了一种基于GAN的框架(GT-GAN),用于从不完整的LEO卫星互联网观测中合成高保真数据,即使在40%数据缺失的情况下也表现出鲁棒性。

arXiv:2607.24790v1 公告类型:新 摘要:低地球轨道(LEO)卫星互联网已成为实现无处不在连接的重要基础设施,以符合国际电信联盟对6G电信网络的愿景。然而,当前的LEO卫星互联网观测常因数据缺失而受影响,这复杂化了数据增强任务并限制了代表性数据集的扩展。鉴于这些数据集的复杂特性,生成式人工智能(GenAI)提供了一种有前景的方法,但迄今为止在该领域的应用鲜受关注。本文提出了一种基于GenAI的框架,可直接从不完整的LEO网络观测中合成高保真数据。我们提出了代表性的数据缺失场景,并利用最新的基于GAN和VAE的GenAI模型在近期WetLinks数据集上评估了性能。我们设计了块缺失和点缺失场景,以紧密模拟真实世界LEO卫星网络中发生的数据丢失。结果表明,我们提出的基于GAN的框架是有效的,且GT-GAN模型在两种缺失场景下均表现出最佳性能。即使在极端条件下(例如,40%的输入数据缺失),GT-GAN也展现出最高的鲁棒性,始终能够捕捉底层输入数据分布,并且受泛化影响最小。我们的结果为未来基于GenAI的数据增强方法以及卫星网络测量的数据驱动研究指明了方向。
查看原文
查看缓存全文

缓存时间: 2026/07/29 09:52

# 基于GAN的鲁棒数据合成框架用于卫星互联网观测

来源:https://arxiv.org/html/2607.24790  
Xiang Shi 和 Peng Hu  
邮箱:[email protected], [email protected]  
本研究感谢加拿大自然科学与工程研究委员会(NSERC)[资助编号 RGPIN-2022-03364] 以及 Manitoba 研究基金的支持。

###### 摘要

低地球轨道(LEO)卫星互联网已成为实现无处不在连接的重要基础设施,与国际电信联盟对 6G 电信网络的愿景相契合。然而,当前的 LEO 卫星互联网观测常因数据缺失而受损,这使数据增强任务复杂化,并限制了代表性数据集的扩展。考虑到这些数据集的复杂特性,生成式 AI(GenAI)提供了一种有前景的方法,但迄今为止,其在此领域的应用尚未引起足够关注。本文提出一个基于 GenAI 的框架,可直接从不完整的 LEO 网络观测中合成高保真数据。我们提出了代表性的数据缺失场景,并在最新的 WetLinks 数据集上,使用最新的基于 GAN 和 VAE 的 GenAI 模型评估了性能。我们设计了块状缺失和点状缺失场景,以紧密模拟真实 LEO 卫星网络中发生的数据丢失情况。结果表明,我们提出的基于 GAN 的框架是有效的,并且 GT-GAN 模型在两种缺失场景中都表现出最佳性能。即使在极端条件下(例如输入数据缺失 40%),GT-GAN 仍表现出最高的鲁棒性,能够稳定捕获底层输入数据分布,并且在泛化能力方面受影响最小。我们的结果揭示了基于 GenAI 的数据增强方法以及卫星网络测量数据驱动研究的未来方向。

###### 关键词:

生成对抗网络、机器学习、LEO 卫星互联网、网络测量、数据增强。

©2026 IEEE。允许个人使用此资料。所有其他用途,包括在任何当前或未来媒体中转载/重新发布此资料用于广告或促销目的、创建新的集体作品、转售或重新分发到服务器或列表、或在其他作品中重复使用本作品的任何受版权保护的组件,均需获得 IEEE 许可。

## I. 引言

低地球轨道(LEO)卫星互联网已成为实现无处不在连接的重要基础设施,符合国际电信联盟(ITU)对 6G 电信网络的愿景。近年来,针对卫星互联网的测量工作 [1](https://arxiv.org/html/2607.24790#bib.bib1)、[2](https://arxiv.org/html/2607.24790#bib.bib2)、[3](https://arxiv.org/html/2607.24790#bib.bib3)、[4](https://arxiv.org/html/2607.24790#bib.bib4) 在研究界获得了越来越多的关注,这些工作有助于探索数据、性能模式以及向全球不同地区提供的互联网服务的洞察和规律。

尽管这些测量数据集为亟需的 LEO 卫星互联网数据驱动研究提供了宝贵机会,但仍存在几个基本挑战。首先,现有的测量通常规模有限且在地理上稀疏,这阻碍了分析结果向无直接观测区域的泛化。其次,在不同地区收集的数据集可能在时间段和实验配置上存在差异,从而导致不一致性。第三,测量通常依赖于测量基础设施的理想运行条件(例如,无中断的持续互联网服务、卫星用户终端、天线及相关网络设备),而这些条件容易随时间发生故障或中断。这些挑战可能导致数据样本缺失或不完整,从而危及基于此类数据集的后续数据分析或机器学习(ML)模型的有效性和鲁棒性。

我们对近期真实 LEO 卫星测量数据集(即 WetLinks [2](https://arxiv.org/html/2607.24790#bib.bib2) 和 LENS [1](https://arxiv.org/html/2607.24790#bib.bib1))的分析证实了数据缺失现象的存在。具体来说,在 5.5 个月的测量期内,我们在 WetLinks 数据集中识别出 44 个不同的数据缺失事件。缺失范围从 33 个单点缺失(即单个时间点数据丢失)到连续多个数据丢失,极端情况下达到 51,570 个连续缺失点。

在增强真实世界测量数据时,处理缺失观测是一个必要考虑因素。虽然传统技术如插值法或统计插值方法可以成功填充上下文一致的值以使数据集完整,但它们仅专注于填补空缺,而非生成用于增强任务所需的高保真合成数据。基于机器学习的生成模型通过捕获时间和地理区域上的复杂依赖关系,增强了鲁棒性。这些模型能够识别和建模隐藏模式,从而比传统统计技术更准确地重建原始数据,但重建数据仅关注局部模式,无法生成多样性数据。在此基础上,生成式 AI(GenAI)方法,如变分自编码器(VAE)、生成对抗网络(GAN)和扩散模型,可以直接从不完整的观测中学习底层数据分布。这些模型不仅仅是填补空缺,而是能够合成高保真、完整的合成数据,以促进数据增强。它们对于稀疏、不规则和高维数据尤其有效,因此即使在训练源不完整的情况下,也十分适合用于鲁棒的合成数据生成。

然而,几乎没有工作使用 GenAI 方法来解决 LEO 卫星网络测量中的不完整数据问题。现有工作主要集中在基于 GAN 的通用模型实现 [5](https://arxiv.org/html/2607.24790#bib.bib5)、[6](https://arxiv.org/html/2607.24790#bib.bib6)、[7](https://arxiv.org/html/2607.24790#bib.bib7)、[8](https://arxiv.org/html/2607.24790#bib.bib8)、[9](https://arxiv.org/html/2607.24790#bib.bib9),而基于 VAE 的模型 [10](https://arxiv.org/html/2607.24790#bib.bib10)、[11](https://arxiv.org/html/2607.24790#bib.bib11) 和基于扩散的方法 [12](https://arxiv.org/html/2607.24790#bib.bib12) 在学习底层时间序列分布方面也展现出强大潜力。此外,循环神经网络(RNN)相关模型 [13](https://arxiv.org/html/2607.24790#bib.bib13) 也被用于类似任务。然而,在这些 GenAI 框架中,GAN 特别适合 LEO 网络数据,因为它们能够对复杂、高维的时间依赖关系进行建模。与通常产生过于平滑结果的 VAE 不同,GAN 利用生成器和判别器之间的竞争训练过程,这使得 GAN 能够捕获输入时间序列中的更精细细节和更深层分布。因此,我们提出一个基于 GAN 的框架,直接从部分观测中合成高保真的 LEO 卫星网络数据,为后续的数据驱动研究和网络建模提供鲁棒基础。本文的主要贡献总结如下:

- • 我们提出了一个基于 GAN 的框架,用于解决日益增长的卫星互联网测量中的缺失数据问题。
- • 我们提出了贴合实际的缺失场景,可复现常见卫星互联网测量数据集中连续块状和随机点状数据缺失的情况。
- • 我们基于最先进的 GenAI 模型(即 GT-GAN、SeriesGAN 和 Temporal VAE)评估了该框架,并表明 GT-GAN 在泛化能力和鲁棒性方面取得了最佳性能。

本文组织结构如下:第二节回顾相关工作并论证我们的方法和研究目标;第三节阐述问题陈述和方法论;第四节讨论评估结果;第五节给出结论性意见和未来工作。

## II. 相关工作

近期,GenAI 方法展现出了巨大的潜力。与传统统计方法或确定性模型相比,通过学习不完整数据的底层分布,这些模型能够生成逼真且上下文一致的合成数据。此外,基于 GenAI 的方法非常适合处理稀疏和不规则数据,这与地理分布的测量数据自然契合。通过有效捕获非线性和高维关系,它们为处理不完整数据集提供了一种有前景的解决方案。

GAN 框架由 Goodfellow 等人 [5](https://arxiv.org/html/2607.24790#bib.bib5) 于 2014 年提出。自那时起,研究人员一直致力于持续优化该框架并创新其架构,在多个领域取得了显著进展。特别是在时间序列任务方面,涌现了一系列杰出工作。例如,Morgan 等人 [6](https://arxiv.org/html/2607.24790#bib.bib6) 于 2016 年提出了 C-RNN-GAN 模型。该模型利用原始 GAN 框架学习时间序列数据的分布,并有目的地生成新数据。生成器和判别器均利用 LSTM 来解决模型中的长期记忆问题。类似地,Smith 等人提出了 RCGAN [7](https://arxiv.org/html/2607.24790#bib.bib7),除了在生成器和判别器中引入概率外,还能在特定条件下生成适当的数据。2019 年,Yoon 等人提出了另一个杰出模型,名为 TimeGAN [8](https://arxiv.org/html/2607.24790#bib.bib8)。该模型集成了编码器-解码器框架,以确保稳定、高质量的训练。此外,GT-GAN 模型 [9](https://arxiv.org/html/2607.24790#bib.bib9) 也在 GAN 外部引入了自编码器,以提高训练和生成质量。除此之外,GT-GAN 主要解决了从不完整训练数据集中生成高保真合成数据的问题,而无需更改模型。除了 GANs,几种深度学习框架在时间序列领域也表现出了强大性能。例如,Kingma 等人 [10](https://arxiv.org/html/2607.24790#bib.bib10) 引入了 VAE,它学习输入数据的潜在空间分布,以重建高保真的假样本。与 GANs 不同,VAEs 提供了更稳定的训练过程和更简单的损失函数(即重构损失)。最后,基于扩散的框架 Diffusion-TS [12](https://arxiv.org/html/2607.24790#bib.bib12) 在多变量时间序列生成方面表现出了出色性能。它利用编码器-解码器 Transformer 来捕获复杂的序列信息。与传统的扩散模型(向数据添加噪声,然后从噪声中预测数据)不同,Diffusion-TS 直接重构数据样本,并使用基于傅立叶的损失函数来确保生成样本的真实性和可解释性。

近期研究已证明了 GenAI 在时间序列数据增强方面的潜力。值得注意的是,TS-GAN [14](https://arxiv.org/html/2607.24790#bib.bib14) 通过结合 LSTM 和 GAN 框架,在生成高度逼真的合成时间序列数据方面,已在医学领域取得了显著成功。类似地,GenAI 也被证明有益于金融数据增强。例如,Dogariu 等人 [15](https://arxiv.org/html/2607.24790#bib.bib15) 提出了一种混合生成模型,该模型适应各种网络架构,以应对学习金融数据中复杂模式和互相关性的挑战。此外,Tang 等人 [16](https://arxiv.org/html/2607.24790#bib.bib16) 通过优化 TimeGAN 模型增强了能耗时间序列数据,从而提高了混合 CNN-GRU 模型的预测能力。据作者所知,目前尚无研究涉及如何利用 GenAI 方法来增强 LEO 卫星网络数据,特别是在数据集不完整的情况下。

## III. 问题陈述与方法论

为填补当前的研究空白,我们提出了一个基于 GAN 的框架,以检验现有模型是否能捕获 LEO 网络测量数据中深层且复杂的分布,并从不完整数据集中生成高保真合成数据。为此,我们的方法论由四个部分组成。首先,我们提出两种经验性的缺失数据场景(即块状缺失和点状缺失),以复现现实世界中的观测情况。其次,我们详细介绍了实验中使用的生成模型,包括基于 GAN 和基于 VAE 的架构。第三,我们利用 Yoon 等人 [8](https://arxiv.org/html/2607.24790#bib.bib8) 提出的多维评估协议,评估每个模型生成的合成数据的质量。最后,根据我们设计的训练流程,深入进行实验。

### III-A 提出的缺失场景

基于观察到的真实世界数据缺失现象,我们设计了两种不同的场景来评估模型。第一种场景是块状缺失,它模拟了由 Starlink 天线或卫星在系统更新期间引起的短暂连续数据丢失,导致时间序列中出现连续空白。第二种是点状缺失,代表特定时间点上的随机数据丢失,此时所有特征均不可用。这一设计也基于对代表性卫星网络测量数据集的真实调查。以 WetLinks 数据集为例,我们识别出 44 个数据缺失实例。这些缺失的范围从 33 个单点空白(即点状缺失)到多个连续空白(即块状缺失),包括六个两个连续数据点缺失的空白,以及若干跨越两个以上数据点的空白,极端情况多达 51,570 个连续空白。通过复现这些观察到的真实缺失模式,我们可以在部分输入数据缺失时,有效模拟并评估模型合成数据的质量。

块状缺失场景用于评估当卫星网络数据集中连续数据丢失时,模型生成的合成数据的质量。原始数据集被划分为若干个固定长度为LL的滑动窗口。对于数据点序列X=x1,x2,...,xLX=\{x_1, x_2, ..., x_L\},我们定义一个掩码向量M=m1,m2,...,mLM=\{m_1, m_2, ..., m_L\},其中mi∈{0,1}m_i \in \{0,1\} 表示数据是否缺失。每个窗口的前kk个观测值被掩码,其中k∈{5,10,20,40}k \in \{5,10,20,40\} 表示不同规模的缺失观测值。形式化定义如下:

m_i = 
\begin{cases} 
0, & (1 \leq t \leq k) \\
1, & (k < t \leq L)
\end{cases}
\text{,其中 } k \in \{5,10,20,40\} \quad (1)

点状缺失场景用于模拟传感器或系统中断,即在特定时间点丢失所有特征。在此设计中,缺失性仅取决于时间索引tt。对于每个时间步,掩码值mtm_t从伯努利分布中抽取,其中每个元素的掩码定义为M(t,i)=mtM(t,i)=m_t

相似文章

Sat3DGen:基于单张卫星图像的全面街景级3D场景生成

Hugging Face Daily Papers

Sat3DGen采用几何优先的方法,从单张卫星图像生成街景级3D场景,通过新颖的约束条件和训练策略,提高了几何精度和照片级真实感。该方法在VIGOR-OOD基准测试上相比先前工作有显著改进。

通过同质-异质分割的合成图像生成后策展

arXiv cs.LG

本文提出了一种与生成器无关的生成后策展方法,通过将真实类别拆分为规范的同质子集和无冗余的异质子集,并基于保真度-多样性准则对合成图像进行评分,从而选取信息丰富的合成图像子集。该方法持续优于现有的数据选择基线,并且在合成样本数量减少多达40%的情况下,仍能达到与真实数据相当的性能。

高效数据合成的一个信息论准则

arXiv cs.LG

本文从信息论角度解释了合成数据何时会改善或降低LLM训练效果,区分了信息开放和信息封闭的生成循环,并通过数据处理不等式解释了模型崩溃的原因。