一种基于VAE的多任务卫星辅助语义通信框架,用于支持6G的互联自动驾驶汽车
摘要
提出了一种基于VAE的多任务语义通信框架,用于卫星辅助自动驾驶,在保持交通标志重建和分类性能的同时,实现了显著的带宽压缩。
arXiv:2607.13494v1 公告类型:新
摘要:智能交通系统的发展和6G无线通信技术的引入显著改变了车辆网络拓扑。未来的互联自动驾驶汽车(CAV)网络需要带宽高效、可靠和低延迟的通信,用于交通标志识别和决策等安全关键应用。传统通信系统无论任务相关性如何都传输原始数据,这在资源受限的卫星信道中效率低下,因为上行带宽稀缺且传播损耗大。语义通信通过传输任务相关信息而非完整信号表示来解决这一限制。它提取并传递关键语义特征,利用深度学习优化接收端的任务性能。因此,我们提出了一种基于变分自编码器(VAE)的多任务语义通信框架,用于卫星辅助自动驾驶。与确定性自编码器方法不同,所提模型使用概率潜在表示实现更鲁棒、更高效的编码。学习到的特征通过有噪声的无线信道传输,以执行交通标志重建和分类。该框架以端到端方式训练,以联合优化两个任务。结果表明,所提方法实现了高达87.23\%至98.17\%的显著带宽压缩,同时在不同信噪比条件下保持稳定性能。
查看缓存全文
缓存时间: 2026/07/16 04:22
# 一种基于VAE的多任务卫星辅助语义通信框架,用于6G支持的网联自动驾驶车辆
来源:https://arxiv.org/html/2607.13494
###### 摘要
智能交通系统的发展与6G无线通信技术的引入,显著改变了车辆网络拓扑结构。未来的网联自动驾驶车辆(CAV)网络需要在带宽高效、可靠且低时延的通信下,支持交通标志识别与决策等安全关键应用。传统通信系统无论任务相关性如何,均传输原始数据,这在资源受限的卫星信道中效率低下——上行链路带宽稀缺且传播损耗巨大。语义通信通过仅传输与任务相关的信息而非完整的信号表示,克服了这一局限。它提取并传达关键的语义特征,并利用深度学习优化接收端的任务性能。为此,我们提出了一种基于变分自编码器(VAE)的多任务语义通信框架,用于卫星辅助的自动驾驶。与基于确定性自编码器的方案不同,所提模型采用概率性潜在表示,以实现更鲁棒、更高效的编码。学习到的特征通过含噪无线信道传输,用于交通标志的重建与分类。该框架进行端到端训练,联合优化两个任务。结果表明,所提方法在不同信噪比条件下,能够实现高达87.23%至98.17%的带宽缩减,同时保持稳定的性能。
## I. 引言
乡村或灾区的自动驾驶车辆日益依赖卫星通信来共享关键数据。当发送方车辆检测到一个交通标志时,它不仅需要传输图像本身,还需要传输可操作的语义信息,以便接收方车辆实时识别该标志。这一过程因卫星带宽有限、传播损耗以及衰落和噪声等信道问题而变得困难。传统方法将压缩、调制和推理分离,传输像素级数据而不考虑接收方的需求,效率低下。在语义通信中,学习紧凑的表示以保留与任务相关的信息。联合源信道编码(JSCC)的开创性工作表明,传输与接收的端到端训练隐式考虑了信道效应。大多数研究集中于单任务问题,例如重建和分类[1,2,4,5]。关于联合任务学习的研究较少,且现有研究通常使用均方误差(MSE)进行重建[3]。
虽然MSE方便,但在感知质量上存在局限。最小化逐像素平方误差的解码器往往产生模糊的输出,在多个可能的重建中取平均而非选择明确的选项。这对于交通标志图像尤其成问题,因为精确的几何形状对区分相似类别至关重要。字符或形状之间的模糊边界会降低图像质量以及用于有效分类的判别信号,因为解码器和分类器都依赖于相同的潜在向量。
本文提出了一种基于VAE的多任务语义通信框架,用于卫星辅助的车联网,其中用组合感知损失(结合MSE、结构相似性SSIM和图像梯度项)替代了仅使用MSE的重建。一个具有残差细化子网络的双分支解码器恢复了被通信瓶颈抑制的细节,而在测试时采用确定性推理策略(用后验均值替代随机采样),在保持概率训练优势的同时稳定了重建质量。主要贡献如下:
- •我们提出了一种面向网联自动驾驶车辆的卫星辅助语义通信框架,通过使用任务导向的特征编码替代原始像素级传输,提升了效率和鲁棒性。
- •我们采用概率性潜在表示,并引入维度缩放的KL散度权重,以增强在高噪声卫星信道下的鲁棒性,并防止小码字维度下的后验坍缩。
- •我们引入了一个统一的多任务框架,联合优化重建与分类,其中包含一个带有残差细化子网络的双分支解码器,能够恢复被通信瓶颈抑制的细粒度边缘细节。
- •我们在不同的交通标志数据集及不同信道条件下(包括阴影和晴朗天空的卫星传播)对所提方法进行了测试,并与传统方法进行了比较。
本文其余部分组织如下:第二章回顾语义通信和基于深度学习的通信系统的相关工作。第三章介绍系统模型。第四章描述所提方法。第四章第七节详述实验设置。第五章展示结果与分析,最后第六章总结全文。
## II. 相关工作
深度联合源信道编码(DeepJSCC)[1]用端到端学习替代了传统的源信道分离编码,在含噪信道上实现优雅降级。后续工作探索了反馈机制以及Transformer和基于扩散的接收器等先进架构,但其高计算成本和延迟限制了在实时或资源受限场景中的部署,在这些场景下轻型卷积模型仍然更为实用。此外,大多数先前工作聚焦于地面或加性高斯白噪声(AWGN)信道,而卫星特有的挑战,如大路径损耗、低轨系统中的多普勒频移以及两跳中继几何结构,尚未得到充分探索,这激发了本研究的动机。最近的任务导向语义通信方法[3]展示了用于联合重建和分类的共享潜在空间,但依赖逐像素损失模糊了潜在建模与架构设计各自的作用;相比之下,本文引入了一种组合感知损失和一个匹配的确定性基线,以隔离损失设计与随机潜在表示的效果。此外,基于MSE的目标通常产生过于平滑的重建,而感知和结构度量(如SSIM[7]和基于特征的损失[6])结合基于梯度的约束[8]能更好地保持视觉保真度,这启发了我们的组合损失公式。
## III. 系统模型与问题建模
### III-A 传输场景
我们考虑一个卫星辅助的车辆通信场景:发送方自动驾驶车辆捕获交通标志图像,并将压缩后的语义码字传输给卫星中继,中继再将其转发给接收方车辆。端到端的上行-下行链路使用卫星系统中标准的两跳抽象建模为单个等效平坦衰落AWGN信道[3],在解码转发或放大转发中继下有效,等效接收信噪比(SNR)记为γ。虽然卫星链路通常具备强视距条件,但我们采用瑞利衰落作为保守的最坏情况模型,以考虑城市遮挡、树叶阴影和低仰角过境,确保鲁棒的性能评估。发射机将图像 x∈[0,1]^{H×W}(带有类别标签 c∈Y={0,...,C-1})映射到潜在码字 z∈R^d,并通过信道传输。接收信号 y∈R^d 随后用于联合重建图像 x̂ 和预测标签 ĉ。假定单个衰落系数 h 在一个传输间隔内对所有 d 维保持不变,对应于窄带信道。
### III-B 问题建模
令 f_φ: R^{H×W} → R^d 表示参数为 φ 的编码器,g_θ: R^d → R^{H×W} 和 q_ψ: R^d → R^C 分别表示接收端的重建网络和分类网络。系统通过求解以下约束优化问题进行端到端训练:
min_{φ,θ,ψ} E_{x,c,y}[ α L_cls(q_ψ(y),c) + β L_rec(g_θ(y),x) + γ L_kl(f_φ(x)) ],
s.t. E[ ||z||_2^2 ] ≤ P, (1a)
d ≤ d_max, (1b)
x̂ = g_θ(y) ∈ [0,1]^{H×W}, (1c)
y = h z̃ + n, h ~ Rayleigh, n ~ N(0, σ_n^2 I), (1d)
其中 z = f_φ(x) 表示编码后的潜在表示,z̃ 是其功率归一化版本。约束(1a)强制执行发射功率预算 P,而(1b)根据可用带宽将码字维度限制为 d_max。约束(1c)确保有效的像素重建,(1d)定义了卫星信道模型,其中 σ_n^2 = 1/(2 γ_lin)。目标函数联合优化分类准确率、重建保真度和潜在正则化,从而在含噪无线信道上实现鲁棒的端到端语义通信。正则化项 L_kl(·) 仅包含在概率VAE公式中,确定性基线中则省略。实际上,约束(1a)中的功率约束通过传输前将 z 归一化为单位RMS幅度来强制执行,详见方法章节IV。
## IV. 所提框架
图1:基于VAE的多任务卫星辅助语义通信框架,用于6G自动驾驶车辆,包含用于更好重建的细化分支和用于含噪信道中交通标志识别的并行分类器。
### IV-A 编码器架构
图2:所提议的VAE编码器-解码器架构,包含潜在采样和细化分支。
编码器 f_φ 由三个步长卷积块组成,逐步降低空间分辨率,如图2所示。每个块处理输入空间图并产生下采样输出。卷积块记为 C(k,s,p),其中 k 为卷积核大小,s 为步长,p 为填充。得到的特征体积被展平为向量 h∈R^{8192},然后通过两个独立的全连接层以产生后验均值和对数方差:
μ = W_μ h + b_μ, log σ^2 = W_v h + b_v, (2)
每个都产生一个 d 维向量。这两个分支对应全连接稠密层,即 FC(μ) 和 FC(σ) 层,如图2所示。
### IV-B 重参数化与信道模型
训练期间,潜在向量通过重参数化技巧[9]采样:
z = μ + ε ⊙ σ, ε ~ N(0, I), (3)
其中 σ = exp(0.5 log σ^2)。推理时,我们使用 z = μ 进行确定性评估,消除随机重建方差,并在测试集上持续改善感知质量。传输之前,z 通过其均方根幅度进行归一化,以将信号功率与输入尺度解耦:
z̃ = z / sqrt( (1/d) Σ_{i=1}^d z_i^2 ). (4)
信道引入瑞利衰落和AWGN:
y = h z̃ + n, (5)
其中衰落系数逐元素抽取如下:
h = sqrt( (h_R^2 + h_I^2) / 2 ), h_R, h_I ~ N(0,1), (6)
噪声为 n ~ N(0, σ_n^2 I),标准差为
σ_n = 1 / sqrt(2 γ_lin), γ_lin = 10^{γ_dB/10}. (7)
假设发射机没有信道状态信息;解码器和分类器都学会在由训练信道分布定义的衰落、含噪信号空间内工作。接收信号 y 在送入解码器和分类器之前,先乘以原始的RMS功率进行重缩放。
### IV-C 带细化分支的解码器
解码器将向量 y 通过一个全连接投影和四个转置卷积块转换到图像空间,遵循编码器的下采样层次。前三个块在降低通道深度的同时增加空间分辨率,而第四个块保持 64×64 分辨率并带有一个细化分支。转置卷积定义为 CT(k,s,p),具有卷积核大小 k、步长 s 和填充 p,后接ReLU激活。在最后阶段,基础图像 x_base ∈ R^{64×64}相似文章
EVLA:用于物理基础驾驶推理与控制的电感知多模态助手
介绍了EVLA,这是一个通过实时感知电动动力总成状态来增强视觉-语言驾驶助手,从而实现能量最优和物理基础决策的框架。
SEAOTTER:传感器嵌入式自编码与一次性转码实现高效重建
介绍 SEAOTTER,一种用于云机器人的压缩框架,该框架将学习到的潜在表示与标准 JPEG 兼容性相结合,在极端压缩比下实现了更快的编码/解码速度和更高的准确性。
Fast-dDrive: 用于自动驾驶的高效块扩散VLM
Fast-dDrive是一种用于端到端自动驾驶的块扩散VLA模型,实现了最先进的轨迹精度,同时相比自回归基线提供了超过12倍的吞吐量加速,解决了高保真规划与边缘部署高效推理之间的权衡。
面向连续多无人机追踪的拓扑感知时空交接框架
本文提出了一种用于无人机交通监控的实时多相机多车辆跟踪系统,该系统采用基于拓扑的时空交接机制和确定性队列匹配,在相机视角间保持车辆身份,实现了99.8%的交接成功率。
一种结合大语言模型和思维链的自主AI框架,用于无人机辅助物流调度与移动边缘计算
本文提出了一种自主AI框架,利用大语言模型和思维链推理来优化无人机辅助的物流调度与移动边缘计算,旨在提高制造物流中的效率和资源分配。