用于海冰类型预测的多标签比例学习
摘要
本文介绍了一种弱监督多标签比例学习框架,用于使用SAR图像和多模态数据进行海冰类型预测,相比有监督基线实现了显著的准确性提升。
arXiv:2609.16347v1 Announce Type: new
摘要:海冰类型预测对于气候监测、海上航行和极地决策至关重要。该任务的主要标签数据来源是海冰图,由冰分析师手动制作,他们通过解释卫星图像来将冰区划分为多边形。尽管海冰图很有价值,但其制作过程劳动密集且成本高昂,这促使近期使用深度学习来自动化该过程。然而,深度学习模型需要块级(或像素级)标签数据进行训练,而海冰图仅提供多边形级注释。作为变通方法,有监督方法通常通过为每个样本分配其父多边形的主导冰类型,从多边形级海冰图标签创建近似的块级标签。这种方法使得有监督训练成为可能,但创建了一个不适定的学习问题,具有本质上近似的解。在本文中,我们将海冰类型预测重新定义为一个弱监督多标签比例学习问题,以便能够直接使用多边形级海冰图标签,避免不必要的标签近似,从而提高预测准确性。为了解决这个问题,我们提出了一个两模块框架,首先使用多实例学习(MIL)进行水-冰分类,然后引入多标签比例学习(MLPL)进行冰类型组成预测。我们进一步扩展了该框架,通过模态引导的辅助正则化,整合了SAR图像、AMSR2亮温和ERA5再分析数据的多模态模型。在AI4Arctic数据集上评估,仅SAR模型将MAE降低了14.5%,并使平均冰级F1比最佳有监督基线提高了一倍以上。多模态模型进一步将MAE降低了21.5%,比仅SAR模型提高了41.2%的平均F1,并比有监督多模态基线提高了52.7%。
查看缓存全文
缓存时间: 2026/09/16 08:49
# 面向海冰类型预测的多标签比例学习 来源:https://arxiv.org/html/2609.16347 CCS:计算方法 学习方法 Samira Alkaee Taleghan 单位:美国科罗拉多州丹佛市科罗拉多大学丹佛分校 邮箱:[[email protected]](mailto:[email protected]) Younghyun Koo 单位:美国科罗拉多州博尔德市科罗拉多大学博尔德分校国家冰雪数据中心(NSIDC)、CIRES 邮箱:[[email protected]](mailto:[email protected]) Andrew P. Barrett 单位:美国科罗拉多州博尔德市科罗拉多大学博尔德分校国家冰雪数据中心(NSIDC)、CIRES 邮箱:[[email protected]](mailto:[email protected]) 以及 Farnoush Banaei-Kashani 单位:美国科罗拉多州丹佛市科罗拉多大学丹佛分校 邮箱:[[email protected]](mailto:[email protected]) © 无 ###### 摘要 海冰类型预测对于气候监测、极地地区海事导航和决策至关重要。该任务的主要标签数据来源是海冰图,由冰情分析员手动制作,他们通过解读卫星图像,将冰区划分为多边形区域。每个多边形区域被分配总的海冰密集度以及该区域内存在的各冰型的部分密集度。尽管海冰图具有重要价值,但其制作过程劳动密集且成本高昂,这促使了近期使用深度学习进行自动化处理的研究。然而,深度学习模型需要像素级(或图块级)的标签数据进行训练,而海冰图仅提供多边形级别的注释。作为变通方案,监督学习方法通常通过为每个样本分配其所属多边形的主导冰型,将多边形级别的海冰图标签近似转化为图块级标签。虽然这种方法支持了监督训练,但造成了本质上是近似解的病态学习问题。本文将海冰类型预测重新定义为弱监督的多标签比例学习问题,以便能够直接使用多边形级别的海冰图标签,避免不必要的标签近似,从而提高预测精度。为了解决这个问题,我们提出了一个两模块框架:首先使用多实例学习(MIL)进行水-冰分类,然后引入多标签比例学习(MLPL)进行冰型组成预测。我们进一步通过一个融合SAR影像与AMSR2亮温数据及ERA5再分析数据,并采用模态引导辅助正则化的多模态模型来扩展该框架。在AI4Arctic数据集上的评估表明,仅使用SAR的模型将平均绝对误差(MAE)降低了14.5%,平均冰类F1分数相比最佳监督基线提升了一倍多。多模态模型相较于仅SAR模型进一步将MAE降低了21.5%,平均F1分数提升了41.2%,相较于监督多模态基线提升了52.7%。 ###### 关键词:海冰类型预测、多实例学习、标签比例学习、多传感器遥感 ## 1. 引言 海冰类型预测对于气候监测、数值建模、海事导航以及极地地区的决策至关重要。由于海冰类型反映了冰的厚度、年代、强度和可航行性,可靠的信息对于理解极地气候过程和支持在冰封水域的安全活动至关重要(Vihma, 2014 (https://arxiv.org/html/2609.16347#bib.bib1); Taleghan et al., 2024 (https://arxiv.org/html/2609.16347#bib.bib49))。海冰类型信息的主要来源是海冰图。海冰图由专业冰情分析员手动制作,他们利用领域专业知识和视觉检查来解读多传感器卫星影像和辅助数据源,将冰区划分为多边形区域。合成孔径雷达(SAR)在该过程中尤其重要,因为它提供高分辨率观测,并且能够穿透云层并在极地黑夜中工作(Dierking, 2013 (https://arxiv.org/html/2609.16347#bib.bib5))。尽管海冰图很有价值,但其制作劳动密集且成本高昂,这推动了使用深度学习自动化海冰类型预测的努力。在业务化的海冰制图中,分析员在相对均匀的冰况区域手动绘制多边形,并根据世界气象组织(WMO)的“卵形码”和SIGRID3数据格式为每个多边形分配一组标准代码(Center, 2022 (https://arxiv.org/html/2609.16347#bib.bib3))。卵形码并非为每个多边形分配单一冰型,而是记录总的海冰密集度(SIC)(海冰覆盖率,从0%到100%),以及最多三种共存冰型的部分密集度,每种冰型由其发育阶段(SOD,作为冰厚的代理指标)和浮冰尺寸(FLOE)表征。图1 (https://arxiv.org/html/2609.16347#acmlabel1) 展示了丹麦气象研究所(DMI)制作的海冰图多边形叠加在Sentinel-1 SAR影像上的示例,以及分配给每个多边形的WMO卵形码。重要的是,这些标签描述的是整个多边形的总体组成,而不是每个独立像素或图块的类别身份。一个多边形内的条件可能差异很大,混合多边形可能包含几种具有不同部分密集度的不同冰型。 灰度SAR卫星图像上绘制了七个带编号的彩色多边形轮廓,叠加在海冰区域,旁边有七个椭圆形的卵形码图表。每个椭圆顶部列出该多边形的总冰密集度,下方各行则列出部分密集度、发育阶段和浮冰尺寸代码。 图1. 海冰图多边形及其WMO卵形码。(a) 2021年10月14日07:12 UTC,斯瓦尔巴群岛西北部弗拉姆海峡,Sentinel-1A EW HH场景,DMI海冰图。(b) 每个多边形的SIGRID-3卵形码。 灰度SAR卫星图像上绘制了七个带编号的彩色多边形轮廓,叠加在海冰区域,旁边有七个椭圆形的卵形码图表。每个椭圆顶部列出该多边形的总冰密集度,下方各行则列出部分密集度、发育阶段和浮冰尺寸代码。 深度学习的最新进展为自动化海冰类型预测和辅助海冰图生成开辟了新的机会(Li et al., 2024 (https://arxiv.org/html/2609.16347#bib.bib2); Jalayer et al., 2025 (https://arxiv.org/html/2609.16347#bib.bib51); Taleghan et al., 2025b (https://arxiv.org/html/2609.16347#bib.bib50))。通过从SAR影像中提取空间和纹理特征,深度学习模型可以克服人工解释的限制,实现更具扩展性和及时性的海冰制图。然而,训练这类模型需要像素级或图块级的标签数据——而海冰数据通常缺乏这类标签;海冰图仅提供多边形级别的注释。因此,监督方法通过为每个样本分配其所属多边形的主导冰型,将多边形注释转化为像素或图块级标签,从而将卵形码的多标签比例结构简化为单一类别(Park et al., 2020 (https://arxiv.org/html/2609.16347#bib.bib4); Boulze et al., 2020 (https://arxiv.org/html/2609.16347#bib.bib64); Kruk et al., 2020 (https://arxiv.org/html/2609.16347#bib.bib65))。这种变通方法虽然支持了监督训练,但造成了一个病态学习问题:主导标签简化丢弃了部分密集度信息,在混合多边形中引入了标签噪声,并忽略了从异构多边形级别注释进行训练所固有的不确定性。海冰图中可用的多边形级别比例注释与标准监督方法所需的像素级标签之间的不匹配,构成了本工作的核心挑战。 我们并非推断嘈杂的主导类别标签,而是通过将每个多边形视为一组未标注图像图块的“包”,其集体组成由标签比例描述,从而保留海冰图监督的原始结构。这种设定天然契合多实例学习(MIL),其中监督信号是针对“包”而非单个实例提供的(Dietterich et al., 1997 (https://arxiv.org/html/2609.16347#bib.bib6); Maron and Lozano-Pérez, 1997 (https://arxiv.org/html/2609.16347#bib.bib7)),也与标签比例学习(LLP)相符,其中训练目标是使实例的聚合预测匹配已知的包级别类别比例(Quadrianto et al., 2008 (https://arxiv.org/html/2609.16347#bib.bib8))。由于海冰图多边形可能包含多种共存冰型,因此产生的任务既是多标签的,也是基于比例的。这种表述避免了主导类别的假设,并直接利用了业务海冰图的全部注释丰富性。 我们提出了一个反映海冰制图任务结构的两模块框架。第一个模块使用MIL表述执行粗略的水-冰分类。第二个模块使用多标签比例学习(MLPL)估计冰图多边形的冰型组成。在第二个模块中,核心的仅SAR模型使用了证据狄利克雷聚合(evidential Dirichlet aggregation),允许图块为多边形级别的比例估计提供可变的证据,而不是强制每个图块贡献等量的softmax概率。这一点很重要,因为边界图块、模糊纹理和混合区域不应像信息丰富的冰型模式那样,对包级别的估计产生相同的影响。作为一个扩展,我们引入了一个多模态辅助正则化架构,通过AMSR2冰密集度一致性和ERA5环境兼容性正则化,将SAR影像与AMSR2亮温数据和ERA5大气再分析场相整合。 本工作的主要贡献是: (1)我们将业务海冰制图中多边形级别的标注阶段表述为一个弱监督问题,保留部分密集度信息而非将每个多边形简化为主导类别,并提出了一个结合二元MIL和多标签比例学习的两模块框架:首先识别被冰覆盖的多边形,然后直接从多边形级别的密集度标签预测细粒度的多标签冰型比例; (2)我们将证据狄利克雷聚合应用于包级别的海冰比例学习,允许图块提供可变的证据而非等量的softmax概率; (3)我们通过模态引导的辅助正则化扩展了该框架,整合了AMSR2冰密集度一致性和ERA5环境兼容性。此外,我们研究了包大小校准和不确定性加权狄利克雷训练作为扩展方法,进一步提高了比例估计的准确性,并分析了图块选择预算与预测性能之间的权衡。 论文的其余部分组织如下:第2节回顾相关工作,第3节介绍方法,第4节报告实验和结果,第5节总结全文。 ## 2. 相关工作 ### 2.1. 海冰类型分类 监督的海冰分类方法旨在使用带标签的训练数据,从卫星影像中自动识别和区分冰型。早期基于CNN的研究证明了深度学习用于海冰分类的可行性。Li等人(Li et al., 2017 (https://arxiv.org/html/2609.16347#bib.bib41))将CNN应用于高分三号SAR影像以区分冰和开阔水域,Boulze等人(Boulze et al., 2020 (https://arxiv.org/html/2609.16347#bib.bib64))在Sentinel-1数据上使用CNN,实现了比传统方法更高的冰型分类精度。更深层的架构,如AlexNet(Krizhevsky et al., 2012 (https://arxiv.org/html/2609.16347#bib.bib34))、VGG16(Simonyan and Zisserman, 2014 (https://arxiv.org/html/2609.16347#bib.bib35))、ResNet(He et al., 2016 (https://arxiv.org/html/2609.16347#bib.bib36))和DenseNet(Huang et al., 2017 (https://arxiv.org/html/2609.16347#bib.bib43))通过分层特征提取和残差学习进一步提高了性能。Xu等人(Xu and Scott, 2017 (https://arxiv.org/html/2609.16347#bib.bib44))微调了AlexNet用于基于SAR的冰-水分类,而Khaleghian等人(Khaleghian et al., 2021 (https://arxiv.org/html/2609.16347#bib.bib42))展示了通过数据增强,VGG16的优越性。专门化、基于注意力的以及多传感器架构进一步提升了基于SAR数据的海冰分类(Song et al., 2018 (https://arxiv.org/html/2609.16347#bib.bib37); Lyu et al., 2022 (https://arxiv.org/html/2609.16347#bib.bib38); Zhang et al., 2021 (https://arxiv.org/html/2609.16347#bib.bib39); Kruk et al., 2020 (https://arxiv.org/html/2609.16347#bib.bib65); Han et al., 2022 (https://arxiv.org/html/2609.16347#bib.bib67); Chen et al., 2023 (https://arxiv.org/html/2609.16347#bib.bib40))。IceBench(Taleghan et al., 2025a (https://arxiv.org/html/2609.16347#bib.bib48))提供了一个使用代表性CNN模型和常用指标的海冰类型分类标准化基准。尽管取得了这些进展,监督方法通常将混合多边形简化为单一标签。相比之下,我们的工作直接从多边形级别的多标签比例中学习,保留了混合冰型的组成。 ### 2.2. 多实例学习 多实例学习(MIL)是一种弱监督框架,其中标签被分配给实例的“包”,而不是单个样本(Dietterich et al., 1997 (https://arxiv.org/html/2609.16347#bib.bib6); Maron and Lozano-Pérez, 1997 (https://arxiv.org/html/2609.16347#bib.bib7))。在经典假设下,一个正包包含至少一个正实例,而一个负包仅包含负实例。此后,MIL已被扩展到计算机视觉、遥感和医学成像等多个应用领域(Amores, 2013 (https://arxiv.org/html/2609.16347#bib.bib9); Carbonneau et al., 2018 (https://arxiv.org/html/2609.16347#bib.bib10); Quellec et al., 2017 (https://arxiv.org/html/2609.16347#bib.bib12))。传统的MIL使用kNN、SVM和决策树等模型(Wang and Zucker, 2000 (https://arxiv.org/html/2609.16347#bib.bib13); Andrews et al., 2002 (https://arxiv.org/html/2609.16347#bib.bib14); Chevaleyre and Zucker, 2001 (https://arxiv.org/html/2609.16347#bib.bib15)),而深度MIL通常用CNN提取实例特征,然后在包级别进行聚合。平均池化和最大池化可能会分别稀释有信息的实例或忽略更广泛的上下文;基于注意力的MIL通过学习实例重要性权重来解决这个问题(Ilse et al., 2018 (https://arxiv.org/html/2609.16347#bib.bib11))。基于注意力的MIL已从全局自注意力模型(如TransMIL(Shao et al., 2021 (https://arxiv.org/html/2609.16347#bib.bib16)))发展到局部上下文方法(如CAMIL(Fourkioti et al., 2023 (https://arxiv.org/html/2609.16347#bib.bib19)))。其他变体引入了聚类、分布引导评分、伪包蒸馏、基于图的空间建模以及多任务或多模态学习(Lu et al., 2021 (https://arxiv.org/html/2609.16347#bib.bib20); Qu et al., 2022 (https://arxiv.org/html/2609.16347#bib.bib18); Zhang et al., 2022 (https://arxiv.org/html/2609.16347#bib.bib17); Tu et al., 2019 (https://arxiv.org/html/2609.16347#bib.bib21); Pal et al., 2022 (https://arxiv.org/html/2609.16347#bib.bib22); Li et al., 2021 (https://arxiv.org/html/2609.16347#bib.bib23); Ren et al., 2025 (https://arxiv.org/html/2609.16347#bib.bib24); Luo et al., 2025 (https://arxiv.org/html/2609.16347#bib.bib25))。在海冰制图中,Alter-CNN使用...
相似文章
物理知识引导的混合神经学习在北极海冰浓度演变与短期预测中的应用
本文介绍了PIHIM,一种物理信息混合神经模型,用于预测北极海冰浓度演变,结合深度学习与物理方程以提高准确性和短期预测能力。
基于生成式机器学习的季节性预报概率偏差订正:以北极海冰预测为例
本文提出了一种基于条件变分自编码器(cVAE)的概率后处理框架,用于对北极海冰的季节性预报进行偏差订正,相比标准方法,在校准性、锐度及谱功率方面均有提升。
CW-BASS v2:基础模型教师下用于半监督分割的饱和度感知伪标签选择
本文介绍了CW-BASS v2,一种用于半监督语义分割的饱和度感知伪标签选择方法,该方法根据教师的可靠性在严格过滤和自适应置信度下限之间自适应切换。使用DINOv2教师,在多个基准测试上显示了优于基线的结果。
GLACIER: 一种用于分子性质预测的多模态学生-教师基础模型
本文介绍了GLACIER,一种多模态学生-教师基础模型,它整合了分子图、SMILES字符串和物理化学描述符,以高效预测分子性质。它利用Finsler几何感知融合以及来自更大教师模型(MiniMol、MolFormer)的知识蒸馏,以轻量级架构实现高性能。
超越表面统计:通过内部表示实现LLM鲁棒共形预测
本论文提出了一个利用内部表示而非输出层统计的LLM共形预测框架,引入层级信息(LI)评分作为非一致性度量,在分布偏移下改进有效性-效率权衡。该方法在QA基准上相比文本级基线展现出更强的对校准-部署不匹配的鲁棒性。