RGBD20K:一个用于RGB-D语义分割的大规模基准

Hugging Face Daily Papers 论文

摘要

本文介绍了RGBD20K,这是一个用于RGB-D语义分割的大规模基准数据集,包含160个细粒度类别和20,000对图像,具有高质量注释和一种新颖的分数净化融合方法。

在本文中,我们提出了RGBD20K,这是一个新颖的数据集,旨在通过涵盖丰富的类别和高质量注释,促进更鲁棒和通用的RGB-D语义分割的发展。RGBD20K具有几个吸引人的特性:(1)扩展的语义空间。特别是,它涵盖了160个细粒度类别,大大超越了现有流行RGB-D基准(例如,NYUv2有40个类,SUN RGB-D有37个类)的类别多样性。凭借如此丰富的语义覆盖,我们期望促进更具泛化能力的分割模型的学习。(2)更大规模。与当前基准相比,RGBD20K提供了20,000对RGB-D图像,提供了显著更大的训练资源,有利于开发更强大的深度模型。(3)高保真注释。我们对现有标签进行严格的重新评估和修正,以解决长期存在的注释噪声,从而得到一个干净可靠的真值基础。此外,我们提出了一种新颖的分数净化融合(SPF)方法,该方法在所有评估基准上实现了最先进的性能,证明了我们的方法在利用高质量多模态信息进行RGB-D语义分割方面的有效性。数据集在这里:https://github.com/ShaohuaDong2021/RGBD20K/。
查看原文
查看缓存全文

缓存时间: 2026/09/25 19:47

论文页面 - RGBD20K:大规模RGB-D语义分割基准数据集

来源:https://huggingface.co/papers/2609.29028

摘要

本文提出RGBD20K,这是一个旨在促进更鲁棒和通用RGB-D语义分割模型发展的新型数据集。该数据集包含丰富的类别与高质量标注。RGBD20K具有以下显著特性: (1) 扩展语义空间:尤其涵盖了160个细粒度类别,远超现有主流RGB-D基准数据集(例如包含40类的NYUv2和37类的SUNRGB-D)的类别多样性。通过如此丰富的语义覆盖,我们期望推动更具泛化能力的分割模型学习。 (2) 更大规模:相较于现有基准数据集,RGBD20K提供了20,000对RGB-D图像,为开发更强大的深度模型提供了实质性的更大规模训练资源。 (3) 高保真标注:我们对现有标签进行了严格的重新评估与修正,解决了长期存在的标注噪声问题,从而构建了干净可靠的真值基础。此外,我们提出了一种新颖的得分净化融合方法,该方法在所有评估基准上均达到了最先进的性能,证明了我们利用高质量多模态信息进行RGB-D语义分割的有效性。数据集地址:https://github.com/ShaohuaDong2021/RGBD20K/。

查看arXiv页面 (https://arxiv.org/abs/2609.29028)查看PDF (https://arxiv.org/pdf/2609.29028)GitHub仓库 (https://github.com/ShaohuaDong2021/RGBD20K)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.29028)

在您的代理中获取此论文:

hf papers read 2609\.29028

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型关联此论文

在模型README.md中引用 arxiv.org/abs/2609.29028 以从本页链接。

引用此论文的数据集0

没有数据集关联此论文

在数据集README.md中引用 arxiv.org/abs/2609.29028 以从本页链接。

引用此论文的Spaces0

没有Space关联此论文

在Space README.md中引用 arxiv.org/abs/2609.29028 以从本页链接。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection)以从本页链接。

相似文章

GEOID-Flood:用于洪水分割的大规模多模态基准数据集

Hugging Face Daily Papers

介绍了GEOID-Flood,这是一个用于洪水分割的大规模多模态基准数据集,包含来自65个国家219个事件的超过14,000个瓦片,在单图像、多时相和多模态协议下,将基础模型与传统编码器进行了评估。

CM-EVS:稀疏全景RGB-D位姿数据用于完整场景覆盖

Hugging Face Daily Papers

本文提出了COVER,一种无需训练的方法,用于将3D资产转换为具有完整场景覆盖和低冗余度的稀疏全景RGB-D位姿数据,并介绍了包含36,373个来自室内和室外场景的精选帧的CM-EVS数据集。

迈向暗光环境下鲁棒且三维感知的RGB-NIR成像

Hugging Face Daily Papers

本文提出了一种用于RGB-NIR低光成像的三维感知神经方法,该方法在三维空间中将极度含噪的RGB观测与NIR线索融合,无需干净RGB监督,并提高了跨不同噪声水平的鲁棒性。