RGBD20K:一个用于RGB-D语义分割的大规模基准
摘要
本文介绍了RGBD20K,这是一个用于RGB-D语义分割的大规模基准数据集,包含160个细粒度类别和20,000对图像,具有高质量注释和一种新颖的分数净化融合方法。
查看缓存全文
缓存时间: 2026/09/25 19:47
论文页面 - RGBD20K:大规模RGB-D语义分割基准数据集
来源:https://huggingface.co/papers/2609.29028
摘要
本文提出RGBD20K,这是一个旨在促进更鲁棒和通用RGB-D语义分割模型发展的新型数据集。该数据集包含丰富的类别与高质量标注。RGBD20K具有以下显著特性: (1) 扩展语义空间:尤其涵盖了160个细粒度类别,远超现有主流RGB-D基准数据集(例如包含40类的NYUv2和37类的SUNRGB-D)的类别多样性。通过如此丰富的语义覆盖,我们期望推动更具泛化能力的分割模型学习。 (2) 更大规模:相较于现有基准数据集,RGBD20K提供了20,000对RGB-D图像,为开发更强大的深度模型提供了实质性的更大规模训练资源。 (3) 高保真标注:我们对现有标签进行了严格的重新评估与修正,解决了长期存在的标注噪声问题,从而构建了干净可靠的真值基础。此外,我们提出了一种新颖的得分净化融合方法,该方法在所有评估基准上均达到了最先进的性能,证明了我们利用高质量多模态信息进行RGB-D语义分割的有效性。数据集地址:https://github.com/ShaohuaDong2021/RGBD20K/。
查看arXiv页面 (https://arxiv.org/abs/2609.29028)查看PDF (https://arxiv.org/pdf/2609.29028)GitHub仓库 (https://github.com/ShaohuaDong2021/RGBD20K)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.29028)
在您的代理中获取此论文:
hf papers read 2609\.29028
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型关联此论文
在模型README.md中引用 arxiv.org/abs/2609.29028 以从本页链接。
引用此论文的数据集0
没有数据集关联此论文
在数据集README.md中引用 arxiv.org/abs/2609.29028 以从本页链接。
引用此论文的Spaces0
没有Space关联此论文
在Space README.md中引用 arxiv.org/abs/2609.29028 以从本页链接。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection)以从本页链接。
相似文章
SULAND v2:用于UAV/UGV地表地雷检测的精细化RGB数据集及域偏移下的深度学习目标检测基准
本文介绍了SULAND v2,一个精细化的RGB地表地雷检测数据集和基准,用于UAV/UGV测量,解决了目标检测中的标注错误和域偏移评估问题。
GEOID-Flood:用于洪水分割的大规模多模态基准数据集
介绍了GEOID-Flood,这是一个用于洪水分割的大规模多模态基准数据集,包含来自65个国家219个事件的超过14,000个瓦片,在单图像、多时相和多模态协议下,将基础模型与传统编码器进行了评估。
RRS-10K:面向罕见遥感图像解读的多任务视觉-语言模型基准
RRS-10K是一个用于评估视觉-语言模型在罕见遥感图像解读方面的基准数据集,包含超过10,000张军事相关图像和多种任务格式。对52个模型的评估显示其零样本性能中等,且在视觉定位和复杂推理方面存在明显不足。
CM-EVS:稀疏全景RGB-D位姿数据用于完整场景覆盖
本文提出了COVER,一种无需训练的方法,用于将3D资产转换为具有完整场景覆盖和低冗余度的稀疏全景RGB-D位姿数据,并介绍了包含36,373个来自室内和室外场景的精选帧的CM-EVS数据集。
迈向暗光环境下鲁棒且三维感知的RGB-NIR成像
本文提出了一种用于RGB-NIR低光成像的三维感知神经方法,该方法在三维空间中将极度含噪的RGB观测与NIR线索融合,无需干净RGB监督,并提高了跨不同噪声水平的鲁棒性。