标签
本文提出了一种前馈框架,能够从无位姿的多视图图像中将3D场景分解为实例结构的令牌组,从而在没有3D标注的情况下实现直接的对象级重建、分割和操控。
YOLO26 是一个于2026年1月发布的多任务计算机视觉模型系列,具备无需 Non-Maximum Suppression 的端到端检测功能以降低延迟,并针对边缘部署进行了优化,具有改进的CPU推理能力和紧凑设计。
Ultralytics YOLO26 引入了一个统一的实时视觉模型家族,具有无需NMS的推理、改进的训练策略以及用于检测、分割和姿态估计的多任务能力,实现了最先进的精度与延迟权衡。
本文介绍了一种基于视觉的路面病害分析系统,该系统采用Mask R-CNN实例分割方法,在自定义数据集上实现了高精度和高召回率的裂缝检测与量化。
Urban-ImageNet是一个大规模多模态数据集和评估基准,用于从社交媒体图像进行城市空间感知,支持场景分类、跨模态检索和实例分割任务,覆盖中国24个城市的61个城市地点。