CABiNet (ICRA 2021) 与 YOLO26-sem 在 UAVid 数据集上的对比:精度、计算量与 GPU 延迟 [P]

Reddit r/MachineLearning 新闻

摘要

一项基准测试显示,CABiNet(一种2021年的高效架构)在 UAVid 数据集的实时语义分割任务上,其精度与延迟的权衡优于 YOLO26-sem。

事先声明:我是 CABiNet (ICRA 2021) 的原始第一作者,因此我并非中立方。以下所有内容均可通过代码仓库复现。 ## 背景 CABiNet 是一种用于实时语义分割的双分支 CNN:一个高分辨率空间分支,一个轻量级上下文分支(全局聚合 + 局部分布),基于 MobileNetV3 主干网络,并通过一个小的特征融合模块(FFM)进行融合。 该架构发表于 2021 年,随后沉寂。今年我回归,重建了代码仓库(PyTorch 2.x, Hydra, AMP, EMA, poly-LR, OHEM 损失, CI 与测试),并利用它来探讨一个关键问题:在 **UAVid** 数据集(原论文针对的航空数据集)上,一个专为特定任务设计的 2021 年高效架构,与一个 2026 年的通用多任务模型(及其专门的语义分割变体)相比表现如何? ## 控制了什么(以及未控制什么) 两个模型均使用相同的转换数据集与划分、相同的 ENet 逆对数类别权重(`cls_pw=0.5`)、用于评估的 EMA 权重,以及相同的评估协议:单尺度推理,无测试时增强。 未匹配(控制)的方面: | 维度 | CABiNet | YOLO26-sem | 潜在优势 | | :--- | :--- | :--- | :--- | | 初始化 | 在 ImageNet 上预训练的 MobileNetV3 主干;分割层随机初始化 | 整个网络在 Cityscapes + ADE20K 上预训练 | 可能有利于 YOLO | | 训练轮次 | 5000 (早停,耐心值 100) | 500 (早停,耐心值 50) | 可能有利于 CABiNet | | 优化器/学习率策略 | SGD + 多项式衰减,解码器学习率 ×10 | SGD + 余弦退火 | 不同 | | 损失函数 | OHEM-CE + 辅助深度监督 | CE + Dice + 辅助 | 不同 | | 额外数据增强 | 无 | mosaic 0.8, copy-paste 0.15 | 可能有利于 YOLO | 因此,这不是一个纯粹的架构消融实验。这是一个受控的基准测试:数据表示、类别权重和评估方法是标准化的,而每个模型则保留其特定的训练配方。上述每一项并非孤立实验,因此我并未测量其中任何单一因素的具体价值。 ## 结果 — UAVid 测试集,1024×1024,单尺度推理 | 模型 | mIoU (%) | 参数量 (M) | FLOPs (G) | FP16 延迟* | FP16 FPS | | :--- | :--- | :--- | :--- | :--- | :--- | | **CABiNet (MobileNetV3-L)** | **67.14** | 9.17 | 54.8 | 4.44 ms | 225 | | **CABiNet (MobileNetV3-S)** | 65.25 | 5.36 | 44.1 | 3.09 ms | 324 | | YOLO26x-sem | 64.41 | 40.16 | 430.9 | 13.09 ms | 76 | | YOLO26l-sem | 63.28 | 17.87 | 192.4 | 7.54 ms | 133 | | YOLO26m-sem | 61.98 | 14.32 | 152.3 | 5.71 ms | 175 | | YOLO26s-sem | 61.69 | 6.50 | 44.4 | 2.52 ms | 396 | | YOLO26n-sem | 58.17 | 1.63 | 11.4 | 2.23 ms | 449 | *\*RTX 4070 SUPER,批大小 1,纯模型前向传播(无前后处理),30 次预热后测量 200 次迭代,由我本人测量。参数量仅计架构;FLOPs 为 1024² 分辨率下的分析前向计算(CABiNet 使用 thop,YOLO26 使用 Ultralytics profiler;两者报告的 FLOPs = 2×MACs)。* ## UAVid mIOU 与 FP16 延迟关系图 虚线为精度/延迟的帕累托前沿:YOLO26n 和 YOLO26s 作为合法的低延迟点位于其上,而 YOLO26m/l/x 则被支配(它们每个都比至少一个 CABiNet 变体更慢且精度更低)。CABiNet 占据了该前沿的高精度一端。 有三点值得指出: 1. **计算量相近**:CABiNet-S vs YOLO26s。两者计算量相近(约 44 GFLOPs,44.1 vs 44.4),CABiNet-S 参数量略少(5.36M vs 6.50M),在该 GPU 上延迟差距在 0.6 ms 以内,但 CABiNet-S 的 mIoU 高出 +3.6(65.25 vs 61.69)。YOLO26s 仍然是更快的模型,因此这是一个纯粹的精度/延迟权衡,而非普遍性胜利。 2. **高精度端**:CABiNet-L vs YOLO26x。CABiNet-L 的 mIoU 高出 +2.7,且前向延迟约为其 1/3(4.44 vs 13.09 ms)。并非 CABiNet 是最快的模型(YOLO26n/s 更快);而是它在达到更高精度的同时,并未进入 YOLO26m/l/x 的延迟/计算区间。 3. **并非普遍更优**:在 VDD 和 AeroScapes 数据集上(使用相同的匹配评估方法),YOLO26 中型及以上模型超越了 CABiNet-Large,后者在那里的表现仅处于中等水平。数字和配置见代码仓库。 MobileNetV3 的深度可分离卷积在 FLOPs 上经济,但在 GPU 延迟上并不总是如此,这就是前沿呈现此种形态的原因。故事的核心是在高精度端的“每毫秒精度”,而非“最小最快”。 ## 定性对比 — CABiNet-L vs YOLO26x-sem +2.7 mIoU 的差距源于何处。UAVid 测试集上各分类别的 IoU,使用相同的单尺度评估: | 类别 | CABiNet-L | YOLO26x-sem | Δ | | :--- | :--- | :--- | :--- | | 人类 | 28.3 | 21.1 | **+7.2** | | 静止车辆 | 57.2 | 51.3 | **+5.9** | | 移动车辆 | 71.9 | 66.8 | **+5.1** | | 树木 | 80.3 | 78.2 | +2.1 | | 植被 | 64.1 | 63.3 | +0.8 | | 道路 | 80.3 | 79.8 | +0.5 | | 杂乱物 | 67.8 | 67.3 | +0.5 | | 建筑 | 87.1 | 87.4 | −0.2 | ## UAVid 测试集定性对比 差距几乎完全体现在小/细长类别上:行人和车辆。在大区域类别上,两者差距在半个百分点以内,YOLO26x 在“建筑”类别上略胜一筹。 两帧 UAVid 测试图像,均为单尺度推理;各列分别是:输入图像 · YOLO26x-sem · CABiNet-L · 真值标注。第二行展示了“静止车辆”类别数字背后的一个失败模式:YOLO26x 将停车场结构合并为一个“静止车辆/杂乱物”团块,并将“建筑”区域渗透到停车场中,而 CABiNet-L 则更贴近真值标注。选择这两帧是为了说明上述各类别的差异,而非作为具有代表性的随机样本。 ## 范围/局限性 1. 仅限 UAVid 数据集(见第 3 点)。VDD / AeroScapes 的数据和配置在代码仓库中;我重点介绍 UAVid 是因为结果清晰,而非隐藏其他结果。 2. 每个配置仅运行一次训练:没有种子扫描,没有方差估计。观察到的 ~2.7 mIoU(CABiNet-L vs YOLO26x)差距相对于此表中的较小差异来说是巨大的,但我并未确立其统计显著性。对于低于 ~1 个百分点的差异,我不会过度解读。 3. 延迟是基于单块消费级 GPU 的纯净前向传播测量。没有 TensorRT/ONNX,没有 Jetson,没有全帧滑动窗口开销(UAVid 源帧是 4K;CABiNet 使用分块,YOLO 使用缩放,因此端到端数字会有所不同)。请将这些数字理解为模型级别的 GPU 测量,而非部署吞吐量。 4. 初始化是不对称的:YOLO26-sem 从 Cityscapes + ADE20K 预训练开始,CABiNet 仅从 ImageNet 预训练主干开始。这很可能赋予了 YOLO26 在航空数据上的迁移学习优势,尽管其幅度未被测量。CABiNet 从更少特定领域优势的起点达到更高的 UAVid 精度,这是使结果有趣的部分,但它仍然是一个干扰因素。 ## 开源 * 权重(CABiNet-L/S 及所有 YOLO26-sem 尺寸)在 Hugging Face 上,附有模型卡与指标 * 完整 Hydra 配置、转换器和评估脚本;上述每一行结果均可复现 * 在线演示(UAVid):在 https://huggingface.co/spaces/dronefreak/uavid-aerial-segmentation 上运行任何检查点处理您自己的航空图像 ## 链接 * 代码 + 排行榜:https://github.com/dronefreak/CABiNet * 演示:https://huggingface.co/spaces/dronefreak/uavid-aerial-segmentation * 论文:CABiNet, ICRA 2021 (DOI 10.1109/ICRA48506.2021.9560977) ## 我最希望得到的批评 标准化数据表示、类别权重和评估方法,同时让每个模型保留其原生训练配方,这是比较不同谱系架构的有用方法吗?如果不是,您会标准化或改变什么?
查看原文

相似文章

Ultralytics YOLO26:统一的实时端到端视觉模型

Hugging Face Daily Papers

Ultralytics YOLO26 引入了一个统一的实时视觉模型家族,具有无需NMS的推理、改进的训练策略以及用于检测、分割和姿态估计的多任务能力,实现了最先进的精度与延迟权衡。

YOLO26 简介

Hacker News Top

YOLO26 是一个于2026年1月发布的多任务计算机视觉模型系列,具备无需 Non-Maximum Suppression 的端到端检测功能以降低延迟,并针对边缘部署进行了优化,具有改进的CPU推理能力和紧凑设计。

@injaneity: https://x.com/injaneity/status/2075659478096376158

X AI KOLs Timeline

本文解释了批处理和并行操作如何改善AI计算机使用系统中的延迟和效率,重点介绍了pi-computer-use和cua-driver等开源实现,它们在Codex出现类似功能之前就取得了显著的性能提升。