可见光与热红外光谱范围内视频监控的增强技术
摘要
本文研究了基于CNN的多光谱图像分类中的增强技术,这些图像来自可见光和热红外相机,利用ThermalWorld数据集来理解不同增强方法对分类准确率的影响。
arXiv:2606.13042v1 公告类型:新
摘要:在智能视频监控中,摄像头在白天和夜晚记录图像序列。通常,这需要不同的传感器。为了获得更好的性能,将它们结合起来并不罕见。我们聚焦于这样一个场景:一台长波红外相机连续记录,同时另一台相机在白天记录可见光谱范围内的图像,并由智能算法对采集到的影像进行监控。更准确地说,我们的任务是基于多光谱CNN的目标检测。乍一看,可见光谱范围与热红外图像的区别在于,前者具有颜色和清晰的纹理信息,而不包含物体发出的热辐射信息。尽管颜色可以为分类任务提供有价值的信息,但诸如光照变化和不同传感器的特性等因素仍然构成显著问题。无论如何,获取足够且实用的热红外数据集来训练深度神经网络仍然是一个挑战。这就是为什么借助可见光谱范围的数据进行训练可能是有利的,特别是当待评估的数据同时包含可见光和红外数据时。然而,目前尚不清楚热辐射、形状或颜色信息的变化对分类准确率的影响程度。为了更深入地了解卷积神经网络如何做出决策以及它们从不同传感器输入数据中学到什么,我们研究了不同增强技术的适用性和鲁棒性...
查看缓存全文
缓存时间: 2026/06/12 08:55
# 可见光和热红外光谱视频监控的数据增强技术 来源: https://arxiv.org/html/2606.13042 \\authorinfo 通讯作者更多信息:V.B.:邮箱:[email protected],电话:+49 (0)72 43 92 21 67, ###### 摘要 在智能视频监控中,摄像头在白天和夜晚记录图像序列。通常情况下,这需要不同的传感器。为了获得更好的性能,将它们结合起来并不罕见。我们关注的情况是:一台长波红外相机持续记录,与此同时,另一台相机在白天记录可见光谱范围的图像,并由智能算法监控采集到的图像。更准确地说,我们的任务是基于多光谱 CNN 的目标检测。乍一看,来自可见光谱范围的图像与热红外图像在两方面不同:一方面前者具有颜色和清晰的纹理信息,另一方面前者不包含物体发出的热辐射信息。尽管颜色可以为分类任务提供有价值的信息,但不同的光照条件和不同传感器的特性仍然构成显著问题。然而,获取足够且实用的热红外数据集来训练深度神经网络仍然是一个挑战。这就是为什么借助可见光谱范围的数据进行训练可能是有利的,特别是当需要评估的数据同时包含可见光和红外数据时。然而,目前尚无明确证据表明热辐射、形状或颜色信息的差异对分类精度的影响程度。为了更深入地了解卷积神经网络如何做出决策以及它们从不同传感器输入数据中学到了什么,我们研究了不同增强技术的适用性和鲁棒性。我们使用了公开可用的大规模多光谱 ThermalWorld 数据集,该数据集包含长波红外和可见光谱范围的图像,显示人物、车辆、建筑物和宠物,并训练了一个用于图像分类的卷积神经网络。训练数据将通过基于其不同属性的多种修改进行增强,以找出哪些修改产生何种影响,并能带来最佳的分类性能。 ###### 关键词: 增强技术,视频监控,长波热红外,LWIR,颜色空间,灰度,图像分类,CNN ## 1 引言 ### 1.1 动机 处理热红外 (IR) 图像在安防和国防任务(如视频监控或无人地面车辆)中非常重要,并且在自动驾驶系统中也扮演着越来越重要的角色。为此训练出的卷积神经网络 (CNN) 已学会检测人员、车辆、建筑物、动物或其他感兴趣的目标。输入模型训练数据的属性对于目标检测的成功与否起着决定性作用。视频摄像头应昼夜监控,因此我们考虑使用的检测器应能可靠地对两种类型的图像数据进行分类。 根据数据集的不同,如果网络是用可见光谱 (VIS) 图像训练的,可以假设它擅长分类可见图像,但不擅长分类红外图像,反之亦然。然而,实际上,IR 和 VIS 图像可以通过各自具备的优势或缺失的劣势来相互补充:玻璃后的物体在 IR 中不可见,见图 1(a,b);IR 图像中存在干扰反射,见图 2(a);VIS 图像中模糊的遮挡物体,见图 1(d-f);或者光照不足的问题,见图 1(c) 和图 2(b)。对于人类来说,预测哪种光谱范围效果好、哪种不好并不总是容易的。例如,图 3 中 VIS 图像中的人物不易被人类检测到,因为图像相当混乱,但机器检测它的效果却比对应的 IR 图像更好。 如果查看相关 IR 和 VIS 检测对根据真实标注的置信度值,会发现两种光谱范围的利用仍有提升空间。图 4 中的右下角和左上角显示,在另一种光谱范围中要么没有检测到,要么检测置信度很低。 因此,目前尚不清楚哪种训练数据能在多光谱评估中达到最佳性能。此外,一个大问题是 CNN 需要大量的训练数据,而标注这些数据是一个繁琐的过程。特别是兼容标注的长波红外数据很稀缺。这就是为什么我们更倾向于使用可见光范围的图像来训练我们的网络,并寻找合适的增强技术来准备它们。 图注说明 (a) 图注说明 (b) 图注说明 (c) 图注说明 (d) 图注说明 (e) 图注说明 (f) 图 1:IR 或 VIS 检测中优缺点示例:玻璃后的物体仅在 VIS 中可见 (a,b)。黑暗情况下的运动模糊,IR 效果更好 (c)。模糊遮挡导致 IR 效果更好 (d-f)。(白色框为真实标注,蓝色框为 IR 和 VIS 的检测结果,红色框为仅在一个光谱范围的检测结果,黄色框为无匹配真实标注的检测结果)。所有示例均来自 MIL Tokyo 检测数据集 [10]。 图注说明 (a) 图注说明 (b) 图 2:IR 或 VIS 检测中优缺点的更多示例:由于玻璃表面的反射,IR 检测更容易出错 (a)。示例来自 DGB Toronto 数据集 [7]。IR 检测在黑暗环境下效果更好 (b)。示例来自 CATS 数据集 [11]。 图注说明 (a) 图 3:有时对人类来说更可见的光谱并不一定是检测效果更好的光谱。红色框:VIS 检测结果,白色框:IR 中遗漏的真实标注。图像来自 MIL Tokyo 检测数据集 [10]。 图注说明 (a) 图 4:MILtokyo 数据集上的 YOLOv3 检测器:IR 和 VIS 检测中的置信度值。对应检测结果相对于真实标注的置信度值相互对比。 ### 1.2 相关工作 2008 年,Zhang 和 Viola [12] 介绍了一种红外行人检测器,该检测器使用可见光谱图像进行训练,因为人类在各光谱中的整体形状相似。关于可见光和热人脸识别的早期对比研究之一由 Socolinsky 和 Selinger [9] 提出。他们得出结论:“人脸的长波热红外图像不仅是一种有效的生物特征,而且几乎可以肯定比相应的可见光图像更优越。” 2013 年,Kieritz 等人 [4] 使用来自可见光谱的跨模态检测器进行训练,并将其应用于红外图像。 如今,基于 CNN 的方法变得流行,因为它们获得了良好的实际效果。它们是通用框架,不需要太多开发。2015 年,Sarfraz 和 Stiefelhagen [8] 发表了一种用于热到可见人脸识别的方法。他们的模型试图学习从可见到热红外光谱的非线性映射,同时保留身份信息。König 等人 [6] 提出了一种新颖的多光谱区域提议网络,该网络基于预训练的 VGG-16,用于从结合了可见光和红外图像信息的多光谱图像中检测行人。2018 年,Herrmann 等人 [2] 使用预训练的神经网络处理 IR 数据,这些数据被尽可能转换为接近 RGB 域。他们应用的方法包括拉伸、均衡化、反转以及拉伸和反转的组合。 ### 1.3 贡献 我们借鉴了 Herrmann 等人 [2] 的方法,并调整和优化了增强技术,以便在测试数据是 VIS 和 IR 数据的混合时获得更好的结果。与他们相反,我们将可见光数据尽可能转换为接近红外数据,而不是反过来。我们不使用拉伸或均衡化,而是将图像转换为不同的颜色系统。我们的目标是使易于获取的训练数据与专门处理可见光和热红外图像混合的检测器兼容。显然,让可见光图像看起来更像红外图像是有目的性的。为此,我们尝试了下面描述和可视化的几种方法。总的来说,与未增强的可见光训练数据相比,我们在红外图像分类以及可见光和热红外混合图像分类方面分别提高了约 76% 和 24%。纯可见光测试数据的性能保持不变。为了强调结果并深入了解 CNN 从输入数据中学到了什么,我们还比较了所用技术第一层卷积的滤波器核。 ## 2 方法 ### 2.1 使用的增强技术示例 在这项工作中,我们有输入图像对 (i, v) ∈ IR, VIS,现在对其进行描述。设 T 为元素在 [0,1] 中的张量,代表具有 c 个通道的图像。可见光彩色输入图像 v 的高度为 h,宽度为 w,像素被缩放为 v ∈ [R, G, B] ⊂ T^(h×w×c), (1) 其中 c=3, v_ij1=R, v_ij2=G, v_ij3=B ∈ T^(h×w)。此外,设 i ∈ IR ⊂ T^(h×w) (2) 描述热红外图像。现在,我们想要转换可见的 RGB 图像。转换为灰度时,采用凸组合。该模型也称为亮度 (Luminance),其灵感来源于人眼对红、绿、蓝感知敏感度不同的当前光谱: v' = [0.2989R + 0.5870G + 0.1140B] ∈ T^(h×w)。 (3) 另一种灰度空间是强度 (Intensity),即 RGB 通道的均值: v' = (1/3)[R + G + B] ∈ T^(h×w)。 (4) 更简单的是值 (Value),逐像素设置 v' = max_{i,j}(v_ij1, v_ij2, v_ij3) ∈ T^(h×w) (5) 仅考虑沿第三轴的最大条目。高斯模糊也是一种增强技术,使图像更模糊,相当于将图像的每个通道与二维高斯函数进行卷积。对于每个通道,逐像素计算: v'_ij = v_ij * (1/(2πσ^2)) exp(-||v_ij||^2/(2σ^2))。 (6) 要计算图像 v ∈ VIS 的反转 (inverse),只需设置 v' = 1_hwc - v, (7) 其中 1_hwc 描述一个全为 1 的 h×w×c 张量。可以通过将 b ∈ [-1,1] 加到 v 中每个条目 v_ijc 上来修改强度 (Intensity): v'_ijc = min(max(v_ijc + b, 0), 1)。 (8) 要通过因子 k ≥ 0 改变对比度 (contrast),按通道设置: v'_ij = (v_ij - 1_hw ⋅ mean(v_ij)) ⋅ k + 1_hw ⋅ mean(v_ij)。 (9) 在这项工作中,我们将增强技术 A 应用于输入图像 v ∈ VIS,参见 Buhrmester 等人 [1] A: v → A(v), (10) A 是一个或多个所述转换或恒等函数的连续执行。预处理后的图像现在可以输入分类算法,即 CNN。它将输入图像 v ∈ VIS, i ∈ IR 映射到预测: CNN: A(v) → P', CNN: i → P。 (11) 我们的目标是计算 A,使得 P ≈ P'。 ## 3 实验 在本节中,我们描述我们的数据、深度神经网络以及如何将之前介绍的增强技术应用于输入图像。此外,我们解释研究结果。 ### 3.1 数据 我们使用 ThermalWorld 数据集 [5] 进行实验。它提供了 1659 对带真实标注类别标签的对齐彩色和热图像。图像尺寸分别为 1185×889×3 像素和 640×480×1 像素。约 21% 用于验证。数据标注有 9 个类别 [car, truck, minibus, bus, building, human, cat, dog, boat],见图 5。 图注说明 图 5:ThermalWorld 数据集的图像,包括人类、汽车、猫、公交车、人类、建筑物,分别以 VIS 和 IR 显示。 ### 3.2 神经网络 作为模型,我们使用一个在分类任务中表现良好的已建立卷积神经网络。该架构有两个卷积层 (conv1, conv2),带有最大池化 (pool1, pool2),以及三个全连接层 (fc1, fc2 和 softmax),并具有标准化、数据增强、归一化和 dropout 等最先进工具,参见 Hinton 等人 [3]。我们相应地修改了它,以便输入彩色、灰度或红外图像,并可视化第一层的核和输出。输入图像分别缩放为 128×128×3 和 128×128×1 的大小。 ### 3.3 执行 首先,我们用热红外图像训练我们的神经网络。之后,我们用可见的 RGB 图像训练我们的网络。对于每种测试模式(测试图像为 IR 或 VIS 或它们的混合 (IR/VIS)),我们得到一个比较值 P。我们的目标是找到一种增强技术 A,以提高网络在测试用例 IR、VIS 和 IR/VIS 中的性能 P'。使用尽可能在光学上将可见图像转换为接近热红外图像的变换是很有前景的。首先,我们尝试转换为不同的灰度模式:亮度 (Lum)、强度 (Intensity) 和值 (Value)。之后,我们在图像上添加高斯模糊 (blur),σ=0.5。我们还对它们进行反转 (inv) 或改变亮度或对比度。我们对这些变换的几种组合进行了实验。最后,我们将这些不同的增强图像输入到我们的架构中,并以多种模式训练网络。我们比较测试图像 (IR、VIS 和 IR/VIS) 的准确率 P'(A),以找出哪种增强 A 使得 P ≈ P' 最接近。在评估中,当然也对可见测试图像 VIS 应用了相同的预处理。 ### 3.4 结果 表 1:不同增强技术下的测试准确率 (%)。 表 2: 训练模式 / 测试模式 | IR | VIS | IR/VIS --- | --- | --- | --- RGB | 33 | 99 | 66 Luminance | 32 | 99 | 65.5 Lum blur | 52 | 71 | 61.5 Lum inv | 54 | 99 | 76.5 Intensity inv blur | 56 | 99 | 77.5 Lum inv blur contrast | 56 | 99 | 77.5 Lum inv blur | 58 | 99 | 78.5 Lum inv blur brighter | 58 | 99 | 78.5 IR | 76 | 51 | 63.5 ![[未加标题的图像]](此处无对应caption文本,保留原样)
相似文章
基于Token的双视角融合与大视觉模型在乳腺癌分类中的适配
本文提出了一种以Token为中心的双视角学习框架,在冻结的视觉Transformer中统一了基于提示的适配和跨视角融合,以改善基于乳腺X线图像的乳腺癌分类,在VinDr-Mammo和CMMD数据集上取得了一致的性能提升。
自然图像对比学习理论
本文通过分析计算,针对基本数据增强和具有平稳统计特性的自然图像,在对比损失下得到了最优表示。结果表明,最优CNN的第一层滤波器是正弦波,且权重可通过注水算法计算。
迈向暗光环境下鲁棒且三维感知的RGB-NIR成像
本文提出了一种用于RGB-NIR低光成像的三维感知神经方法,该方法在三维空间中将极度含噪的RGB观测与NIR线索融合,无需干净RGB监督,并提高了跨不同噪声水平的鲁棒性。
AGVBench:面向可靠性的静脉识别数据增强基准测试
AGVBench是一个面向可靠性的静脉识别数据增强基准测试,评估了多个数据集和骨干网络上的30种增强策略,揭示了准确性与安全性之间的解耦。
@ninaddaithankar: 视觉模型能否在没有数据增强、掩码、裁剪或重建的情况下学会观察?它可以!介绍……
介绍了时间差视觉表征学习范式(Temporal Difference in Vision, TDV),这是一种新颖的视觉表征学习范式,无需数据增强、掩码、裁剪或重建即可学习有用的表征,并在密集空间任务上达到与最先进方法相当的性能。