针对设备端火灾理解的视觉语言模型蒸馏

arXiv cs.AI 论文

摘要

本文提出一种知识蒸馏框架,用于压缩视觉语言模型以实现设备端火灾检测,表明紧凑模型能够保留大部分教师模型的能力,同时可在嵌入式硬件上部署。

arXiv:2609.05782v1 公告类型:新 摘要:视觉语言模型(VLMs)通过推理场景的语义上下文并从而减少误报,为传统火灾检测系统提供了一种有前景的替代方案,但其庞大的模型尺寸使得在嵌入式火灾传感器上的部署不切实际。本文研究了如何压缩领域专用VLMs以实现完全设备端部署,同时不丢失火灾检测所需的安全关键行为。我们开发了一个教师-学生知识蒸馏框架,其中针对火灾理解微调的大型VLMs可以蒸馏到轻量级学生模型中。跨多个VLM家族和模型规模的实验表明,紧凑的学生模型保留了其大部分教师模型的火灾理解能力。我们进一步将蒸馏模型部署在我们的商业Detectium火灾检测传感器上,并联合评估推理准确性、延迟和内存使用。结果显示,压缩和部署不仅影响准确性,还影响模型故障模式,其中Qwen2.5-0.5B提供了最佳的整体部署权衡。我们的研究结果为在资源受限、安全关键的环境中部署领域专用VLMs提供了更广泛的指导。
查看原文
查看缓存全文

缓存时间: 2026/09/10 08:42

# 用于设备端火灾理解的视觉语言模型蒸馏
来源:https://arxiv.org/html/2609.05782

###### 摘要
视觉语言模型(VLMs)通过对场景语义上下文进行推理,为传统火灾探测系统提供了一个有前景的替代方案,从而减少误报,但其庞大的模型尺寸使其难以部署在嵌入式火灾传感器上。本文研究了如何在不损失火灾探测所需的关键安全行为的前提下,压缩领域专用VLM以实现完全的设备端部署。我们开发了一个教师-学生知识蒸馏框架,其中针对火灾理解微调的大型VLM可以被蒸馏为轻量级的学生模型。跨越多个VLM家族和模型规模的实验表明,紧凑的学生模型保留了其教师模型的大部分火灾理解能力。我们将蒸馏后的模型部署在我们的商用Detectium火灾探测传感器上,并联合评估了推理准确率、延迟和内存使用情况。结果表明,压缩和部署不仅影响准确率,还影响模型的失效模式,其中Qwen2.5-0.5B提供了最佳的整体部署权衡。我们的研究结果为在资源受限、安全关键型场景中部署领域专用VLM提供了更广泛的指导。
¹EPFL,瑞士洛桑
²Detectium,芬兰埃斯波
[email protected], [email protected], [email protected]

## 1引言
工业环境中的传统火灾探测系统主要依赖烟雾探测器或热成像相机,当检测到烟雾或异常高温时触发警报(Fonollosa et al. 2018 (https://arxiv.org/html/2609.05782#bib.bib9); Khajavi et al. 2023 (https://arxiv.org/html/2609.05782#bib.bib1))。由于这些传感器响应的是底层物理信号而非周围环境,因此存在较高的假阳性率(Liu et al. 2023a (https://arxiv.org/html/2609.05782#bib.bib10)):良性场景,例如烹饪时的明火或工厂中故意控制的高温过程,可能会触发与真正危险火灾相同的警报(Mensch et al. 2024 (https://arxiv.org/html/2609.05782#bib.bib35))。每一次误报都需要人工核实,并可能触发代价高昂的干预,浪费资源并侵蚀对系统的信任(Tannous 2021 (https://arxiv.org/html/2609.05782#bib.bib11); Chagger and Smith 2014 (https://arxiv.org/html/2609.05782#bib.bib12))。

最近多模态模型的进展,特别是视觉语言模型(VLMs)(Liu et al. 2023b (https://arxiv.org/html/2609.05782#bib.bib6); Bai et al. 2025 (https://arxiv.org/html/2609.05782#bib.bib7); Team et al. 2024 (https://arxiv.org/html/2609.05782#bib.bib8); Liu et al. 2025 (https://arxiv.org/html/2609.05782#bib.bib34)),提供了一条超越信号级检测的途径。给定来自摄像头的图像帧,VLM可以对整个场景进行推理,例如区分受控火焰和不受控火焰,并评估所观察到的火灾是否构成真正的安全风险。先前的研究表明,与传统系统相比,这种语义推理显著降低了假阳性率(Gragnaniello et al. 2025 (https://arxiv.org/html/2609.05782#bib.bib3); Kim et al. 2025 (https://arxiv.org/html/2609.05782#bib.bib4)),为更智能的下一代火灾探测系统指明了方向。

然而,将VLM用于火灾探测受到模型规模与部署约束之间根本冲突的阻碍。拥有数十亿参数的现代VLM无法在火灾探测传感器的嵌入式硬件上运行,必须托管在云服务上,需要将每一帧捕获的图像上传以供分析。这带来了两个问题。第一是延迟。火灾蔓延迅速,一个实用的系统必须在起火初期就识别出危险火灾,才能有效进行缓解(Çetin et al. 2013 (https://arxiv.org/html/2609.05782#bib.bib13))。传统的烟雾探测器需要大约一分钟才能触发警报(Bukowski et al. 2003 (https://arxiv.org/html/2609.05782#bib.bib5))。为了在烟雾探测器之前发出警报,基于VLM的系统必须在几秒钟内完成其整个检测推理循环。然而,云推理增加了往返通信延迟,并且任何网络故障都可能导致系统在恰恰需要的时刻不可用。第二,也是更根本的,是隐私问题。火灾传感器必须安装在隐私期望最强的空间,例如私人公寓、公共洗手间或法规禁止将图像传输到外部场所的设施(Regulation 2016 (https://arxiv.org/html/2609.05782#bib.bib14); Kansal et al. 2025 (https://arxiv.org/html/2609.05782#bib.bib15)),使得持续上传图像到云服务不可接受。因此,火灾探测既需要现代大型VLM的语义推理能力,又要求完全的设备端推理以保证低延迟和隐私,而当前系统无法同时满足这些要求。

本文研究如何在不牺牲火灾探测所需的安全关键行为(即降低误报率)的前提下,充分压缩领域专用VLM以实现真实的嵌入式部署。为此,我们为设备端火灾理解开发了一个教师-学生知识蒸馏框架。我们首先将来自Qwen(Yang et al. 2025 (https://arxiv.org/html/2609.05782#bib.bib24))、Llama(Grattafiori et al. 2024 (https://arxiv.org/html/2609.05782#bib.bib25))和Gemma(Team et al. 2024 (https://arxiv.org/html/2609.05782#bib.bib8))家族的最新VLM微调为教师模型,以获取对火灾场景的上下文理解,然后将它们的火灾领域知识蒸馏到跨越多个参数规模的轻量级学生模型中。我们在DetectiumFire(Liu et al. 2026 (https://arxiv.org/html/2609.05782#bib.bib2))上评估所得模型,不仅测量其火灾理解能力,还评估其在决定误报性能的非火灾场景上的行为。我们的结果表明,紧凑的学生模型能够保留其教师模型的大部分能力,而增加学生模型规模带来的准确率提升却出人意料地有限。然后,我们将蒸馏后的学生模型部署在我们的商用Detectium火灾探测传感器上,在完全设备端推理的条件下联合评估其火灾理解准确率、安全相关的检测错误、推理延迟和内存消耗。这项部署研究表明,模型部署涉及的不仅仅是准确率-效率权衡:不同的架构和部署选择可能会系统性地将模型导向不同的失效模式。在测试的模型家族和规模中,Qwen2.5-0.5B提供了最佳的整体部署权衡。

总而言之,我们的贡献如下:
1. 我们开发了一个教师-学生蒸馏框架,将领域专用VLM压缩为适合完全设备端火灾理解的轻量级模型,同时在很大程度上保留了其语义推理能力。
2. 我们系统地研究了蒸馏在不同模型家族和规模上的影响,表明紧凑的学生模型保留了大部分教师性能,同时揭示了不同蒸馏目标下的重要失效模式。
3. 我们将蒸馏后的学生模型部署在我们的商用Detectium火灾探测传感器上,并刻画了推理准确率、安全相关的检测错误、延迟和内存消耗之间的实际权衡。

尽管我们的实验专注于火灾探测,但关于领域特定蒸馏、失效模式评估和部署时研究的见解广泛适用于其他需要资源受限设备端推理的安全关键VLM应用。

## 2相关工作
### 2.1用于火灾探测的VLMs
火灾探测传统上被表述为图像分类或目标检测(Çetin et al. 2013 (https://arxiv.org/html/2609.05782#bib.bib13); Liu 2023 (https://arxiv.org/html/2609.05782#bib.bib31); Elhanashi et al. 2025 (https://arxiv.org/html/2609.05782#bib.bib21); Khajavi et al. 2024 (https://arxiv.org/html/2609.05782#bib.bib36)),这能定位火焰但无法推理火灾是否具有危险性。最近的工作转而利用VLM的推理和语言能力,从检测转向语义理解:用自然语言描述和分析火灾场景(Seidel et al. 2025 (https://arxiv.org/html/2609.05782#bib.bib16)),并评估所观察到的火灾是否构成真正的风险(Gragnaniello et al. 2025 (https://arxiv.org/html/2609.05782#bib.bib3); Kim et al. 2025 (https://arxiv.org/html/2609.05782#bib.bib4))。诸如SmokeBench(Qi et al. 2026 (https://arxiv.org/html/2609.05782#bib.bib17))和多模态DetectiumFire数据集(Liu et al. 2026 (https://arxiv.org/html/2609.05782#bib.bib2))等基准测试进一步表明,VLM可以超越二元检测,描述燃烧物体、环境和风险水平。然而,现有工作评估的是离线VLM或假设云规模推理。将火灾领域VLM部署在嵌入式传感器上仍未被探索,这正是本工作的重点。

### 2.2用于VLM的知识蒸馏
知识蒸馏(KD)将大型教师的能力转移到小型学生(Hinton et al. 2015 (https://arxiv.org/html/2609.05782#bib.bib18); Kim and Rush 2016 (https://arxiv.org/html/2609.05782#bib.bib22)),并已成为部署可实现视觉语言模型的标准途径(Jin et al. 2025 (https://arxiv.org/html/2609.05782#bib.bib20); Shu et al. 2025 (https://arxiv.org/html/2609.05782#bib.bib19); Cai et al. 2025 (https://arxiv.org/html/2609.05782#bib.bib23); Ghonim et al. 2026 (https://arxiv.org/html/2609.05782#bib.bib37); Kumar et al. 2026 (https://arxiv.org/html/2609.05782#bib.bib38))。已经提出了几种用于VLM的蒸馏框架。例如,LLaVA-MoD(Shu et al. 2025 (https://arxiv.org/html/2609.05782#bib.bib19))通过模仿和偏好蒸馏,将大型教师逐步蒸馏为一个稀疏的混合专家学生。LLaVA-KD(Cai et al. 2025 (https://arxiv.org/html/2609.05782#bib.bib23))在一个多阶段训练方案中,结合了输出分布蒸馏和跨视觉标记的关系蒸馏。生产模型如Gemma 3(Team et al. 2024 (https://arxiv.org/html/2609.05782#bib.bib8))同样使用蒸馏进行训练。然而,现有的VLM蒸馏针对的是在标准多模态基准上测量的通用能力。相比之下,我们从部署的角度研究用于火灾理解的领域特定蒸馏,不仅评估视觉推理能力的保持情况,还评估其对安全关键行为、设备端延迟和资源消耗的影响。

## 3用于火灾理解的知识蒸馏
本节介绍我们用于设备端火灾理解的教师-学生知识蒸馏框架。我们首先在第3.1节(https://arxiv.org/html/2609.05782#S3.SS1)描述如何微调最先进大型VLM以获得火灾场景的上下文理解。然后,在第3.2节(https://arxiv.org/html/2609.05782#S3.SS2)介绍将此火灾领域知识蒸馏到轻量级学生模型的流程,遵循先前工作的标准蒸馏框架(Shu et al. 2025 (https://arxiv.org/html/2609.05782#bib.bib19))。

### 3.1教师模型
由于通用VLM并非专门训练用于推理火灾场景,且目前没有现成的火灾领域VLM适合作为蒸馏教师,我们通过两阶段过程构建了自己的火灾专用教师模型πT:
#### 基础初始化:
给定一个预训练的大VLM,我们同时冻结语言模型和视觉编码器,因为它们的预训练参数已经编码了丰富的语言和视觉表征。我们只训练视觉-语言适配器,它将视觉特征投影到语言嵌入空间中。对于这个初始化阶段,我们使用一个精心策划的图像-文本描述数据集,涵盖各种场景和视觉概念,以便在引入任何火灾特定监督之前,适配器能学习通用的视觉-语言对齐。具体来说,给定一个多模态指令示例(x,y),其中x=(xv,xi)由输入图像xv和文本指令xi组成,y表示真实响应,我们优化标准的下一个词预测目标:LInit(πT)=-E(yk∣y <...> 你是有用的、能够理解用户提供的视觉内容,并使用自然语言协助用户完成各种任务的语言和视觉助手。

因此,最终的部署配置由Q8_0量化的语言模型和F16多模态视觉模块组成。在推理时,导出的文件使用llama.cpp中的llama-server提供服务,该服务器加载模型并直接在传感器CPU上执行推理。

#### 使用MobileCLIP编码器的学生模型。
llama.cpp转换管道支持我们主要配置中使用的基于CLIP的视觉编码器,但不支持MobileCLIP-S2使用的FastViT(Vasu et al. 2023 (https://arxiv.org/html/2609.05782#bib.bib27))主干网络。因此,MobileCLIP-S2学生模型(Qwen3-0.6B和Qwen2.5-3B)无法通过相同的GGUF管道导出。相反,这些模型直接在传感器CPU上使用PyTorch以bfloat16精度执行,LoRA适配器在加载时应用,视觉编码器通过open_clip_torch(Ilharco et al. 2021 (https://arxiv.org/html/2609.05782#bib.bib28); Cherti et al. 2023 (https://arxiv.org/html/2609.05782#bib.bib32))加载。使用的CPU线程数与GGUF实验相同,为四个。由于MobileCLIP-S2模型使用与量化GGUF模型不同的运行时和数值精度,其延迟和准确率结果与基于CLIP的学生模型并不严格直接可比。因此,我们主要报告它们以描述轻量级视觉编码器在可用运行时下的部署行为。

### D.3测量
对于评估,我们使用与主实验相同的DetectiumFire评估集。每个推理请求包含一个以前未见过的单幅图像以及与火灾理解任务对应的提示。我们使用确定性解码,温度设置为0,最大生成长度为64个新标记。请求之间不重用任何图像或提示缓存,因此每个请求独立地重新编码输入图像,这与传感器处理实时图像流的行为一致。我们报告三个部署指标。*首token时间(TTFT)*衡量从接收到推理请求到生成第一个输出token的间隔。对于视觉语言模型,TTFT主要捕获预填充阶段,包括图像编码、将视觉特征投影到语言模型嵌入空间以及初始语言模型前向传递。*端到端延迟(E2E)*衡量总推理时间,包括TTFT和剩余输出token的自回归生成。*峰值常驻集大小(RSS)*衡量执行期间推理进程占用的最大物理内存。对于每个指标,我们按照标准的延迟基准测试实践,报告验证集中随机抽样的20个火灾理解请求的中位数而非平均值。

相似文章

Switch-KD:面向视觉语言模型的视觉开关知识蒸馏

Hugging Face Daily Papers

Switch-KD提出了一种新颖的视觉开关知识蒸馏框架,通过在共享的文本概率空间内统一多模态知识迁移,高效压缩视觉语言模型。该方法在将0.5B TinyLLaVA学生模型从3B教师模型中蒸馏时,在10个多模态基准测试上实现了平均3.6个百分点的提升。

基于噪声学生在线策略自蒸馏的自增强视觉语言模型

arXiv cs.LG

提出NOPD,一种自蒸馏方法,通过利用干净输入和损坏输入之间的预测差异,在没有外部监督的情况下改进视觉语言模型。在视觉推理任务上取得了显著提升,匹配或超过了强化学习和来自外部模型的蒸馏。

掩码蒸馏:将思维链内化到语言模型中

arXiv cs.AI

掩码蒸馏是一种知识蒸馏框架,它训练学生大语言模型仅预测解决方案令牌,同时推理教师提供反馈,旨在将思维链计算内化到模型参数中。该方法显示任务相关的成功,在GSM8K上有效,但对于像Countdown这样更困难的任务需要小型脚手架。