自然语言理解在多模态视频登革热诊断中的作用

arXiv cs.AI 论文

摘要

本文提出了一种基于YOLO和CLIP的视觉-语言框架,用于对蚊虫飞行帧进行分类以检测登革热病毒,在帧级别实现了98.54%的准确率和99.91%的灵敏度,经过时间聚合后达到完整的视频级别性能。

arXiv:2608.12677v1 公告类型:新 摘要:从视频数据中检测蚊子感染相关的行为变化具有挑战性,因为蚊子体型小、运动快速且不规则,并且受到背景、光照和阴影等环境因素的影响,这可能使可靠的特征提取变得困难。本研究提出了一种基于YOLO和对比语言-图像预训练(CLIP)的视觉-语言框架,用于对未感染和登革热病毒血清型2型(DENV2)感染蚊子的飞行帧进行分类。首先,使用YOLO将蚊子区域从背景中分离出来。然后,从视频帧中提取的视觉特征在共享嵌入空间中对齐语义上有意义的文本提示。该多模态模型通过监督双向对比学习进行微调,并通过基于帧级别的图像-文本相似度分类进行评估。结果表明,所提方法在帧级别达到了98.54%的准确率和99.91%的灵敏度。在对帧级别信息进行时间聚合后,模型实现了完整的视频级别性能。消融结果表明,微调和基于CLIP的表示对于该领域至关重要,而文本分支提供了语义上的图像-文本对齐,但在准确率上并未优于纯视觉模型。这些发现表明,视觉-语言模型可以为从视频数据中分析感染相关的生物行为提供有用的框架。
查看原文
查看缓存全文

缓存时间: 2026/08/14 09:27

# 自然语言理解在多模态视频登革热诊断中的作用
来源: https://arxiv.org/abs/2608.12677
查看 PDF (https://arxiv.org/pdf/2608.12677)

> 摘要:从视频数据中检测蚊子感染相关的行为变化具有挑战性,因为蚊子体型小、运动快速且不规则,并且会受到背景、光照和阴影等环境因素的影响,这使得可靠的特征提取变得困难。在本研究中,提出了一种基于 YOLO 和对比语言-图像预训练(CLIP)的视觉-语言框架,用于对未感染和感染登革病毒血清型 2(DENV2)的蚊子的飞行帧进行分类。首先,使用 YOLO 将蚊子区域与背景分离。然后,从视频帧中提取的视觉特征在共享嵌入空间中与具有生物学意义的文本提示进行对齐。多模态模型通过有监督的双向对比学习进行微调,并通过基于帧级图像-文本相似度的分类进行评估。结果表明,所提出的方法在帧级达到了 98.54% 的准确率和 99.91% 的灵敏度。在时间聚合帧级信息后,该模型实现了完全的视频级性能。消融结果表明,微调和基于 CLIP 的表示对于该领域至关重要,而文本分支提供的是语义图像-文本对齐,而非相较于纯视觉模型的准确率优势。这些发现表明,视觉-语言模型可以为从视频数据分析感染相关生物行为提供有用的框架。

## 提交历史

来自: Danial Sharifrazi [查看邮件 (https://arxiv.org/show-email/bb15516b/2608.12677)] **[v1]** 2026年8月13日 星期四 00:27:22 UTC (531 KB)

相似文章

Ultralytics YOLO26:统一的实时端到端视觉模型

Hugging Face Daily Papers

Ultralytics YOLO26 引入了一个统一的实时视觉模型家族,具有无需NMS的推理、改进的训练策略以及用于检测、分割和姿态估计的多任务能力,实现了最先进的精度与延迟权衡。

当视觉为声音代言

Hugging Face Daily Papers

本文发现,具备视频处理能力的多模态大语言模型(MLLMs)表面上似乎能够理解音频,但实际上依赖视觉线索,这一失败模式被称为视听Clever Hans效应。我们提出了Thud,一个基于干预的探查框架来诊断该问题,并提出了一种对齐方案,将视听一致性提升了28个百分点。