O-VAD:通过以对象为中心的跟踪与推理实现工业视频异常检测

Hugging Face Daily Papers 论文

摘要

O-VAD 提出了一种无需训练的智能体框架,用于工业视频异常检测,该框架随时间跟踪对象状态演变,并在时间轨迹上进行推理以识别异常对象,在三个数据集上优于现有的 VLM 和 VAD 方法。

工业视频异常检测(IVAD)旨在识别工业过程中的异常对象和事件,这对现代制造和质量控制系统至关重要。现有的基于 VLM 的异常推理方法能够在通用领域中检测开放式异常。然而,在具有复杂对象变换、严格物理和程序约束的工业场景中,它们的性能会下降。为了应对这种交互密集型检测的复杂性,我们提出了一种无需训练的智能体框架,用于无需领域特定知识的异常检测,强调像人类检查员那样的对象状态演变。该框架旨在随时间跟踪检测到的对象的时空动态和潜在变换,然后基于逐个对象的时态状态轨迹进行推理,以在定位帧中识别异常对象。我们的方法克服了先前方法的局限性,这些方法依赖于在正常片段上重新训练或在测试时注入领域知识作为上下文。在三个 IVAD 数据集上的大量实验表明,我们的方法优于前沿的 VLM、智能体框架以及在各自数据集上微调的传统 VAD 方法,同时提供关于异常过程和类型的可解释报告。
查看原文
查看缓存全文

缓存时间: 2026/07/27 17:45

论文页面 - O-VAD:通过以对象为中心的跟踪与推理实现工业视频异常检测

来源:https://huggingface.co/papers/2607.18142

摘要

工业视频异常检测(Industrial Video Anomaly Detection, IVAD)旨在识别工业流程中的异常对象和事件,这对于现代制造和质量控制系统至关重要。现有的基于VLM的异常推理方法能够检测通用领域的开放式异常。然而,在工业场景中,由于对象变换复杂、物理规律严格以及流程约束众多,这些方法的性能会下降。为了应对这类交互密集型检测的复杂性,我们提出了一种无需训练、无需领域特定知识的智能体框架,该方法如同人类检验员一样,重点关注对象状态的演变过程。该框架旨在跟踪检测对象在时间上的空间-时间动态及潜在变换,然后基于对象级别的时间状态轨迹进行推理,从而在定位框架中识别出异常对象。我们的方法克服了以往方法的局限性——以往方法要么依赖在正常片段上的重新训练,要么在测试推理时注入领域知识作为上下文。在三个IVAD数据集上的大量实验表明,我们的方法不仅优于前沿的VLM、智能体框架以及在相应数据集上微调的传统VAD方法,还能生成关于异常过程和类型的可解释报告。

查看 arXiv 页面 (https://arxiv.org/abs/2607.18142)
查看 PDF (https://arxiv.org/pdf/2607.18142)
项目页面 (https://o-vad.github.io/)
GitHub2 (https://github.com/o-vad/O-VAD)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.18142)

在你的智能体中获取该论文:

hf papers read 2607.18142

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型0

没有模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2607.18142 即可在本页面建立链接。

引用本文的数据集0

没有数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.18142 即可在本页面建立链接。

引用本文的 Spaces0

没有 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2607.18142 即可在本页面建立链接。

收录本文的收藏集0

没有收藏集收录此论文

添加此论文至一个收藏集 (https://huggingface.co/new-collection) 即可在本页面建立链接。

相似文章

原生主动感知作为全模态理解的推理方式

Hugging Face Daily Papers

介绍OmniAgent,一个全模态代理,使用迭代的观察-思考-行动循环与主动感知,实现卓越的长视频理解,在基准测试上优于更大的模型如Qwen2.5-VL-72B。