O-VAD:通过以对象为中心的跟踪与推理实现工业视频异常检测
摘要
O-VAD 提出了一种无需训练的智能体框架,用于工业视频异常检测,该框架随时间跟踪对象状态演变,并在时间轨迹上进行推理以识别异常对象,在三个数据集上优于现有的 VLM 和 VAD 方法。
查看缓存全文
缓存时间: 2026/07/27 17:45
论文页面 - O-VAD:通过以对象为中心的跟踪与推理实现工业视频异常检测
来源:https://huggingface.co/papers/2607.18142
摘要
工业视频异常检测(Industrial Video Anomaly Detection, IVAD)旨在识别工业流程中的异常对象和事件,这对于现代制造和质量控制系统至关重要。现有的基于VLM的异常推理方法能够检测通用领域的开放式异常。然而,在工业场景中,由于对象变换复杂、物理规律严格以及流程约束众多,这些方法的性能会下降。为了应对这类交互密集型检测的复杂性,我们提出了一种无需训练、无需领域特定知识的智能体框架,该方法如同人类检验员一样,重点关注对象状态的演变过程。该框架旨在跟踪检测对象在时间上的空间-时间动态及潜在变换,然后基于对象级别的时间状态轨迹进行推理,从而在定位框架中识别出异常对象。我们的方法克服了以往方法的局限性——以往方法要么依赖在正常片段上的重新训练,要么在测试推理时注入领域知识作为上下文。在三个IVAD数据集上的大量实验表明,我们的方法不仅优于前沿的VLM、智能体框架以及在相应数据集上微调的传统VAD方法,还能生成关于异常过程和类型的可解释报告。
查看 arXiv 页面 (https://arxiv.org/abs/2607.18142)
查看 PDF (https://arxiv.org/pdf/2607.18142)
项目页面 (https://o-vad.github.io/)
GitHub2 (https://github.com/o-vad/O-VAD)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.18142)
在你的智能体中获取该论文:
hf papers read 2607.18142
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型0
没有模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2607.18142 即可在本页面建立链接。
引用本文的数据集0
没有数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.18142 即可在本页面建立链接。
引用本文的 Spaces0
没有 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2607.18142 即可在本页面建立链接。
收录本文的收藏集0
没有收藏集收录此论文
添加此论文至一个收藏集 (https://huggingface.co/new-collection) 即可在本页面建立链接。
相似文章
小巧但可信:高效视觉语言推理用于时间序列异常检测
本文提出 VisAnomReasoner,一个参数高效的视觉语言模型,在带自然语言解释的新基准 VisAnomBench 上微调,在时间序列异常检测中精度和 F1 提升超过 21 个百分点,并展现出强大的跨基准泛化能力。
面向多模态在线分布式工业异常检测的参数高效多类智能调度
本文提出MODIAD,一种面向多模态在线分布式工业异常检测的框架,通过多类智能调度问题和资源高效类级低秩自适应(REC-LoRA)策略解决资源约束问题。在MVTec 3D-AD和Eyecandies数据集上的实验展示了卓越的性能和效率。
OmniVideo-100K:一个通过结构化脚本和证据链进行音视频推理的数据集
OmniVideo-100K介绍了一个自动化的数据引擎,通过实体锚定脚本和线索引导的问答生成来提升音视频推理和时间一致性,在多个基准测试上实现了显著的性能提升。
原生主动感知作为全模态理解的推理方式
介绍OmniAgent,一个全模态代理,使用迭代的观察-思考-行动循环与主动感知,实现卓越的长视频理解,在基准测试上优于更大的模型如Qwen2.5-VL-72B。
Light-Omni:带长期记忆的智能体视频理解中反射优先于推理
Light-Omni是一个多模态智能体框架,用于高效视频理解,通过双上下文状态(全局状态和参数化潜在状态)避免迭代推理,实现更快更准确的处理,并显著提升速度和节省内存。