ReactVAU:一个用于流式视频异常理解的慢-快解耦框架
摘要
ReactVAU引入了一个用于实时流式视频异常理解的慢-快解耦框架,利用快速检测模块、持久化异常感知内存和按需慢速推理,以提高效率和性能。
查看缓存全文
缓存时间: 2026/09/09 08:31
论文页面 - ReactVAU:用于流式视频异常理解的快慢解耦框架
来源:https://huggingface.co/papers/2609.07941
摘要
ReactVAU通过快速检测模块、持续异常感知记忆和按需慢速推理模块,实现了实时流式视频异常理解,最大限度减少了对重型模型的使用。
本文我们提出了ReactVAU,一个用于实时流式视频异常理解(VAU)的快慢解耦框架(https://huggingface.co/papers?q=Slow-Fast%20Decoupled%20Framework)。现有的VAU方法依赖于离线推理和全局时序采样,这违反了因果性,并且无法部署到实时监控流中。相反,通用的流式视频模型虽然满足因果访问要求,但在内存压缩过程中稀释了罕见的瞬时异常,并且通常在长时间正常区间内统一调用重型多模态大语言模型。ReactVAU通过三个协同组件解决了这一差距:一个基于空间网格折叠的轻量级快速检测模块,用于持续异常过滤;一个异常感知持续记忆模块,保护关键视觉线索免受时间衰减影响;以及一个重型慢速推理模块,该模块在正常视频流期间保持休眠状态,仅由可疑事件唤醒,用于语义验证和因果描述。在多个基准上的大量实验表明,ReactVAU在严格的流式约束下运行,同时在异常检测和因果推理方面均取得了有竞争力的性能,并通过最大限度减少重型多模态大语言模型的调用显著提升了计算效率。项目页面:https://huiyuiui.github.io/ReactVAU/
查看arXiv页面 (https://arxiv.org/abs/2609.07941)查看PDF (https://arxiv.org/pdf/2609.07941)项目页面 (https://huiyuiui.github.io/ReactVAU/)GitHub2 (https://github.com/huiyuiui/ReactVAU-code)添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2609.07941)
在您的代理中获取此论文:
hf papers read 2609\.07941
没有最新版CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型README.md中引用 arxiv.org/abs/2609.07941 以从本页面链接到它。
引用此论文的数据集0
无数据集链接此论文
在数据集README.md中引用 arxiv.org/abs/2609.07941 以从本页面链接到它。
引用此论文的Spaces0
无Space链接此论文
在Space README.md中引用 arxiv.org/abs/2609.07941 以从本页面链接到它。
包含此论文的收藏集0
无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接到它。
相似文章
O-VAD:通过以对象为中心的跟踪与推理实现工业视频异常检测
O-VAD 提出了一种无需训练的智能体框架,用于工业视频异常检测,该框架随时间跟踪对象状态演变,并在时间轨迹上进行推理以识别异常对象,在三个数据集上优于现有的 VLM 和 VAD 方法。
VideoMLA:用于分钟级自回归视频扩散的低秩潜变量KV缓存
VideoMLA 用共享的低秩潜变量和解耦的 3D-RoPE 位置键替换了视频扩散模型中每个头的 KV 缓存,在 B200 上将每个 token 的 KV 内存降低了 92.7%,吞吐量提升了 1.23 倍,同时在 VBench 基准测试中保持了质量。
Glance, Scrutinize, and Think: Advancing Video Anomaly Detection from Training-Free to Agentic Reasoning
This paper presents a unified global-to-local paradigm for video anomaly detection, introducing a training-free framework (GtS) and a tool-augmented agentic reasoning method with reinforcement learning, along with a new benchmark VAGU-T and metric JeAUG.
超越检索:渐进式潜在记忆演化用于流式视频理解
LatentStream 引入了一个渐进式潜在工作记忆框架,该框架内化流式视觉证据以进行连续推理,在视频基准测试中实现了最先进的结果。
V-RAE:重新思考视频潜在空间用于生成
V-RAE提出了一种视频表示自编码器,它从冻结的视觉表示中构建语义组织的潜在表示,以提升视频生成质量、收敛速度和预测建模。