标签
本文提出了一种基于YOLO和CLIP的视觉-语言框架,用于对蚊虫飞行帧进行分类以检测登革热病毒,在帧级别实现了98.54%的准确率和99.91%的灵敏度,经过时间聚合后达到完整的视频级别性能。
本文介绍了V2N,这是首个完整的视觉钢琴转录系统,可联合从视频中预测起音、释音、按键保持和力度,在PianoVAM和R3基准上取得了最先进的结果。
对六个月内的10个AI初创公司发布视频进行分析,揭示了一个一致的规律,能够区分哪些视频获得了超过100万次观看,哪些以失败告终。
本文评估了帧采样率对使用LSTM和GRU模型进行基于序列的自闭症相关自我刺激手部行为分类的影响,在15帧间隔下实现了高达98.75%的准确率,并分析了针对小规模行为视频数据集的数据增强策略。
Lapian-Notes(拉片笔记)是一个开源的AI辅助电影分析工具,能自动抽帧、生成剧情泳道和情绪曲线,完全本地运行,无需上传数据。
该文章宣布开源发布 small_vlm_video_analysis,这是一个使用本地小型视觉语言模型的工具,用于验证程序化视频是否符合预定义的 SOP,包括帧描述、基于规则的判断以及可视化工具。
Claude Code 现在可以观看视频了,它利用 FFmpeg 场景检测在屏幕内容变化的关键时刻捕获帧,并集成从 YouTube 免费提取字幕或使用 Whisper 处理 Zoom/Loom 视频的字幕提取功能,使用户能够分析录制内容并将洞察保存到知识库中。
介绍 GitHub 上的 claude-video 工具,能让 Claude/Codex 等 AI Agent 分析视频内容,适用于拆解爆款视频、分析广告素材、诊断 bug 等多种场景。
介绍开源工具claude-real-video,它通过场景变化检测和音频转录,让任何LLM都能在本地分析视频,解决了固定帧采样和云上传的痛点。
Interhuman.ai 为其 Inter-1 模型推出了流式 API,通过 WebSocket 从实时视频流中检测 12 种社交信号,并支持参与度追踪和对话质量评分。
Artifact-Bench是一个综合性基准,用于评估多模态大语言模型在检测和分析AI生成视频伪影方面的表现,揭示了它们的显著局限性以及与人类感知的错位。
介绍knowly AI工具,可解读YouTube视频和arXiv论文,效果惊艳,交互与解读效果不逊于NotebookLM,有Chrome插件并通过谷歌精选。免费额度较少,向量处理稍慢。
Perceptron公司发布了其旗舰视频分析模型Mk1,声称成本比竞争对手低80-90%,同时在空间和视频推理基准上表现出色。
本文针对 Ego-Exo4D 数据集提出了三种参数高效的多视角熟练度评估方法,实现了从判别式分类到生成式反馈的转变。与基于视频 Transformer 的基线模型相比,所提出的模型在参数量和训练轮次大幅减少的同时,取得了最先进的准确率。
一个工具,让Claude能够通过提取字幕和帧来观看和分析视频,从而实现基于视频的查询和摘要。