video-understanding

标签

Cards List
#video-understanding

StreamArena:迈向连续、交互式且长时程的智能体流式视频理解

Hugging Face Daily Papers · 2026-08-06 缓存

StreamArena 是一个用于小时级交互式流式视频理解的基准测试,并配套了一种名为 StreamMind 的两层架构。该架构在实时感知、历史回顾、主动交互和工具使用方面均优于现有的流式基线方法。

0 人收藏 0 人点赞
#video-understanding

GST-Bench:VLMs能否从视频中形成全局空间意识?

Hugging Face Daily Papers · 2026-08-06 缓存

GST-Bench是一个新的VQA基准,用于评估视频理解中的全局空间意识,测试VLMs能否从长时间的第一人称视频中构建连贯的全局场景表示。对22个最先进的VLMs的评估显示,它们与人类之间存在巨大差距,最佳模型得分42.68,而人类为79.08。

0 人收藏 0 人点赞
#video-understanding

帧选择就是一切:让LLM看视频的笔记

Hacker News Top · 2026-08-03 缓存

面向LLM视频输入的帧选择优化工程笔记,涵盖场景检测、去重策略以及token预算管理。

0 人收藏 0 人点赞
#video-understanding

ViSAGE:构建用于长视频理解的自我纠正记忆

arXiv cs.AI · 2026-08-03 缓存

ViSAGE是一个用于长视频理解的多模态智能体记忆框架,通过跨模态绑定、双向记忆精炼和多智能体交叉验证来构建自我纠正、以实体为中心的记忆,相比基线实现了5.9%的准确率提升。

0 人收藏 0 人点赞
#video-understanding

@tom_doerr: VideoAgent 是一个一体化的开源框架,用于全面视频智能,结合理解、编辑和创意生成…

X AI KOLs Timeline · 2026-08-02 缓存

VideoAgent 是一个一体化的开源框架,用于全面视频智能,通过统一的智能体工作流结合理解、编辑和创意生成。

0 人收藏 0 人点赞
#video-understanding

@HuggingModels:认识一下 Mage-VL,多模态 AI 的游戏规则改变者!它在一个模型中处理图像、文本甚至视频理解。……

X AI KOLs Timeline · 2026-07-31 缓存

Mage-VL 被介绍为一款多模态 AI 模型,它在一个模型中处理图像、文本和视频理解,从而支持更丰富的交互式应用。

0 人收藏 0 人点赞
#video-understanding

RRM:经验驱动的反思性检索记忆用于长时程多模态推理

arXiv cs.CL · 2026-07-31 缓存

本文介绍了反思性检索记忆(RRM),一种记忆框架,从历史任务轨迹中提炼程序性检索经验,以改进长时程多模态推理中的证据检索。RRM在M3-Bench-Robot、M3-Bench-Web和Video-MME-Long基准上达到或超过了先前的最先进水平。

0 人收藏 0 人点赞
#video-understanding

从被动视频到可编辑体验:面向具身智能的物理接地体验合成

arXiv cs.AI · 2026-07-31 缓存

介绍Pegasus,一种低资源框架,利用基于图的任务表示、分层可供性潜在空间和闭环物理验证,将人类示范视频转换为机器人可执行数据,旨在将硬件数据收集转变为可规模化的知识迁移。

0 人收藏 0 人点赞
#video-understanding

Gemini Robotics ER 2:利用视频理解、任务编排和多机器人协作,驱动机器人技术

Google DeepMind Blog · 2026-07-30 缓存

Google DeepMind 发布 Gemini Robotics ER 2,这是一个具身推理模型,使机器人能够理解视频、编排任务并与多机器人协作,现通过 Gemini API 公开提供。

0 人收藏 0 人点赞
#video-understanding

microsoft/Mage-VL · Hugging Face - 一个高效的编解码器原生流式多模态基础模型

Reddit r/LocalLLaMA · 2026-07-28 缓存

微软推出了Mage-VL,这是一个编解码器原生的流式多模态基础模型,用于图像和视频理解。通过采用受视频编解码器启发的稀疏模式,该模型实现了高达3.5倍的推理加速,同时将视觉令牌减少了超过75%。

0 人收藏 0 人点赞
#video-understanding

@HaiyuWu1: 首先在潜空间中从互联网视频学习因果关系,然后使用强化学习教基础模型如何行动…

X AI KOLs Following · 2026-07-24 缓存

Induction Labs 推出了想象模型(imagination models),这是一种新的基础模型架构,从互联网规模的视频中学习。他们的第一个模型 Photon-1 通过观看 18 年的屏幕录像(无动作标签)学习使用计算机,以比 Gemini 3.1 Flash 低 30 倍的预训练成本取得了更好的结果。

0 人收藏 0 人点赞
#video-understanding

TimeLens2: 通用视频时间定位与多模态大语言模型

Hugging Face Daily Papers · 2026-07-19 缓存

TimeLens2 提出了一种使用多模态大语言模型的通用视频时间定位方法,将时间证据视为区间集,在多个基准上取得了最先进的性能。

0 人收藏 0 人点赞
#video-understanding

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

Hugging Face Daily Papers · 2026-07-17 缓存

视听火烈鸟(AV-Flamingo)是一个完全开放的视听大语言模型,专为理解和推理长视频及复杂视频而设计,在性能上优于同规模的开源模型,并与更大型模型竞争。

0 人收藏 0 人点赞
#video-understanding

VideoChat3: 完全开源的高效且通用的视频理解MLLM

Papers with Code Trending · 2026-07-16 缓存

VideoChat3是一个完全开源、高效且通用的以视频为中心的多模态大语言模型,引入了膨胀3D视觉Transformer (I3D-ViT)和自适应帧分辨率用于流式视频感知,以及可扩展的视频数据合成管道,仅用4B参数就实现了卓越性能。

0 人收藏 0 人点赞
#video-understanding

@heyshrutimishra: 重磅:中国网络安全公司刚刚找到了一种绕过人工智能最昂贵问题之一的方法。Meta 构建了一个 AI m…

X AI KOLs Timeline · 2026-07-14 缓存

360 AI Research 提出了 MoSA,一种从 10,000 小时未标注视频中学习物体识别的方法,可生成超过 2100 万个自动标签,无需人工干预,解决了 AI 昂贵标注的瓶颈。

0 人收藏 0 人点赞
#video-understanding

OpenMOSS-Team/MOSS-VL-Realtime

Hugging Face Models Trending · 2026-07-14 缓存

MOSS-VL-Realtime 是一个实时流式视觉语言模型,能够处理连续视频帧,支持可中断交互、主动静默和动态修正,具备时间戳感知编码和256K上下文窗口。

0 人收藏 0 人点赞
#video-understanding

Light-Omni:带长期记忆的智能体视频理解中反射优先于推理

Hugging Face Daily Papers · 2026-07-06 缓存

Light-Omni是一个多模态智能体框架,用于高效视频理解,通过双上下文状态(全局状态和参数化潜在状态)避免迭代推理,实现更快更准确的处理,并显著提升速度和节省内存。

0 人收藏 0 人点赞
#video-understanding

智能体“观看”视频的最佳方式?

Reddit r/AI_Agents · 2026-07-03

本文讨论了AI代理处理和理解视频内容的最优方法,探索了各种视频分析技术。

0 人收藏 0 人点赞
#video-understanding

全模态密集视频字幕生成的并行自回归解码

Hugging Face Daily Papers · 2026-07-03 缓存

本文介绍了PadCaptioner,一个3B参数的全模态密集视频字幕模型,采用并行自回归解码实现高效率和高品质,性能超越7B参数模型。通过利用事件间的弱局部依赖关系,潜在规划机制实现了无损并行生成。

0 人收藏 0 人点赞
#video-understanding

Video-Oasis: 重新思考视频理解的评估

Hugging Face Daily Papers · 2026-07-02 缓存

Video-Oasis 揭示,现有视频基准测试中 55% 可以在没有视觉输入的情况下解决,暴露了当前视频理解模型的显著能力差距。最先进的模型在剩余的视频原生挑战上仅略高于随机猜测。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈