video-understanding

标签

Cards List
#video-understanding

M^3Eval:基于认知心理学的视频任务多模态记忆评估

Hugging Face Daily Papers ↗ · 2026-06-03 缓存

M^3Eval是一个全面的评估框架和基准,用于探查多模态模型中的记忆能力,其设计基于认知心理学。实验揭示了在记忆维持、干扰模式和时空定位方面的一致弱点。

0 人收藏 0 人点赞
#video-understanding

多模态视频理解中视觉状态追踪的基准测试

Hugging Face Daily Papers ↗ · 2026-06-02 缓存

介绍VSTAT,一个用于评估多模态大语言模型(MLLMs)中视觉状态追踪的基准,包含834个片段和1,500个问题。当前MLLMs表现远逊于人类,问题出在视觉感知而非推理上。

0 人收藏 0 人点赞
#video-understanding

X-Stream: 探索将MLLMs作为多流理解的多路复用器

Hugging Face Daily Papers ↗ · 2026-06-01 缓存

X-Stream 引入了首个多流视频理解基准,将MLLMs作为多路复用器在多个并发流中进行评估。研究表明,当前MLLMs仅能达到约50%的准确率,暴露了处理多流时的显著局限性。

0 人收藏 0 人点赞
#video-understanding

线性缩放视频VLM用于长视频理解

Hugging Face Daily Papers ↗ · 2026-05-29 缓存

StateKV是一种推理时方法,通过将跨帧上下文携带在固定容量的循环状态中,实现长视频视觉语言模型的线性时间视频预填充,在无需微调的情况下保持接近完全自注意力的准确性。

0 人收藏 0 人点赞
#video-understanding

EarlyTom:早期Token压缩实现快速视频理解

Hugging Face Daily Papers ↗ · 2026-05-28 缓存

EarlyTom是一个无需训练即可在视觉编码器早期压缩视觉token的框架,可减少首个token生成时间和计算成本,同时保持准确性,实现高达2.65倍的TTFT降低。

0 人收藏 0 人点赞
#video-understanding

Kwai-Keye/Keye-VL-2.0-30B-A3B

Hugging Face Models Trending ↗ · 2026-05-25 缓存

Kwai-Keye 发布了 Keye-VL-2.0-30B-A3B,这是一款 30B 级别的视觉语言模型,具备先进的视频理解、稀疏注意力机制和智能体能力,在多项基准测试中达到顶尖水平。

0 人收藏 0 人点赞
#video-understanding

LLaVA-OneVision-2:迈向下一代感知智能

Hugging Face Daily Papers ↗ · 2026-05-25 缓存

LLaVA-OneVision-2 引入了编解码流分词和窗口注意力机制以实现高效的视频理解,在包括视频、空间和跟踪任务在内的多个多模态基准测试中取得了最先进的性能。

0 人收藏 0 人点赞
#video-understanding

MetaphorVU:面向隐喻视频理解

Hugging Face Daily Papers ↗ · 2026-05-25 缓存

本文介绍了MetaphorVU-Bench,这是首个针对隐喻视频理解的系统化基准,并提出了MetaphorBoost,一种推理时增强框架,可改善多模态大语言模型中的跨域映射。

0 人收藏 0 人点赞
#video-understanding

Show HN: Lance – 图像/视频生成与理解统一模型

Hacker News Top ↗ · 2026-05-20 缓存

字节跳动发布Lance,一个3B参数的统一多模态模型,支持图像和视频的生成、理解与编辑,采用多任务方案从头开始训练。

0 人收藏 0 人点赞
#video-understanding

Flat-Pack Bench:通过家具组装评估大型视觉-语言模型的时空理解能力

Hugging Face Daily Papers ↗ · 2026-05-20 缓存

介绍了Flat-Pack Bench,一个通过家具组装任务评估大型视觉-语言模型细粒度时空推理能力的基准测试。实验表明,当前的LVLMs在跟踪和空间交互方面存在困难。

0 人收藏 0 人点赞
#video-understanding

@HappyyPablo: 开源 Marlin-2B,一个小型视觉语言模型,用于从视频中提取结构化信息。Marlin 针对两个问题进行了微调……

X AI KOLs Timeline ↗ · 2026-05-19 缓存

开源 Marlin-2B,一个用于从视频中提取结构化信息的小型VLM,经过微调以回答'发生了什么以及何时发生'。在其重量级别中最佳的开放模型,与 Gemini-2.5-flash 竞争。

1 人收藏 1 人点赞
#video-understanding

ParaVT: 在智能体视频强化学习中驯服工具先验悖论以实现并行工具使用

Hugging Face Daily Papers ↗ · 2026-05-19 缓存

ParaVT 提出了第一个用于并行视频工具调用的多智能体端到端强化学习框架,通过 PARA-GRPO 解决了工具先验悖论,并完全开源了论文、代码、权重和数据。

0 人收藏 0 人点赞
#video-understanding

@elonmusk: Grok 已能理解视频

X AI KOLs Following ↗ · 2026-05-18 缓存

Grok 现在支持完整的视频分析功能,包括摘要生成、翻译、场景解释和上下文提取,成为原生多模态模型,具备强大的视觉能力。

0 人收藏 0 人点赞
#video-understanding

看我之意:面向视频细粒度对象理解的视觉与语言表征对齐

Hugging Face Daily Papers ↗ · 2026-05-18 缓存

SWIM是一种新颖的训练策略,仅使用文本提示即可对齐视觉和语言表征以实现细粒度对象理解,并在训练期间利用掩码监督来改善跨模态注意力。该方法引入了NL-Refer数据集,并在细粒度对象理解基准测试中取得了优于基于视觉提示的方法的性能。

0 人收藏 0 人点赞
#video-understanding

OmniPro:面向全主动流式视频理解的综合基准

Hugging Face Daily Papers ↗ · 2026-05-18 缓存

OmniPro 是首个用于评估全模态大语言模型中主动流式视频理解的基准,包含 2,700 个样本,覆盖多种任务和双模式评估协议。

0 人收藏 0 人点赞
#video-understanding

LiteFrame: 高效视觉编码器解锁视频大语言模型的帧缩放

Hugging Face Daily Papers ↗ · 2026-05-17 缓存

LiteFrame提出了一种轻量级视频编码器,采用压缩令牌蒸馏(Compressed Token Distillation)训练,可降低延迟,并使视频大语言模型能够处理8倍以上的帧数以实现长视频理解,在降低计算量的同时提高准确性。

0 人收藏 0 人点赞
#video-understanding

bytedance-research/Lance

Hugging Face Models Trending ↗ · 2026-05-15 缓存

字节跳动研究团队推出Lance,一个30亿参数(3B参数)的统一多模态模型,在128块A100 GPU上从零开始训练,能够在单一框架内进行图像和视频的理解、生成和编辑。

0 人收藏 0 人点赞
#video-understanding

VideoSeeker: 通过原生智能体工具调用激励实例级视频理解

Hugging Face Daily Papers ↗ · 2026-05-15 缓存

VideoSeeker 引入了一种实例级视频理解的新范式,将智能体推理与视觉提示相结合,通过自动化数据合成和强化学习实现卓越性能,超越了 GPT-4o 和 Gemini-2.5-Pro。

0 人收藏 0 人点赞
#video-understanding

@VincentLogic: NVIDIA 这次真的不讲武德,直接甩出一个开源的视频理解怪兽 Nemotron 3 Nano Omni,处理视频快得离谱:1 小时就能搞定 10 小时的视频内容,比播放速度还快 10 倍 核心靠的是 3D 卷积技术,不再逐帧傻扫,而是成…

X AI KOLs Timeline ↗ · 2026-05-14

NVIDIA 开源了视频理解模型 Nemotron 3 Nano Omni,采用 3D 卷积技术,处理速度比播放速度快 10 倍,擅长音视频分析、监控检索和素材打标,但不适用于代码或文本推理任务。

0 人收藏 0 人点赞
#video-understanding

ViMU:视频隐喻理解基准

Hugging Face Daily Papers ↗ · 2026-05-14 缓存

ViMU是首个旨在评估视频理解模型超越字面视觉理解、解读隐喻、讽刺及社会意义能力的基准,采用无提示的开放式和多项选择题。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈