video-understanding

标签

Cards List
#video-understanding

VideoMM:用于高效视频MLLMs的自适应宏微观推理

arXiv cs.AI ↗ · 2026-09-16 缓存

VideoMM 引入了一种自适应宏微观推理框架,可减少视频MLLMs中的视觉token开销,实现6.13倍的速度提升和7.4%的准确率增益,从而高效地理解长视频。

0 人收藏 0 人点赞
#video-understanding

高效推理蒸馏:通过合成思维链与难度感知微调的小型视频语言模型

arXiv cs.LG ↗ · 2026-09-16 缓存

本文提出了一种方法,利用合成的思维链理由和难度感知微调,将推理能力蒸馏到紧凑的视频语言模型中,使较小的模型能够在最小的计算开销下超越较大的模型。

0 人收藏 0 人点赞
#video-understanding

BVB:通过在 Blender 中进行程序化重建来基准测试代理视频理解

Hugging Face Daily Papers ↗ · 2026-09-14 缓存

论文介绍了 BVB,这是一个通过在 Blender 中进行程序化重建来基准测试代理视频理解的基准,评估模型在感知相似性和时空事实保留方面的表现。

0 人收藏 0 人点赞
#video-understanding

@FinanceYF5: GPT-6 Astra 实现了其他模型一直无法准确复制的机械结构:起落架……

X AI KOLs Following ↗ · 2026-09-11

GPT-6 Astra 成功从一段 YouTube 视频片段中复制了 Cessna 337 Skymaster 的起落架收放机制,克服了先前模型的局限性。

0 人收藏 0 人点赞
#video-understanding

VLX-VR:一种智能体感知的视频推理模型

arXiv cs.CL ↗ · 2026-09-10 缓存

VLX-VR是一种智能体感知的视频推理模型,它使用思考-记忆-观察循环和强化学习来自适应地收集证据,在MINERVA基准测试中达到了最先进的性能。

0 人收藏 0 人点赞
#video-understanding

Gemini的88%视频令牌减少功能率先应用于3.7 Flash,而非3.8版本

Reddit r/ArtificialInteligence ↗ · 2026-09-03

谷歌对Gemini 3.7 Flash的更新引入了高达88%的视频令牌减少功能,显著降低成本,但准确性提升存在疑问。

0 人收藏 0 人点赞
#video-understanding

选择、压缩、再投资:长视频多模态语言模型中视觉令牌分配的控制性研究

Hugging Face Daily Papers ↗ · 2026-09-03 缓存

本文对长视频多模态语言模型的视觉令牌分配进行了控制性研究,发现帧选择显著提升准确性,而空间压缩在节省的令牌重新投资到更多帧时几乎是免费的,强调了统一比较框架的必要性。

0 人收藏 0 人点赞
#video-understanding

@googleaidevs:Gemini能数出鼓掌的次数吗?准确计数快速运动对AI来说是出了名的棘手任务。因为……

X AI KOLs Timeline ↗ · 2026-09-01 缓存

Gemini 3.7 Flash展示了一项新的自主式视频理解功能,通过动态调整处理速度来准确计数像鼓掌这样的快速运动。

0 人收藏 0 人点赞
#video-understanding

@Saboo_Shubham_: 使用 Gemini 3.7 Flash 的智能体视频理解意义重大。只需降低成本、减少令牌并提高准确性。没什么大不了的…

X AI KOLs Following ↗ · 2026-09-01 缓存

该推文强调,使用 Gemini 3.7 Flash 的智能体视频理解显著降低成本、减少令牌使用量并提高准确性。

0 人收藏 0 人点赞
#video-understanding

介绍 Gemini 的代理式视频理解

Google DeepMind Blog ↗ · 2026-09-01 缓存

Google DeepMind 为 Gemini 模型推出代理式视频理解功能,可将令牌消耗减少高达88%并提升视频分析的准确性。

0 人收藏 0 人点赞
#video-understanding

@xiaohu: 这个牛P 解决了教机器人学习人类动作太费钱、太慢的问题 以往教机械臂抓东西,需要人工拿着手柄远程遥控(遥操作)成千上万个小时,成本极高。 Isaac让机器人看海量网上的普通视频就能学会技能 以往教机械臂抓东西,需要人工拿着手柄远程遥控(遥…

X AI KOLs Timeline ↗ · 2026-08-27 缓存

Isaac 0.5 是一个开源的AI模型,通过观看海量视频来教机器人学习动作,大幅降低了训练成本,效率提升210倍,并采用MoE架构。

0 人收藏 0 人点赞
#video-understanding

Video-IFBench:评估多模态大语言模型在视频理解场景中的指令遵循能力

Hugging Face Daily Papers ↗ · 2026-08-26 缓存

Video-IFBench 介绍了一个综合基准,用于评估多模态大语言模型在视频理解任务中遵循多样化指令的能力,涵盖多种约束条件和任务类型。

0 人收藏 0 人点赞
#video-understanding

tencent/WeMM-Embedding 9B/4B/2B

Reddit r/LocalLLaMA ↗ · 2026-08-25

腾讯推出 WeMM-Embedding,这是一系列基于 Qwen3.5 构建的通用多模态嵌入模型,提供 9B、4B 和 2B 尺寸,支持文本、图像、视频和视觉文档的嵌入生成。

0 人收藏 0 人点赞
#video-understanding

MoTE: 多任务视频理解中的任务专家混合

Hugging Face Daily Papers ↗ · 2026-08-25 缓存

MoTE 在多任务视频理解中引入了任务特定的专家路由,以替代密集的解码器前馈网络,通过可解释的稀疏计算提高了准确性和效率。

0 人收藏 0 人点赞
#video-understanding

MoE-ViE:高效图像与视频理解的混合专家视觉编码器

Hugging Face Daily Papers ↗ · 2026-08-18 缓存

本文介绍了MoE-ViE,一种混合专家视觉编码器,能够高效扩展以支持图像和视频理解,并以更低的推理延迟超越更大的密集模型。

0 人收藏 0 人点赞
#video-understanding

StreamOPD: 一种用于流式视频理解的后训练方法,结合时空线索门控

Hugging Face Daily Papers ↗ · 2026-08-17 缓存

StreamOPD通过使用在线策略蒸馏和时空线索门控的后训练方法,增强流式视频理解,在不依赖推理时内存的情况下实现了显著的基准改进。

0 人收藏 0 人点赞
#video-understanding

MOSS-VL 技术报告

Hugging Face Daily Papers ↗ · 2026-08-15 缓存

MOSS-VL 是一个专为实时交互设计的开放视觉语言模型家族,使用门控交叉注意力机制在生成过程中处理视觉信息,并在开源模型的流式基准测试中取得顶尖性能。

0 人收藏 0 人点赞
#video-understanding

VideoGAIA: 通用AI助手智能视频理解基准

Hugging Face Daily Papers ↗ · 2026-08-12 缓存

VideoGAIA引入了一个基准,用于通过复杂的多轮任务评估多模态模型中的智能视频理解,揭示即使是像GPT-5.5这样的前沿模型也仅达到不到60%的准确率。

0 人收藏 0 人点赞
#video-understanding

StreamArena:迈向连续、交互式且长时程的智能体流式视频理解

Hugging Face Daily Papers ↗ · 2026-08-06 缓存

StreamArena 是一个用于小时级交互式流式视频理解的基准测试,并配套了一种名为 StreamMind 的两层架构。该架构在实时感知、历史回顾、主动交互和工具使用方面均优于现有的流式基线方法。

0 人收藏 0 人点赞
#video-understanding

GST-Bench:VLMs能否从视频中形成全局空间意识?

Hugging Face Daily Papers ↗ · 2026-08-06 缓存

GST-Bench是一个新的VQA基准,用于评估视频理解中的全局空间意识,测试VLMs能否从长时间的第一人称视频中构建连贯的全局场景表示。对22个最先进的VLMs的评估显示,它们与人类之间存在巨大差距,最佳模型得分42.68,而人类为79.08。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈