标签
VideoMM 引入了一种自适应宏微观推理框架,可减少视频MLLMs中的视觉token开销,实现6.13倍的速度提升和7.4%的准确率增益,从而高效地理解长视频。
本文提出了一种方法,利用合成的思维链理由和难度感知微调,将推理能力蒸馏到紧凑的视频语言模型中,使较小的模型能够在最小的计算开销下超越较大的模型。
论文介绍了 BVB,这是一个通过在 Blender 中进行程序化重建来基准测试代理视频理解的基准,评估模型在感知相似性和时空事实保留方面的表现。
GPT-6 Astra 成功从一段 YouTube 视频片段中复制了 Cessna 337 Skymaster 的起落架收放机制,克服了先前模型的局限性。
VLX-VR是一种智能体感知的视频推理模型,它使用思考-记忆-观察循环和强化学习来自适应地收集证据,在MINERVA基准测试中达到了最先进的性能。
谷歌对Gemini 3.7 Flash的更新引入了高达88%的视频令牌减少功能,显著降低成本,但准确性提升存在疑问。
本文对长视频多模态语言模型的视觉令牌分配进行了控制性研究,发现帧选择显著提升准确性,而空间压缩在节省的令牌重新投资到更多帧时几乎是免费的,强调了统一比较框架的必要性。
Gemini 3.7 Flash展示了一项新的自主式视频理解功能,通过动态调整处理速度来准确计数像鼓掌这样的快速运动。
该推文强调,使用 Gemini 3.7 Flash 的智能体视频理解显著降低成本、减少令牌使用量并提高准确性。
Google DeepMind 为 Gemini 模型推出代理式视频理解功能,可将令牌消耗减少高达88%并提升视频分析的准确性。
Isaac 0.5 是一个开源的AI模型,通过观看海量视频来教机器人学习动作,大幅降低了训练成本,效率提升210倍,并采用MoE架构。
Video-IFBench 介绍了一个综合基准,用于评估多模态大语言模型在视频理解任务中遵循多样化指令的能力,涵盖多种约束条件和任务类型。
腾讯推出 WeMM-Embedding,这是一系列基于 Qwen3.5 构建的通用多模态嵌入模型,提供 9B、4B 和 2B 尺寸,支持文本、图像、视频和视觉文档的嵌入生成。
MoTE 在多任务视频理解中引入了任务特定的专家路由,以替代密集的解码器前馈网络,通过可解释的稀疏计算提高了准确性和效率。
本文介绍了MoE-ViE,一种混合专家视觉编码器,能够高效扩展以支持图像和视频理解,并以更低的推理延迟超越更大的密集模型。
StreamOPD通过使用在线策略蒸馏和时空线索门控的后训练方法,增强流式视频理解,在不依赖推理时内存的情况下实现了显著的基准改进。
MOSS-VL 是一个专为实时交互设计的开放视觉语言模型家族,使用门控交叉注意力机制在生成过程中处理视觉信息,并在开源模型的流式基准测试中取得顶尖性能。
VideoGAIA引入了一个基准,用于通过复杂的多轮任务评估多模态模型中的智能视频理解,揭示即使是像GPT-5.5这样的前沿模型也仅达到不到60%的准确率。
StreamArena 是一个用于小时级交互式流式视频理解的基准测试,并配套了一种名为 StreamMind 的两层架构。该架构在实时感知、历史回顾、主动交互和工具使用方面均优于现有的流式基线方法。
GST-Bench是一个新的VQA基准,用于评估视频理解中的全局空间意识,测试VLMs能否从长时间的第一人称视频中构建连贯的全局场景表示。对22个最先进的VLMs的评估显示,它们与人类之间存在巨大差距,最佳模型得分42.68,而人类为79.08。