TimeLens2: 通用视频时间定位与多模态大语言模型

Hugging Face Daily Papers 论文

摘要

TimeLens2 提出了一种使用多模态大语言模型的通用视频时间定位方法,将时间证据视为区间集,在多个基准上取得了最先进的性能。

视频多模态大语言模型(MLLMs)能够描述视频中发生的事情,但很少能识别支持性证据发生的时间。我们研究通用视频时间定位,即一个模型跨视频长度、领域、查询形式及视角预测一组基数的证据区间。现有训练策略与此集合值任务不匹配:长视频标签通常依赖于脆弱的单次标注,而强化学习奖励要么无法区分不重叠的预测,要么需要脆弱的片段匹配。TimeLens2 在监督和优化过程中将时间证据视为区间集。TimeLens2-93K 通过基于标题的提议、独立定位、跨智能体共识、语义验证和边界细化来构建可靠的多跨度监督。我们的时间 Wasserstein 奖励计算合并区间支撑上均匀分布之间精确的一维 \\(W_1\\),在不等基数及等价分割下提供密集、免匹配的反馈;时间 IoU 则通过精确重叠反馈进行补充。在七个基准上,TimeLens2-2B 在所有基准上优于所有规模匹配的基线,而 4B 和 8B 变体取得了最先进的性能,超越了参数多达 397B 的开源模型。2B、4B 和 8B 变体相对于其 Qwen3-VL 骨干网络分别提升了 14.2、13.0 和 18.1 个 mIoU 点。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:35

论文页面 - TimeLens2:基于多模态大语言模型的通用视频时间定位

来源:https://huggingface.co/papers/2607.17423 作者:

摘要

视频多模态大语言模型(MLLMs)能够描述视频中发生的事情,但很少能识别出支撑证据发生的具体时间。本文研究通用视频时间定位任务,即用一个模型预测跨视频长度、领域、查询形式和视角的可变基数证据区间集合。现有训练策略与该集合值任务不匹配:长视频标签通常依赖脆弱的单次标注,而强化学习奖励要么无法区分非重叠预测,要么需要脆弱的片段匹配。TimeLens2 在整个监督和优化过程中将时间证据视为区间集合。TimeLens2-93K 通过基于字幕的候选生成、独立定位、跨智能体共识、语义验证和边界精炼,构建了可靠的多跨度监督。我们的时间 Wasserstein 奖励计算合并区间支撑集上均匀分布之间的精确一维 (W_1),在不等基数和平等碎片化条件下提供密集、无需匹配的反馈;时间 IoU 则通过精确重叠反馈对其补充。在七个基准测试中,TimeLens2-2B 在每个基准上都优于所有同等规模基线,而 4B 和 8B 变体达到了最先进性能,超越了多达 397B 参数的开源模型。与各自 Qwen3-VL 骨干相比,2B、4B 和 8B 变体分别提升了 14.2、13.0 和 18.1 个 mIoU 点。

查看 arXiv 页面 (https://arxiv.org/abs/2607.17423)查看 PDF (https://arxiv.org/pdf/2607.17423)项目页面 (https://mcg-nju.github.io/TimeLens2/)GitHub9 (https://github.com/MCG-NJU/TimeLens2)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.17423)

在智能体中获取此论文:

hf papers read 2607\.17423

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型3

MCG-NJU/TimeLens2-8B 视频-文本到文本 • 9B • 16分钟前更新 • 708 • 8 (https://huggingface.co/MCG-NJU/TimeLens2-8B)

MCG-NJU/TimeLens2-4B 视频-文本到文本 • 4B • 16分钟前更新 • 191 • 7 (https://huggingface.co/MCG-NJU/TimeLens2-4B)

MCG-NJU/TimeLens2-2B 视频-文本到文本 • 2B • 16分钟前更新 • 5 (https://huggingface.co/MCG-NJU/TimeLens2-2B)

引用此论文的数据集1

MCG-NJU/TimeLens2-93K 查看器 • 16分钟前更新 • 71.4k • 791 • 8 (https://huggingface.co/datasets/MCG-NJU/TimeLens2-93K)

引用此论文的空间2

包含此论文的收藏0

没有包含此论文的收藏

将此论文添加到收藏 (https://huggingface.co/new-collection) 以将其链接到此页面。

相似文章

面向一对多时序定位

Hugging Face Daily Papers

本文介绍了一对多时序定位(OMTG)这一新任务,用于从单个文本查询中定位多个不连续的视频片段,同时提供了基准、评估指标、包含56k样本的数据集以及新颖的奖励函数,取得了最新最优的结果,优于Gemini 2.5 Pro和Seed-1.8。