TimeLens2: 通用视频时间定位与多模态大语言模型
摘要
TimeLens2 提出了一种使用多模态大语言模型的通用视频时间定位方法,将时间证据视为区间集,在多个基准上取得了最先进的性能。
查看缓存全文
缓存时间: 2026/07/21 06:35
论文页面 - TimeLens2:基于多模态大语言模型的通用视频时间定位
来源:https://huggingface.co/papers/2607.17423 作者:
,
,
,
,
,
,
,
,
,
,
,
,
摘要
视频多模态大语言模型(MLLMs)能够描述视频中发生的事情,但很少能识别出支撑证据发生的具体时间。本文研究通用视频时间定位任务,即用一个模型预测跨视频长度、领域、查询形式和视角的可变基数证据区间集合。现有训练策略与该集合值任务不匹配:长视频标签通常依赖脆弱的单次标注,而强化学习奖励要么无法区分非重叠预测,要么需要脆弱的片段匹配。TimeLens2 在整个监督和优化过程中将时间证据视为区间集合。TimeLens2-93K 通过基于字幕的候选生成、独立定位、跨智能体共识、语义验证和边界精炼,构建了可靠的多跨度监督。我们的时间 Wasserstein 奖励计算合并区间支撑集上均匀分布之间的精确一维 (W_1),在不等基数和平等碎片化条件下提供密集、无需匹配的反馈;时间 IoU 则通过精确重叠反馈对其补充。在七个基准测试中,TimeLens2-2B 在每个基准上都优于所有同等规模基线,而 4B 和 8B 变体达到了最先进性能,超越了多达 397B 参数的开源模型。与各自 Qwen3-VL 骨干相比,2B、4B 和 8B 变体分别提升了 14.2、13.0 和 18.1 个 mIoU 点。
查看 arXiv 页面 (https://arxiv.org/abs/2607.17423)查看 PDF (https://arxiv.org/pdf/2607.17423)项目页面 (https://mcg-nju.github.io/TimeLens2/)GitHub9 (https://github.com/MCG-NJU/TimeLens2)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.17423)
在智能体中获取此论文:
hf papers read 2607\.17423
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型3
MCG-NJU/TimeLens2-8B 视频-文本到文本 • 9B • 16分钟前更新 • 708 • 8 (https://huggingface.co/MCG-NJU/TimeLens2-8B)
MCG-NJU/TimeLens2-4B 视频-文本到文本 • 4B • 16分钟前更新 • 191 • 7 (https://huggingface.co/MCG-NJU/TimeLens2-4B)
MCG-NJU/TimeLens2-2B 视频-文本到文本 • 2B • 16分钟前更新 • 5 (https://huggingface.co/MCG-NJU/TimeLens2-2B)
引用此论文的数据集1
MCG-NJU/TimeLens2-93K 查看器 • 16分钟前更新 • 71.4k • 791 • 8 (https://huggingface.co/datasets/MCG-NJU/TimeLens2-93K)
引用此论文的空间2
包含此论文的收藏0
没有包含此论文的收藏
将此论文添加到收藏 (https://huggingface.co/new-collection) 以将其链接到此页面。
相似文章
Video-MME-Logical: 一种用于视频时间逻辑推理的受控诊断基准
提出 Video-MME-Logical,一个用于评估多模态大语言模型中视频时间逻辑推理的受控基准,揭示了一个显著的人机差距。
用于在剩余使用寿命中锚定多模态语言模型的时间序列检索
本文提出了一种利用时间序列检索锚定多模态大语言模型进行剩余使用寿命预测的框架,展示了基于检索的方法在准确性和稳定性方面优于非检索基线。
观看、记忆、推理:基于MLLMs的人类视角视频理解
一篇综述,以人类视角呈现对多模态大语言模型(MLLMs)进行视频理解的研究,围绕观看、记忆和推理能力组织,涵盖挑战、方法和应用。
面向一对多时序定位
本文介绍了一对多时序定位(OMTG)这一新任务,用于从单个文本查询中定位多个不连续的视频片段,同时提供了基准、评估指标、包含56k样本的数据集以及新颖的奖励函数,取得了最新最优的结果,优于Gemini 2.5 Pro和Seed-1.8。
FM-LLM:一种频率增强的混合专家框架,用于将LLM适应时间序列预测
FM-LLM提出了一种频率增强的混合专家框架,无需文本提示即可将冻结的LLM适应于时间序列预测,通过注入频谱表示并分离周期/非周期解码,取得了最先进的结果。