temporal-grounding

标签

Cards List
#temporal-grounding

GigaChat Audio: 时间感知的大型音频语言模型

Hugging Face Daily Papers · 2026-07-11 缓存

本文介绍了 GigaChat Audio,一个时间感知的大型音频语言模型,能够对长达120分钟的音频回答问题并给出明确的时间戳,使用交错周期性时间标记和合成监督。该模型在基准测试中实现了强时间定位准确性,作者已发布模型权重和数据集。

0 人收藏 0 人点赞
#temporal-grounding

VideoSearch-R1: 通过软查询优化的迭代式视频检索与推理

Hugging Face Daily Papers · 2026-07-01 缓存

VideoSearch-R1 引入了一种智能体框架,该框架通过连续潜在空间优化和策略优化,迭代式地检索视频并优化搜索查询,在视频语料库时刻检索和时间定位任务上取得了最先进的性能。

0 人收藏 0 人点赞
#temporal-grounding

面向一对多时序定位

Hugging Face Daily Papers · 2026-06-04 缓存

本文介绍了一对多时序定位(OMTG)这一新任务,用于从单个文本查询中定位多个不连续的视频片段,同时提供了基准、评估指标、包含56k样本的数据集以及新颖的奖励函数,取得了最新最优的结果,优于Gemini 2.5 Pro和Seed-1.8。

0 人收藏 0 人点赞
#temporal-grounding

MusTBENCH:音乐LLMs中时间定位的基准测试与进展

arXiv cs.CL · 2026-05-29 缓存

MusTBench是一个用于评估大型音频-语言模型(LALMs)在音乐理解中的时间定位能力的基准。作者提出了MusT,一种四阶段训练方案,能显著提升现有模型的时间定位性能。

0 人收藏 0 人点赞
#temporal-grounding

OmniInteract:面向实时全模态助手的真实世界流式交互基准测试

Hugging Face Daily Papers · 2026-05-26 缓存

OmniInteract 提出了一个面向实时全模态大语言模型的流式基准测试,评估在线音视频处理能力,要求具备时间定位和交互式响应。实验表明,当前模型表现不佳,最佳整体 IA-QTF1 分数仅为 0.368。

0 人收藏 0 人点赞
#temporal-grounding

LLaVA-OneVision-2:迈向下一代感知智能

Hugging Face Daily Papers · 2026-05-25 缓存

LLaVA-OneVision-2 引入了编解码流分词和窗口注意力机制以实现高效的视频理解,在包括视频、空间和跟踪任务在内的多个多模态基准测试中取得了最先进的性能。

0 人收藏 0 人点赞
#temporal-grounding

NemoStation/Marlin-2B

Hugging Face Models Trending · 2026-05-13

NemoStation/Marlin-2B 是基于 Qwen3.5-2B 微调的模型,用于视频-文本到文本任务,支持视频字幕生成和时间定位。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈