VideoSearch-R1: 通过软查询优化的迭代式视频检索与推理

Hugging Face Daily Papers 论文

摘要

VideoSearch-R1 引入了一种智能体框架,该框架通过连续潜在空间优化和策略优化,迭代式地检索视频并优化搜索查询,在视频语料库时刻检索和时间定位任务上取得了最先进的性能。

随着视频语料库在规模和任务复杂度上的持续增长,对能够从大规模语料库中检索相关视频(视频间推理)并在检索到的内容中执行细粒度、查询条件化的任务(视频内推理,如时间定位)的方法需求日益增加。然而,现有方法通常将检索视为预处理步骤,因此当初始检索失败时,没有机制可以优化搜索,导致后续细粒度视频内推理的失败。此外,虽然最近的智能体框架在视频理解方面取得了进展,但它们通常假设查询相关的视频已经给定,仅专注于视频内推理任务。为了解决这些局限性,我们提出了 VideoSearch-R1,一种通过与视频搜索引擎多轮交互进行迭代视频检索和推理的智能体框架。具体来说,我们引入了软查询优化(SQR),在连续潜在空间中优化搜索查询标记,而不是在离散文本空间中重写查询,从而能够实现更高效和更细粒度的调整。SQR 及其推理过程使用组相对策略优化(GRPO)进行训练,由来自检索和下游任务的任务级奖励信号引导。在此基础上,VideoSearch-R1 在三个数据集上的视频语料库时刻检索(VCMR)任务中取得了最先进的性能,迭代地从大规模语料库中检索视频,优化搜索查询,并在检索到的内容中执行精确的查询条件化时间定位。我们的分析表明,SQR 能够有效地优化原始查询,相比显式的文本级查询优化,所需的生成标记显著减少。代码和模型检查点可在 mlvlab.github.io/VideoSearch-R1 上公开获取。
查看原文
查看缓存全文

缓存时间: 2026/07/02 03:46

论文页面 - VideoSearch-R1: 通过软查询细化的迭代视频检索与推理

来源: https://huggingface.co/papers/2607.00446

摘要

VideoSearch-R1 是一个智能体框架,通过连续潜在空间细化和策略优化,迭代地检索视频并优化搜索查询,以改进视频时刻检索和时间定位。

随着视频语料库在规模和任务复杂度上不断扩展,迫切需要能够从大规模语料库中检索相关视频(跨视频推理 (https://huggingface.co/papers?q=inter-video%20reasoning)),并在检索到的内容上进行细粒度、查询条件的任务(视频内推理 (https://huggingface.co/papers?q=intra-video%20reasoning)),例如时间定位 (https://huggingface.co/papers?q=temporal%20grounding) 的方法。然而,现有方法通常将检索视为预处理步骤,因此当初始检索失败时,没有机制来优化搜索,导致后续细粒度的视频内推理 (https://huggingface.co/papers?q=intra-video%20reasoning) 失败。此外,尽管近期基于智能体的框架 (https://huggingface.co/papers?q=agentic%20framework) 在视频理解方面取得了进展,但它们通常假设查询相关的视频已经给出,只专注于视频内推理 (https://huggingface.co/papers?q=intra-video%20reasoning) 任务。为了解决这些局限,我们提出了 VideoSearch-R1,这是一个基于智能体的框架 (https://huggingface.co/papers?q=agentic%20framework),通过与视频搜索引擎的多轮交互实现迭代的视频检索 (https://huggingface.co/papers?q=video%20retrieval) 和推理。具体来说,我们引入了软查询细化 (https://huggingface.co/papers?q=Soft%20Query%20Refinement) (SQR),在连续潜在空间 (https://huggingface.co/papers?q=continuous%20latent%20space) 中优化搜索查询标记,而不是在离散文本空间中重写查询,从而实现更高效、更精细的调整。SQR 及其推理过程通过组相对策略优化 (https://huggingface.co/papers?q=Group%20Relative%20Policy%20Optimization) (GRPO) 训练,并由检索和下游任务得出的任务级奖励信号 (https://huggingface.co/papers?q=task-level%20reward%20signals) 引导。在此基础上,VideoSearch-R1 在视频语料库时刻检索 (https://huggingface.co/papers?q=Video%20Corpus%20Moment%20Retrieval) (VCMR) 的三个数据集上取得了最先进的性能,能够从大规模语料库中迭代地检索视频、优化搜索查询,并在检索到的内容中进行精确的查询条件时间定位 (https://huggingface.co/papers?q=temporal%20grounding)。我们的分析表明,SQR 有效优化了原始查询,相比显式的文本级查询优化,所需的生成标记显著更少。代码和模型检查点已在 mlvlab.github.io/VideoSearch-R1 公开。

查看arXiv页面 (https://arxiv.org/abs/2607.00446)查看PDF (https://arxiv.org/pdf/2607.00446)项目页面 (https://mlvlab.github.io/VideoSearch-R1/)GitHub20 (https://github.com/mlvlab/VideoSearch-R1)添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2607.00446)

在您的智能体中获取此论文:

hf papers read 2607\.00446

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

暂无模型引用本文

在模型README.md中引用arxiv.org/abs/2607.00446即可从此页面链接。

引用本文的数据集0

暂无数据集引用本文

在数据集README.md中引用arxiv.org/abs/2607.00446即可从此页面链接。

引用本文的Space0

暂无Space引用本文

在Space README.md中引用arxiv.org/abs/2607.00446即可从此页面链接。

收录本文的合集0

暂无合集收录本文

将本文添加到合集 (https://huggingface.co/new-collection) 中即可从此页面链接。

相似文章

EasyVideoR1:让视频理解的强化学习更简单

Hugging Face Daily Papers

# 论文页面 - EasyVideoR1:让视频理解的强化学习更简单 来源:[https://huggingface.co/papers/2604.16893](https://huggingface.co/papers/2604.16893) ## 摘要 EasyVideoR1 提出了一个高效的视频理解强化学习框架,可提升训练吞吐量,支持多种视频任务,并实现图像-视频联合训练,在多个基准测试上进行全面评估。[可验证奖励强化学习](https://huggingface.co/papers

VideoKR:面向知识和推理密集型视频理解

Hugging Face Daily Papers

VideoKR 引入了一个大规模视频推理数据集和基准,旨在通过专家领域内容和人机协同的示例生成,增强知识密集型视频理解。该数据集包含 31.5万个视频推理示例,覆盖 14.5万个专家领域视频。