VideoSearch-R1: 通过软查询优化的迭代式视频检索与推理
摘要
VideoSearch-R1 引入了一种智能体框架,该框架通过连续潜在空间优化和策略优化,迭代式地检索视频并优化搜索查询,在视频语料库时刻检索和时间定位任务上取得了最先进的性能。
查看缓存全文
缓存时间: 2026/07/02 03:46
论文页面 - VideoSearch-R1: 通过软查询细化的迭代视频检索与推理
来源: https://huggingface.co/papers/2607.00446
摘要
VideoSearch-R1 是一个智能体框架,通过连续潜在空间细化和策略优化,迭代地检索视频并优化搜索查询,以改进视频时刻检索和时间定位。
随着视频语料库在规模和任务复杂度上不断扩展,迫切需要能够从大规模语料库中检索相关视频(跨视频推理 (https://huggingface.co/papers?q=inter-video%20reasoning)),并在检索到的内容上进行细粒度、查询条件的任务(视频内推理 (https://huggingface.co/papers?q=intra-video%20reasoning)),例如时间定位 (https://huggingface.co/papers?q=temporal%20grounding) 的方法。然而,现有方法通常将检索视为预处理步骤,因此当初始检索失败时,没有机制来优化搜索,导致后续细粒度的视频内推理 (https://huggingface.co/papers?q=intra-video%20reasoning) 失败。此外,尽管近期基于智能体的框架 (https://huggingface.co/papers?q=agentic%20framework) 在视频理解方面取得了进展,但它们通常假设查询相关的视频已经给出,只专注于视频内推理 (https://huggingface.co/papers?q=intra-video%20reasoning) 任务。为了解决这些局限,我们提出了 VideoSearch-R1,这是一个基于智能体的框架 (https://huggingface.co/papers?q=agentic%20framework),通过与视频搜索引擎的多轮交互实现迭代的视频检索 (https://huggingface.co/papers?q=video%20retrieval) 和推理。具体来说,我们引入了软查询细化 (https://huggingface.co/papers?q=Soft%20Query%20Refinement) (SQR),在连续潜在空间 (https://huggingface.co/papers?q=continuous%20latent%20space) 中优化搜索查询标记,而不是在离散文本空间中重写查询,从而实现更高效、更精细的调整。SQR 及其推理过程通过组相对策略优化 (https://huggingface.co/papers?q=Group%20Relative%20Policy%20Optimization) (GRPO) 训练,并由检索和下游任务得出的任务级奖励信号 (https://huggingface.co/papers?q=task-level%20reward%20signals) 引导。在此基础上,VideoSearch-R1 在视频语料库时刻检索 (https://huggingface.co/papers?q=Video%20Corpus%20Moment%20Retrieval) (VCMR) 的三个数据集上取得了最先进的性能,能够从大规模语料库中迭代地检索视频、优化搜索查询,并在检索到的内容中进行精确的查询条件时间定位 (https://huggingface.co/papers?q=temporal%20grounding)。我们的分析表明,SQR 有效优化了原始查询,相比显式的文本级查询优化,所需的生成标记显著更少。代码和模型检查点已在 mlvlab.github.io/VideoSearch-R1 公开。
查看arXiv页面 (https://arxiv.org/abs/2607.00446)查看PDF (https://arxiv.org/pdf/2607.00446)项目页面 (https://mlvlab.github.io/VideoSearch-R1/)GitHub20 (https://github.com/mlvlab/VideoSearch-R1)添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2607.00446)
在您的智能体中获取此论文:
hf papers read 2607\.00446
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
暂无模型引用本文
在模型README.md中引用arxiv.org/abs/2607.00446即可从此页面链接。
引用本文的数据集0
暂无数据集引用本文
在数据集README.md中引用arxiv.org/abs/2607.00446即可从此页面链接。
引用本文的Space0
暂无Space引用本文
在Space README.md中引用arxiv.org/abs/2607.00446即可从此页面链接。
收录本文的合集0
暂无合集收录本文
将本文添加到合集 (https://huggingface.co/new-collection) 中即可从此页面链接。
相似文章
VideoSeeker: 通过原生智能体工具调用激励实例级视频理解
VideoSeeker 引入了一种实例级视频理解的新范式,将智能体推理与视觉提示相结合,通过自动化数据合成和强化学习实现卓越性能,超越了 GPT-4o 和 Gemini-2.5-Pro。
通过并行搜索与显式合并扩展检索增强推理
介绍了MultiSearch,一种基于强化学习的框架,该框架在每一步推理中生成多个查询,并显式合并检索到的信息,以提高问答任务中的信噪比和推理准确性。
Visual-Seeker: 通过主动视觉推理实现视觉原生多模态代理搜索
Visual-Seeker 提出了一种视觉原生多模态深度搜索代理,它主动推理细粒度视觉细节并综合多模态证据,在五个具有挑战性的多模态搜索基准上实现了最先进的性能。
EasyVideoR1:让视频理解的强化学习更简单
# 论文页面 - EasyVideoR1:让视频理解的强化学习更简单 来源:[https://huggingface.co/papers/2604.16893](https://huggingface.co/papers/2604.16893) ## 摘要 EasyVideoR1 提出了一个高效的视频理解强化学习框架,可提升训练吞吐量,支持多种视频任务,并实现图像-视频联合训练,在多个基准测试上进行全面评估。[可验证奖励强化学习](https://huggingface.co/papers
VideoKR:面向知识和推理密集型视频理解
VideoKR 引入了一个大规模视频推理数据集和基准,旨在通过专家领域内容和人机协同的示例生成,增强知识密集型视频理解。该数据集包含 31.5万个视频推理示例,覆盖 14.5万个专家领域视频。