Video-DeepResearch:迈向下一代多模态深度研究智能体

Hugging Face Daily Papers 论文

摘要

Video-DeepResearch (Video-DR) 将多模态智能体从静态图像扩展到连续视频流,引入了解耦的感知-探索流水线以及新的基准 Video-DR-Bench。其 Video-DeepResearch-35B-A3B 模型取得了 64.0% 的准确率,超越了 Claude-4.5-Sonnet、GPT-5 和 Gemini 2.5 Pro。

我们引入了 Video-DeepResearch (Video-DR),将多模态智能体从静态图像扩展到连续视频流,这一设定要求密集的时空定位与开放网络探索相结合。初步评估揭示了当前模型的两个关键瓶颈:(1)模态偏差,即智能体绕过视觉工具而倾向于文本搜索;(2)参数化知识泄漏,即模型依赖内部记忆而非真正的工具增强执行。为了解决这些挑战,我们提出了 Video-DR,其特点是采用解耦的感知-探索流水线,并通过分阶段工具解锁,强制在网页检索之前进行详尽的跨帧视觉定位。我们的框架采用两阶段训练方案:先进行监督微调,再进行群组相对策略优化(GRPO),从而实现自主探索,突破模仿学习的天花板。此外,我们构建了 Video-DR-Bench,这是一个人类与 AI 协作的基准,包含 200 个复杂的多跳 VQA 实例。实验结果表明,我们的 Video-DeepResearch-35B-A3B 取得了 64.0% 的平均准确率,创下新的最先进水平,比专有的 Claude-4.5-Sonnet (59.0%) 高出 5.0 个百分点,并显著优于 GPT-5 (52.5%) 和 Gemini 2.5 Pro (57.5%)。30B-A3B 变体达到了 59.3% 的准确率,与 Claude-4.5-Sonnet 相当,证明了我们的训练范式即使在紧凑规模下也行之有效。代码:https://github.com/Osilly/Vision-DeepResearch。
查看原文
查看缓存全文

缓存时间: 2026/08/05 05:43

论文页面 - Video-DeepResearch:迈向下一代多模态深度研究智能体

来源:https://huggingface.co/papers/2608.03979

作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

我们介绍了 Video-DeepResearch(Video-DR),将多模态智能体从静态图像扩展到连续视频流,这一设定要求稠密的时空接地与开放网络探索相结合。初步评估揭示了当前模型的两个关键瓶颈:(1)模态偏差,即智能体绕过视觉工具而偏向文本搜索;(2)参数化知识泄漏,即模型依赖内部记忆而非真正的工具增强执行。为了应对这些挑战,我们提出了 Video-DR,其特点是采用解耦的感知-探索流水线,并通过分阶段工具解锁机制强制在网络检索之前进行穷尽的跨帧视觉接地。我们的框架采用两阶段训练方案:监督微调后进行组相对策略优化(GRPO),从而实现自主探索,突破模仿学习的上限。此外,我们构建了 Video-DR-Bench,一个包含 200 个复杂多跳 VQA 实例的人机协同基准。实验结果表明,我们的 Video-DeepResearch-35B-A3B 以 64.0% 的平均准确率确立了新的最先进水平,超过专有的 Claude-4.5-Sonnet(59.0%)5.0 个百分点,并显著优于 GPT-5(52.5%)和 Gemini 2.5 Pro(57.5%)。30B-A3B 变体达到 59.3%,与 Claude-4.5-Sonnet 相当,证明了我们的训练范式即使在紧凑规模下也很有效。代码:https://github.com/Osilly/Vision-DeepResearch.

查看 arXiv 页面 | PDF | 项目页面 | 添加到收藏

在您的智能体中获取此论文:

hf papers read 2608.03979

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

暂无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.03979,即可从本页面链接到它。

引用此论文的数据集 0

暂无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.03979,即可从本页面链接到它。

引用此论文的 Space 0

暂无 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2608.03979,即可从本页面链接到它。

包含此论文的收藏集 0

暂无收藏集包含此论文

将此论文添加到收藏集(https://huggingface.co/new-collection),即可从本页面链接到它。

相似文章

Mind DeepResearch 技术报告

Hugging Face Daily Papers

# 论文页面 - Mind DeepResearch 技术报告 来源:[https://huggingface.co/papers/2604.14518](https://huggingface.co/papers/2604.14518) ## 摘要 MindDR 是一个高效的多智能体深度研究框架,通过协作式三智能体架构与专门设计的四阶段训练流程,在多个基准测试中取得优异成绩。我们提出 Mind DeepResearch(MindDR),一个高效的[多智能体深度研究框架](https://hug

DR^{3}-Eval: 迈向真实且可复现的深度研究评估

Hugging Face Daily Papers

DR³-Eval 是一个基准测试,用于评估深度研究代理在多模态、多文件报告生成中的表现,它通过真实的网络环境模拟和全面的评估框架,衡量信息召回、事实准确性、引用覆盖率、指令遵循和深度质量。