Video-DeepResearch:迈向下一代多模态深度研究智能体
摘要
Video-DeepResearch (Video-DR) 将多模态智能体从静态图像扩展到连续视频流,引入了解耦的感知-探索流水线以及新的基准 Video-DR-Bench。其 Video-DeepResearch-35B-A3B 模型取得了 64.0% 的准确率,超越了 Claude-4.5-Sonnet、GPT-5 和 Gemini 2.5 Pro。
查看缓存全文
缓存时间: 2026/08/05 05:43
论文页面 - Video-DeepResearch:迈向下一代多模态深度研究智能体
来源:https://huggingface.co/papers/2608.03979
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
我们介绍了 Video-DeepResearch(Video-DR),将多模态智能体从静态图像扩展到连续视频流,这一设定要求稠密的时空接地与开放网络探索相结合。初步评估揭示了当前模型的两个关键瓶颈:(1)模态偏差,即智能体绕过视觉工具而偏向文本搜索;(2)参数化知识泄漏,即模型依赖内部记忆而非真正的工具增强执行。为了应对这些挑战,我们提出了 Video-DR,其特点是采用解耦的感知-探索流水线,并通过分阶段工具解锁机制强制在网络检索之前进行穷尽的跨帧视觉接地。我们的框架采用两阶段训练方案:监督微调后进行组相对策略优化(GRPO),从而实现自主探索,突破模仿学习的上限。此外,我们构建了 Video-DR-Bench,一个包含 200 个复杂多跳 VQA 实例的人机协同基准。实验结果表明,我们的 Video-DeepResearch-35B-A3B 以 64.0% 的平均准确率确立了新的最先进水平,超过专有的 Claude-4.5-Sonnet(59.0%)5.0 个百分点,并显著优于 GPT-5(52.5%)和 Gemini 2.5 Pro(57.5%)。30B-A3B 变体达到 59.3%,与 Claude-4.5-Sonnet 相当,证明了我们的训练范式即使在紧凑规模下也很有效。代码:https://github.com/Osilly/Vision-DeepResearch.
查看 arXiv 页面 | PDF | 项目页面 | 添加到收藏
在您的智能体中获取此论文:
hf papers read 2608.03979
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
暂无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.03979,即可从本页面链接到它。
引用此论文的数据集 0
暂无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.03979,即可从本页面链接到它。
引用此论文的 Space 0
暂无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.03979,即可从本页面链接到它。
包含此论文的收藏集 0
暂无收藏集包含此论文
将此论文添加到收藏集(https://huggingface.co/new-collection),即可从本页面链接到它。
相似文章
DeepVoyager-VL:激励长时程多模态智能体的视觉在环搜索
DeepVoyager-VL 提出了一种长时程多模态深度搜索框架,将视觉证据融入中间推理过程,利用多模态事件图进行数据合成和微调,而无需强化学习,在十个基准测试上取得了强劲性能。
DR-Venus:仅用1万开源数据打造边缘级前沿深度研究智能体
DR-Venus-4B 是一个40亿参数的深研智能体,仅利用1万条开源样本,通过「智能体SFT+回合级奖励RL」训练,在多项研究基准上超越以往90亿以下模型,逼近300亿级系统,且可部署于边缘设备。
InternVideo3: 使用多模态上下文推理将基础模型智能体化
InternVideo3 引入了多模态上下文推理(MCR)和高效注意力机制,以增强长时域多模态任务,在视频理解基准上取得了强劲的结果,并展示了视频智能体能力。
Mind DeepResearch 技术报告
# 论文页面 - Mind DeepResearch 技术报告 来源:[https://huggingface.co/papers/2604.14518](https://huggingface.co/papers/2604.14518) ## 摘要 MindDR 是一个高效的多智能体深度研究框架,通过协作式三智能体架构与专门设计的四阶段训练流程,在多个基准测试中取得优异成绩。我们提出 Mind DeepResearch(MindDR),一个高效的[多智能体深度研究框架](https://hug
DR^{3}-Eval: 迈向真实且可复现的深度研究评估
DR³-Eval 是一个基准测试,用于评估深度研究代理在多模态、多文件报告生成中的表现,它通过真实的网络环境模拟和全面的评估框架,衡量信息召回、事实准确性、引用覆盖率、指令遵循和深度质量。