VideoGen-Agent:增强视频生成智能体

Hugging Face Daily Papers 论文

摘要

本文提出了VideoGen-Agent,一种基于强化学习的多模态智能体,它协调工具进行视频生成,在新的VABench基准测试上显著提升了性能。

近年来,视频生成模型的进展实现了高保真、时间连贯的视频生成。然而,这些模型在满足需要专门知识、特定身份、物理一致性或有序事件的提示时常常遇到困难。在本文中,我们提出了VideoGen-Agent,一个通过多任务智能体强化学习训练的多模态智能体,用于使用外部工具进行视频生成。该智能体通过多轮交互协调增强、生成和验证工具,使用提示和中间观察来指导其决策。我们在一个涵盖六个任务的类别平衡数据集上训练一个共享策略。在教师生成的轨迹上进行监督微调以建立工具使用行为,然后通过强化学习进行优化。一种类别感知的混合奖励评估工具调用有效性、任务适当的工具使用和生成视频质量。我们进一步介绍了VABench,一个包含600个提示的保留基准测试,涵盖程序知识、单实体和多实体身份保持、物理一致性、场景组成和多镜头时间结构。在VABench上,VideoGen-Agent相较于其基础文本到视频生成器提升了19.1分,从56.5到75.6。升级生成工具后,分数进一步提高到86.1,无需额外的智能体训练。人类评估者在84.3%的比较中更倾向于升级后的配置而非最强的独立基线。这些结果支持在视频生成任务中学习工具使用,并表明训练后的智能体可以从后续的生成工具进步中受益。
查看原文
查看缓存全文

缓存时间: 2026/09/22 07:28

论文页面 - VideoGen-Agent:强化视频生成智能体

来源:https://huggingface.co/papers/2609.24997
作者:










摘要

近期视频生成模型的进步使得高保真、时间连贯的视频生成成为可能。然而,这些模型往往难以满足需要专业知识、特定身份、物理一致性或有序事件的提示词要求。本文提出VideoGen-Agent,这是一个通过多任务智能体强化学习训练的多模态智能体,能够利用外部工具进行视频生成。该智能体通过多轮交互协调增强、生成和验证工具,利用提示词和中间观察结果指导其决策。我们在覆盖六个任务的类别平衡数据集上训练了一个共享策略。通过教师生成轨迹的监督微调建立了工具使用行为,随后通过强化学习进行优化。类别感知的混合奖励机制评估了工具调用有效性、任务适配的工具使用以及生成视频质量。我们进一步引入VABench,这是一个包含600个提示词的独立基准测试集,涵盖过程知识、单实体与多实体身份保持、物理一致性、场景组合以及多镜头时间结构。在VABench测试中,VideoGen-Agent相比其基础文本到视频生成器提升了19.1分,从56.5提升至75.6。升级生成工具后,在无需额外智能体训练的情况下,分数进一步提升至86.1。在84.3%的对比中,人类评估者更倾向于升级配置而非最强的独立基线。这些结果支持在跨视频生成任务中学习工具使用,并表明经过训练的智能体能够受益于后续生成工具的进步。

查看arXiv页面(https://arxiv.org/abs/2609.24997)查看PDF(https://arxiv.org/pdf/2609.24997)项目页面(https://andyca111.github.io/VideoGen_Agent/)添加到收藏夹(https://huggingface.co/login?next=%2Fpapers%2F2609.24997)

通过智能体获取本文:

hf papers read 2609.24997

没有最新版CLI?请运行:curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

无模型关联本文

在模型README.md中引用 arxiv.org/abs/2609.24997 即可从本页面关联。

引用本文的数据集0

无数据集关联本文

在数据集README.md中引用 arxiv.org/abs/2609.24997 即可从本页面关联。

引用本文的Spaces0

无Space关联本文

在Space README.md中引用 arxiv.org/abs/2609.24997 即可从本页面关联。

包含本文的收藏夹0

无收藏夹包含本文

将本文添加到收藏夹(https://huggingface.co/new-collection)即可从本页面关联。

相似文章

Video-DeepResearch:迈向下一代多模态深度研究智能体

Hugging Face Daily Papers

Video-DeepResearch (Video-DR) 将多模态智能体从静态图像扩展到连续视频流,引入了解耦的感知-探索流水线以及新的基准 Video-DR-Bench。其 Video-DeepResearch-35B-A3B 模型取得了 64.0% 的准确率,超越了 Claude-4.5-Sonnet、GPT-5 和 Gemini 2.5 Pro。