VideoGen-Agent:增强视频生成智能体
摘要
本文提出了VideoGen-Agent,一种基于强化学习的多模态智能体,它协调工具进行视频生成,在新的VABench基准测试上显著提升了性能。
查看缓存全文
缓存时间: 2026/09/22 07:28
论文页面 - VideoGen-Agent:强化视频生成智能体
来源:https://huggingface.co/papers/2609.24997
作者:
,
,
,
,
,
,
,
,
,
,
摘要
近期视频生成模型的进步使得高保真、时间连贯的视频生成成为可能。然而,这些模型往往难以满足需要专业知识、特定身份、物理一致性或有序事件的提示词要求。本文提出VideoGen-Agent,这是一个通过多任务智能体强化学习训练的多模态智能体,能够利用外部工具进行视频生成。该智能体通过多轮交互协调增强、生成和验证工具,利用提示词和中间观察结果指导其决策。我们在覆盖六个任务的类别平衡数据集上训练了一个共享策略。通过教师生成轨迹的监督微调建立了工具使用行为,随后通过强化学习进行优化。类别感知的混合奖励机制评估了工具调用有效性、任务适配的工具使用以及生成视频质量。我们进一步引入VABench,这是一个包含600个提示词的独立基准测试集,涵盖过程知识、单实体与多实体身份保持、物理一致性、场景组合以及多镜头时间结构。在VABench测试中,VideoGen-Agent相比其基础文本到视频生成器提升了19.1分,从56.5提升至75.6。升级生成工具后,在无需额外智能体训练的情况下,分数进一步提升至86.1。在84.3%的对比中,人类评估者更倾向于升级配置而非最强的独立基线。这些结果支持在跨视频生成任务中学习工具使用,并表明经过训练的智能体能够受益于后续生成工具的进步。
查看arXiv页面(https://arxiv.org/abs/2609.24997)查看PDF(https://arxiv.org/pdf/2609.24997)项目页面(https://andyca111.github.io/VideoGen_Agent/)添加到收藏夹(https://huggingface.co/login?next=%2Fpapers%2F2609.24997)
通过智能体获取本文:
hf papers read 2609.24997
没有最新版CLI?请运行:curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
无模型关联本文
在模型README.md中引用 arxiv.org/abs/2609.24997 即可从本页面关联。
引用本文的数据集0
无数据集关联本文
在数据集README.md中引用 arxiv.org/abs/2609.24997 即可从本页面关联。
引用本文的Spaces0
无Space关联本文
在Space README.md中引用 arxiv.org/abs/2609.24997 即可从本页面关联。
包含本文的收藏夹0
无收藏夹包含本文
将本文添加到收藏夹(https://huggingface.co/new-collection)即可从本页面关联。
相似文章
VGenST-Bench:通过主动视频合成进行时空推理的基准测试
VGenST-Bench是一个基准测试,利用生成模型主动合成受控的时空推理场景,配备多智能体流水线和人工质量控制,用于评估多模态大语言模型。
Code2Video: 一个以代码为中心的教育视频生成范式
Code2Video是一个以代码为中心的代理框架,用于生成教育视频,相比直接代码生成,提高了连贯性和可解释性。它包括一个多代理系统和一个新的评估基准。
AVA-Encoder:迈向智能体原生的视频表征学习
AVA-Encoder 通过基于知识图谱的智能体自编码学习结构化视频表征,能够实现电影级视频生成与推理,同时减少 Token 使用量。
Video-DeepResearch:迈向下一代多模态深度研究智能体
Video-DeepResearch (Video-DR) 将多模态智能体从静态图像扩展到连续视频流,引入了解耦的感知-探索流水线以及新的基准 Video-DR-Bench。其 Video-DeepResearch-35B-A3B 模型取得了 64.0% 的准确率,超越了 Claude-4.5-Sonnet、GPT-5 和 Gemini 2.5 Pro。
VideoCoCo:通过代理双引擎系统实现物理一致视频生成的代码即思维链框架
介绍了VideoCoCo,一种代理双引擎框架,使用可执行的Blender代码作为思维链中间表示,用于物理一致的视频生成,在PhyGenBench和VBench-2.0上取得了最先进的分数。