@tom_doerr: VideoAgent 是一个一体化的开源框架,用于全面视频智能,结合理解、编辑和创意生成…

X AI KOLs Timeline 工具

摘要

VideoAgent 是一个一体化的开源框架,用于全面视频智能,通过统一的智能体工作流结合理解、编辑和创意生成。

VideoAgent 是一个一体化的开源框架,用于全面视频智能,通过统一的智能体工作流结合理解、编辑和创意生成。 https://t.co/M5mhAqL2AC https://t.co/QFyRvRvQmQ
查看原文
查看缓存全文

缓存时间: 2026/08/03 09:38

VideoAgent 是一个一站式开源框架,通过统一的智能体工作流,将理解、编辑与创意生成相结合,实现全面的视频智能。https://t.co/M5mhAqL2AC https://t.co/QFyRvRvQmQ — # HKUDS/VideoAgent 来源:https://github.com/HKUDS/VideoAgent 🌟 全面视频智能:集理解、编辑与生成于一体的一站式框架 English | 简体中文 — ## 📹 演示视频 在本视频中,我们演示了如何使用 VideoAgent 来: - 清晰表达用户需求 - 实现意图分析与自主工具使用及规划 - 创建多模态产品,包括详细的工作流程 - 全自动生成视频概览 ## 🚀 核心特性 🧠 - 理解视频内容 借助先进的多模态智能能力,对视频媒体进行深入分析、摘要总结和洞察提取。 ✂️ - 编辑视频片段 提供直观的工具,用于视频的组装、剪辑和内容重组,实现无缝的工作流集成。 🎨 - 重塑创意视频 利用生成式技术,通过 AI 驱动的创意辅助,制作新颖、富有想象力的视频内容。 🔧 - 多模态智能体框架 通过集成多种 AI 模态的综合框架,提供全面的视频智能,以获得更佳性能。 🚀 - 无缝自然语言体验 通过纯对话式 AI 变革视频交互与创作——无需复杂的界面或专业技术知识,只需与 VideoAgent 进行自然对话即可。 mermaid graph TB A[🎬 VideoAgent 框架] --> B[🧠 视频理解与摘要] A --> C[✂️ 视频编辑] A --> D[🎨 视频重塑] B --> B1[视频问答] B --> B2[视频摘要] C --> C1[电影剪辑] C --> C2[解说视频] C --> C3[视频概览] D --> D1[梗视频] D --> D2[音乐视频] D --> D3[跨文化喜剧] VideoAgent 导演 Funclip NarratoAI NotebookLM 节拍同步剪辑 ✅ ✅ ✅ — — 叙事视频 ✅ — — — — 视频概览 ✅ ✅ ✅ ✅ ✅ 梗视频重塑 ✅ — — — — 歌曲混音 ✅ — — — — 跨语言改编 ✅ — — — — 视频问答 ✅ ✅ — — ✅ 音效工具 ✅ — — — — — ## 📑 目录 - 🌟 系统概述 - 🔧 评估 - 🚀 快速开始 - 🔮 演示 - 💖 致谢 ### 🔥 为什么选择 VideoAgent? | 🧠 易于使用 | 🚀 无限创意 | 🎨 高品质 | |:—:|:—:|:—:| | 一键提示词生成视频 | 从任何想法开始创作 | 达到人类水准的视频制作 | 将您的想法转化为专业视频 | 为您的独特想法生成工作流 | 交付符合专业标准的视频 | — ## 🌟 系统概述 我们的系统为自动化视频处理引入了三项关键创新。意图分析 能够捕捉用户指令之外显性和隐性的子意图。自主工具使用与规划 采用图驱动的工作流生成,并带有自适应反馈循环,以实现自动化智能体编排。多模态理解 将原始输入转换为语义对齐的视觉查询,以增强检索效果。 ### 🧠 意图分析 - 🔍 VideoAgent 智能地将用户指令分解显性和隐性的子意图,捕捉用户可能没有明确说明的细致需求。这种高级解析确保了对用户目标的全面理解,而不仅仅是表面指令。 - 🎯 通过意图到智能体的映射机制,系统能够精确识别多智能体框架中需要哪些能力。这种精准的方法能够高效激活相关的系统组件,同时避免不必要的计算开销,实现最优任务执行。 ### 🔧 自主工具使用与规划 - ⚙️ 图驱动框架自动将用户意图转化为可执行的工作流。系统动态选择适当的智能体并构建最优执行序列。节点代表工具能力,边定义复杂视频任务的工作流连接。 - 🔄 自适应反馈循环通过两步自我评估持续优化规划过程。这确保了稳健的自动化决策和无缝执行。系统在整个任务生命周期中自我修正并优化性能。 ### 🎬 多模态理解 - 📋 分镜智能体将原始用户输入转化为优化的视觉查询。它首先分析带预先生成字幕的视频素材库,以了解可用资源。这一基础性分析确保系统精确掌握哪些内容可供查询处理使用。 - 💡 该智能体随后将用户输入分解细粒度的子查询,这些子查询在视觉和语义上均保持一致。这种精细的拆分通过将用户意图与数据库中最为相关的视觉内容进行匹配,实现了增强的视频检索。 — ## 🔧 评估 我们从多个维度进行了广泛的实验,以验证 VideoAgent 在应对关键挑战方面的有效性。 ### 通过工作流构建实现无限创意 为了评估 VideoAgent 通过自动工作流构建实现的无限创意,我们在三个主干模型上比较了五种广泛适用的智能体。研究结果表明,VideoAgent 在音频和视频数据集上显著优于其他基线方法,展示了其通过图结构引导和由专用自我评估反馈驱动的自我反思,所具备的创意工作流生成能力。此外,我们观察到,与 GPT-4o 和 Deepseek-v3 相比,VideoAgent 在 Claude 3.7 主干模型下展现出更优越且更稳定的创意表现,而其他基线方法在不同主干模型下则表现出波动。这突出了 VideoAgent 通过自动构建多样化且高效的工作流来释放无限创意的能力,能够适应各种用户需求,同时更强的大语言模型能够实现更深入的理解,并为复杂的基于图的任务提供更稳健的创意解决方案。 ### 卓越的多模态理解 为了验证我们的多模态理解能力,我们使用打乱顺序的字幕查询进行了文本到视频的检索实验。评估采用三项指标来检验我们的模型检索对应视觉内容的能力:Recall(召回率)通过比较检索到的片段中点与真实位置来衡量模型正确重排打乱视频片段的能力;基于嵌入匹配的分数评估生成视频与高层级字幕摘要之间的粗粒度对齐;Intersection over Union(交并比)通过计算检索区间与真实区间之间的时间重叠与总覆盖范围的比率,量化片段级别的时间对齐精度。实验结果表明,我们的方法能够检索到更准确的视频片段,从而展示了我们精准的多模态理解能力。 ### 更多迭代,更优性能 我们通过分析反思轮数对性能的影响,研究了 VideoAgent 的迭代优化能力。通过在两个数据集上使用三个 LLM 主干模型进行全面的超参数实验,我们证明了 VideoAgent 显著的自改进能力。结果显示,虽然早期迭代产生的是基线水平的结果,但我们的系统自适应反思机制推动了每一轮后续迭代的显著性能提升。VideoAgent 在所有测试配置下均实现了0.95 的一致工作流构建成功率,展示了其稳健的自我修正能力可靠的高质量输出,且不受底层 LLM 主干模型的影响。 — ## 🚀 快速开始 ### 🖥️ 环境 GPU 内存:8GB 操作系统:Linux、Windows ### 📥 克隆与安装 bash git clone https://github.com/HKUDS/VideoAgent.git conda create --name videoagent python=3.10 conda activate videoagent conda install -y -c conda-forge pynini==2.1.5 ffmpeg pip install -r requirements.txt ### 📦 模型下载 bash # 下载 CosyVoice cd tools/CosyVoice huggingface-cli download PillowTa1k/CosyVoice --local-dir pretrained_models bash # 下载 fish-speech cd tools/fish-speech huggingface-cli download fishaudio/fish-speech-1.5 --local-dir checkpoints/fish-speech-1.5 bash # 下载 seed-vc cd tools/seed-vc huggingface-cli download PillowTa1k/seed-vc --local-dir checkpoints bash # 下载 DiffSinger cd tools/DiffSinger huggingface-cli download PillowTa1k/DiffSinger --local-dir checkpoints bash # 下载 Whisper cd tools huggingface-cli download openai/whisper-large-v3-turbo --local-dir whisper-large-v3-turbo bash # 确保已安装 git-lfs (https://git-lfs.com) git lfs install bash # 下载 ImageBind cd tools mkdir .checkpoints cd .checkpoints wget https://dl.fbaipublicfiles.com/imagebind/imagebind_huge.pth 🌟 为您提供了多种模型;您可以根据项目需求仅下载所需模型。 功能 视频演示 所需模型 相声 英语脱口秀转中文相声 CosyVoice、Whisper、ImageBind 脱口秀 中文相声转英语脱口秀 CosyVoice、Whisper、ImageBind MAD 配音 小明剑魔梗 CosyVoice fish-speech MAD MV AI 音乐视频 DiffSinger、seed-vc、Whisper、ImageBind 节奏 蜘蛛侠:纵横宇宙 Whisper、ImageBind 解说视频 科技新闻:OpenAI 发布 GPT-4o 图像生成功能 CosyVoice、Whisper、ImageBind 视频问答/摘要 沙丘 2 电影演员更新播客 Whisper ### 🤖 LLM 配置 bash # VideoAgent\environment\config\config.yml # 适用场景与 LLM 配置 # Claude 为必需项,它为智能体图路由器提供支持 llm: # 视频重塑/TTS/SVC/脱口秀/相声 deepseek_api_key: "" deepseek_base_url: "" # 智能体图路由器/TTS/SVC/脱口秀/相声 claude_api_key: "" claude_base_url: "" # 视频编辑/概览/摘要/问答/解说视频 gpt_api_key: "" gpt_base_url: "" # 用于字幕生成和细粒度视频理解的 MLLM gemini_api_key: "" gemini_base_url: "" ### 🎯 使用方法 bash # 配置完成后,运行以下命令: python main.py # 控制台将输出:用户需求:... # 需求示例: # 1. 我需要基于现有视频创建改述版本,即在保持原说话人声音的前提下修改语音内容。视频画面应与原视频相同,但对话内容按照我的具体要求进行更新。 # 2. 我有一段脱口秀脚本,想制作成专业水准的视频。我希望脚本能以良好的喜剧节奏和观众反应进行表演,然后匹配相关的视频素材,制作成一部完整的脱口秀专场。我已有参考脚本和一些想用于视频的素材。 当前的 LLM 选择针对每项功能均已优化。如有需要,您也可以在 VideoAgent\environment\config\llm.py 中调整模型名称。 — ## 🔮 演示 电影剪辑 梗视频 音乐视频 语言类喜剧 解说视频 视频概览 有关更多演示使用详情,请参阅:👉 演示文档 您可以在我们的哔哩哔哩频道上找到更多有趣的视频:👉 哔哩哔哩主页 (https://space.bilibili.com/3546868449544308) 欢迎观看更多精彩内容!😊 注意:所有视频仅用于研究和演示目的。音频和视觉素材均来自互联网。如果您认为任何内容侵犯了您的知识产权,请与我们联系。 — ## 💖 致谢 我们向众多为 VideoAgent 做出贡献的个人和组织致以最诚挚的感谢。本框架站在巨人的肩膀上,受益于开源社区的集体智慧以及全球研究人员的开创性工作。 ### 🔧 开源社区与服务提供商 - CosyVoice (https://github.com/FunAudioLLM/CosyVoice) - Fish Speech (https://github.com/fishaudio/fish-speech) - Seed-VC (https://github.com/Plachtaa/seed-vc) - DiffSinger (https://github.com/MoonInTheRiver/DiffSinger) - VideoRAG (https://github.com/HKUDS/VideoRAG) - ImageBind (https://github.com/facebookresearch/ImageBind) - Whisper (https://github.com/openai/whisper) - Librosa (https://github.com/librosa/librosa) ### 🎨 内容创作者与灵感来源 我们的工作得益于各平台内容创作者的创造性贡献而更加丰富。我们感谢: - 🎬 内容创作者:为测试和演示所使用的原始视频内容背后的才华横溢的创作者 - 🎭 喜剧艺术家:其作品启发了我们的跨文化改编 - 🎥 电影工作者:我们演示中出现的电影和电视节目的制作团队 ⚠️ 注意:我们演示中使用的所有内容仅用于研究目的。我们深度尊重所有内容创作者的知识产权,欢迎就内容使用提出任何疑虑或反馈。—

相似文章

Aurora:使用工具代理的统一视频编辑

Hugging Face Daily Papers

Aurora 是一个基于代理的视频编辑框架,它将一个工具增强的视觉语言模型代理与扩散变换器配对,自动解决用户请求中的文本和视觉未指定性,从而实现统一视频编辑任务,如替换、移除、风格迁移和参考驱动插入。

Vivago Video Agent

Product Hunt

Vivago Video Agent 是一款工具,能让用户无需大量提示即可制作出引人入胜的视频。