[Vex] - 我构建了一个开源终端AI视频编辑器,使用FFmpeg、Whisper和智能体工具调用来编辑真实视频素材
摘要
Vex 是一个基于终端的开源AI视频编辑智能体,它将LLM作为规划者,使用确定性工具(FFmpeg、Whisper)进行实际编辑,支持自然语言编辑命令,并具有本地优先、可脚本化的工作流。
大多数AI视频工具的思路本末倒置。它们从模型开始。我想要的是相反的方向——模型只作为规划者,而不是编辑器。实际的编辑工作应当由那些枯燥、确定性的工具完成:FFmpeg、MoviePy、Whisper、项目状态、时间线、撤销/重做、导出验证。于是我构建了 **Vex**。Vex 是一款基于终端的开源AI视频编辑智能体。你可以启动 Vex,把视频指给它,然后用这样的对话方式操作:
> 剪掉 D:\videos\clip.mp4 的前30秒 去掉尴尬的停顿 添加字幕 自动添加视觉素材 导出为Instagram格式
重点不在于“AI编辑视频”——那只是炒作的说法。真正的核心理念是 **视频编辑的智能体控制框架(agentic harness)**。LLM 并不拥有真相,它只是选择工具,项目状态才是真相的持有者。Vex 会维护一份可编辑的工作副本,存储时间线操作,记录中间产物,并且可以通过撤销/重做来重建编辑,而不是指望模型记住之前发生了什么。
当前的技术栈包括:
* 终端REPL中的自然语言编辑
* 安全的工作副本编辑,确保原始素材不受影响
* 修剪、合并、变速、淡入淡出、叠加、音频编辑、字幕
* 本地 Whisper 转录
* 基于转录的高亮片段裁切和竖版短视频
* 通过采样帧分析和可复用的FFmpeg滤镜实现自动调色
* 基于转录的自动视觉素材:优先使用 Hyperframes,必要时使用 Manim
* 适用于 YouTube、Instagram、TikTok、X 和播客音频的导出预设
* 支持 Gemini、Claude 以及兼容 OpenAI 的本地提供商(如 Ollama / LM Studio / llama.cpp)
目前最有趣的部分是自动视觉素材。Vex 不是盲目地给说话人视频堆砌素材,而是读取转录内容,评估哪些口语节拍具有可视化的价值,决定全屏替换还是画中画更稳妥,生成视觉元素,检查画面的对比度、空白区域、文字溢出和边缘安全,最后将最佳版本合成到剪辑中。
简而言之:AI 决定操作,确定性工具执行操作,项目状态记住操作——这就是整套思维模型。
诚实的评分卡:
- 能替代专业剪辑师吗?不能。
- 能自动化大量枯燥的创作者编辑工作吗?能。
- 能辅助制作短视频、字幕、B-roll、调色和导出吗?能。
- 在处理复杂的创意判断时完美吗?不完美。
它的优势在于:可重复执行的编辑工作流,配合明确的指令。
仍需改进的地方:长视频的品味判断、复杂的叙事剪辑,以及简化设置流程。
我构建这个工具的原因在于:我认为“AI视频编辑”不应当意味着把所有内容上传到一个黑箱式的Web应用中。同样有可能实现一种本地优先、可脚本化、可检查的编辑框架,其中模型只是系统的一部分。
仓库链接在下方评论中。我非常希望听到来自视频剪辑师、智能体工具开发者或曾尝试自动化FFmpeg工作流的各位的真诚反馈。什么样的改进会让这个工具在你的工作流中真正有用?
相似文章
构建了一个基于 CLI 的视频编辑代理框架
Vex 是一款开源 CLI 代理框架,允许用户通过自然语言指令编辑视频,自动化处理静音移除、B-roll 添加和视觉生成等任务。
VEXI
VEXI 是一款开源的人工智能编程助手,专为终端环境设计。
Vexilo
Vexilo 是 Claude Code 的一款规划器,内置 31 个代理、92 条命令和 121 种以上技能,旨在提升 AI 辅助开发效率。
Show HN: FableCut – 一个AI代理可驱动的浏览器视频编辑器(零依赖)
FableCut 是一个基于浏览器的开源非线性视频编辑器,将其时间线暴露为 JSON 文档,允许 AI 代理通过 MCP/REST API 驱动视频编辑,并支持实时热重载。
@Fluyeporlaweb: 这简直他妈的太不可思议了 一个实验室刚刚发布了一个仓库,完全将方向、脚本、制作…
一个实验室发布了 ViMax,这是一个开源多智能体系统,能够完全自动化从文本到视频的制作——生成脚本、分镜和带有连贯角色的视频,解决了长格式 AI 视频生成中的一个关键难题。