为什么视频代理模型是下一个前沿——Ethan He, xAI Grok Imagine(98分钟阅读)
摘要
来自xAI的Ethan He讨论了为什么视频代理模型是下一个前沿,他认为视频模型从LLM中获取智能,并且视频生成的演变将模仿AI编程,从一次性输出转向多轮规划与执行。
Ethan He曾是Nvidia Cosmos世界模型的负责人。随后他加入xAI,在三个月内构建了Grok Image。他一直处于视频生成、多模态模型和实时世界模型等一些最重要工作的核心。本文包含对He的采访,他在其中详细阐述了构建前沿图像和视频系统所需的实际要素。
查看缓存全文
缓存时间: 2026/06/02 15:41
# 为什么视频代理模型是下一个方向 — 伊森·何 (Ethan He), xAI Grok Imagine
来源: https://www.latent.space/p/video-agents
*我们正在宣布本周的 AIEWF (https://ai.engineer/wf) 演讲者!参与 AI 工程调查 (https://notion.qualtrics.com/jfe/form/SV_bP07tSVMXH7ePCS)!*
今天的嘉宾伊森最初作为 NVIDIA Cosmos 世界模型 (https://www.youtube.com/watch?v=og59L4JECz4&pp=ygUWbGF0ZW50c3BhY2V0diBldGhhbiBoZQ%3D%3D) 的负责人加入 LS Paper Club,但随后他加入了 xAI,并在 3 个月内构建了 Grok Imagine:
X 头像 for @EthanHe_42 伊森·何@EthanHe\_42 很高兴分享我们的新 Grok Imagine 版本 🚀 这是迄今为止质量最高、速度最快、成本效益最高的视频生成模型。支持 720P、视频编辑和更好的音频!我们认真听取了您的反馈,并迅速行动。仅在六年前,我们几乎... X 头像 for @xai xAI@xAI 理解需要想象。Grok Imagine 让你将脑中的想法变为现实,现在通过全球最快、最强大的视频 API 即可使用:https://t.co/tqQwQVgCEI 试试看,让你的想象力尽情驰骋。2026年1月29日 5:43 AM·116K 浏览量 127 回复·107 转发·1.35K 点赞 (https://x.com/EthanHe_42/status/2016749123198673099)他回到 Latent Space 分享了一些核弹级观点:**视频模型的主要智能来自大语言模型**,而非来自视频数据的训练;而下一个前沿——真正交互式、实时、长时域**世界模型**——将致力于研究 LLM(或许还有**交互模型 (https://www.latent.space/p/ainews-thinking-machines-native-interaction)**...)
换句话说:在短期内,下一代 Sora 不会是一个更好的视频模型,而是**一个视频代理**。
**生成式媒体 (https://www.youtube.com/watch?v=t4359sKBu4w&list=PLcfpQ4tk2k0VjKRy3q6ZxeOtkbZlmFDLg)** 可能更接近**AI 编程的演进路径**:从专注于一次性输出的性能和成本,转向面向代理和系统的多轮推理与规划模型,使其能够规划、编辑、测试、调试并提交 PR。
到了某个节点,编程模型已经足够优秀,提升性能的唯一显著下一步就是**处理这些模型的编排**。
如今,随着视频模型在真实性、一致性和提示遵循性方面性能显著提升,同时成本效率更高,视频生成的下一步演进也可能是能够规划、生成、编辑、批评并迭代整个创意任务的系统。
X 头像 for @XFreeze X Freeze@XFreeze Grok Imagine 代理模式(Beta)刚刚在 Grok 网页版上线。它是一个完整的创意代理,工作在一个无限开放的画布上。Grok 代理在同一工作区内自动规划 → 生成 → 编辑 → 迭代所有内容。告诉它你想要什么,然后看它规划、生成、编辑... 2026年4月30日 5:42 AM·920K 浏览量 681 回复·1.15K 转发·3.97K 点赞 (https://x.com/XFreeze/status/2049725955208622475)在本期节目中,swyx 和 Vibhu 与伊森深入探讨了构建**前沿图像和视频系统**的实际需求:数据、VAE、扩散Transformer、音视频对齐、推理加速,以及存储和移动海量视频数据的隐藏成本。从构建**NVIDIA 的 Cosmos 世界模型 (https://www.nvidia.com/en-us/ai/cosmos/)**,到加入 **xAI** 并在 **Grok Imagine (https://grok.com/imagine)** 从零到一构建时,**伊森·何**一直处于视频生成、多模态模型和实时世界模型领域最重要工作的中心。
我们深入探讨了 **Grok Imagine**,一个小型 xAI 团队如何**在三个月内发布了其首个多模态视频模型**,为什么**迭代速度**在模型开发中几乎比其他任何因素都重要,以及为什么许多最大收益来自于修复数据和训练流程中的微小 Bug。
视频代理几乎肯定将成为未来一年的趋势。最后,我们展望了视频代理之后的未来:
**Flipbook (https://www.flipbook.page/n/43e8c7b08ab14571810fee265c331cb3)** 今年发布时引起了小小轰动,但大多数人只将其视为一个有趣的演示。伊森却非常认真看待它——随着推理速度和成本逐年下降,定制视频 JIT UI 的未来比你想象的要近。我们讨论了为什么视频生成模型可能成为 AI 的前端,**生成式 UI 如何取代传统 HTML/CSS**,为什么世界模型需要实时、交互且长时域,以及为什么视频生成的未来可能更依赖于语言模型和代理而非单纯的扩散。
**我们讨论了:**
- 为什么**快速迭代**比会议更重要
- 为什么**小训练 Bug** 能带来巨大的模型质量提升
- 为什么编码模型可能使**计算再次成为瓶颈**
- 图像和视频模型如何通过**合成字幕**进行训练
- **VAE 和潜在空间**在前沿视频模型中的作用
- 为什么**图像模型**是视频模型的基础
- **时间压缩**与实时交互性之间的权衡
- **Flipbook (https://www.flipbook.page/)、Neural OS (https://neural-os.com/)** 以及生成式 UI 的未来
- 为什么未来界面可能从**用户意图直接到像素**
- 训练视频模型的隐藏成本:**存储、出站流量和 GPU 时长**
- **步骤蒸馏和一致性模型**(如 **OpenAI sCM (https://openai.com/index/simplifying-stabilizing-and-scaling-continuous-time-consistency-models/)**)如何使视频推理速度提升数个数量级
- Grok Imagine 0.9 和**大规模音视频生成**
- 为什么**音视频对齐**比文本-视频对齐更难
- 伊森对**世界模型**的定义
- 参考-到-视频、视频扩展和**长上下文视频生成**
- 为什么 xAI 的研究沟通低估了 **Grok Imagine**
- **xAI 文化**如何塑造了开发速度
- AI 水印、SynthID 和**检测生成媒体**
- 为什么**提示改写**对视频模型很重要
- Grok Imagine 代理与**视频代理**的崛起
- 为什么**语言模型**可能解锁更好的视频生成
- 机器人学、物理 AI 和**具身世界模型**
- 为什么**伊森离开 xAI** 并将重心转向 LLM
- 自管理上下文、记忆和**语言模型的下一个前沿**
**伊森·何**
- **领英:**https://www.linkedin.com/in/ethanhe42
- **X:**https://x.com/EthanHe_42
**00:00:00** 引言
**00:01:25** 从 NVIDIA Cosmos 到 xAI
**00:03:24** 从零到一构建 Grok Imagine
**00:10:07** 图像和视频模型是如何训练的
**00:18:53** 视频压缩、VAE 和实时权衡
**00:22:10** 生成式 UI、Flipbook 和 Neural OS
**00:32:10** 训练大型视频模型的成本
**00:37:04** 蒸馏、GAN 和快速视频推理
**00:41:21** 音视频生成与 Grok Imagine 0.9
**00:48:34** 什么构成了世界模型?
**00:55:51** 参考视频、长上下文和视频记忆
**01:00:11** xAI 文化、研究与第一性原理构建
**01:09:45** AI 安全、水印与提示改写
**01:13:10** 视频代理与 AI 辅助创作
**01:27:32** 为什么语言模型能解锁更好的视频
**01:31:15** 机器人学、物理 AI 与具身世界模型
**01:32:38** 伊森为何离开 xAI
**01:34:16** 自管理上下文与 LLM 的未来
**01:38:43** 伊森的职业道路与结语
**Swyx [00:00:00]:** 我们现在在演播室与伊森·何一起,他最近来自 xAI。欢迎。
**Ethan [00:00:10]:** 谢谢。很高兴来到这里。
**Swyx [00:00:11]:** 还有 Vibhu 也在。你第一次来到我们或加入潜在空间世界是因为你在 NVIDIA 做 Kosmos 工作,并且写了一篇论文。我们很喜欢。你也做了演示,所以感谢你这么做。
**Ethan [00:00:23]:** 实际上,我还在潜在空间上两次介绍了 MoE。
**Swyx [00:00:29]:** 你最初是怎么听说我们的?是我们联系你的吗?是这样吗?
**Ethan [00:00:33]:** 不是,实际上是社区。我发现,哦,有一个在线社区,人们在那里讨论 AI,并且每周通过 Paperclip 互相学习论文。这非常好。
**Ethan [00:00:49]:** 我学到了很多。
**Swyx [00:00:49]:** 我想已经三年了,我们没有停过,甚至圣诞节和新年都没停。很多周我想停下,但它一直在继续。
**Vibhu [00:00:58]:** 不,那很好。我记得你发过说你做了一篇论文,我当时就想“哦,很酷。我们有 Paperclip。那就演示一下吧。”
**Vibhu [00:01:04]:** 但后来我可能联系了你。
**Swyx [00:01:05]:** 你——因为这是一个业余俱乐部,对吧?
**Swyx [00:01:08]:** 所以这很不寻常,但有时候论文作者会来实际讲解论文。今天我们刚做了一篇 poolside 的论文,显然非常好。
**Vibhu [00:01:18]:** 昨天刚发布的。
**Vibhu [00:01:19]:** 相当有趣,对吧?完全开源。他们谈论了所有内容,包括系统。所以是一篇好论文。我们会推荐大家去读。
**Swyx [00:01:25]:** 跟我们说说你转到 xAI 的经过吧,因为我其实都不知道你是什么时候加入的。就讲一下这个转变的故事。
**Ethan [00:01:34]:** 在 xAI 之前,我在 NVIDIA 做 Kosmos 世界模型。Kosmos 是一个巨大的视频基础模型,旨在模拟世界,并且作为所有机器人学家在其上构建的基础。在那里,当我构建完 Kosmos 一号后,我意识到这个东西也有类似语言模型的缩放定律,我们需要进一步扩展视频模型。这就是为什么我意识到需要搬到一个有更多计算资源的地方。就这样。
**Swyx [00:02:13]:** 比 NVIDIA 还多?
**Vibhu [00:02:14]:** 拥有丰富 GPU 的公司自己来了。
**Vibhu [00:02:19]:** 从时间线来看,Kosmo 是什么时候?相当早,对吧?是开放世界模型,开放论文,所有东西都开放。
**Ethan [00:02:25]:** 是 2024 年底。
**Vibhu [00:02:28]:** 2024 年底。
**Ethan [00:02:30]:** 然后在 2025 年中,我搬到了 xAI。那时——我加入的时候差不多是 xAI 准备构建视频模型和多模态模型的时候。当时没有基础设施,没有数据,也没有模型,只有几个工程师,我们在三个月内构建并发布了第一个模型,Grok Imagine 0.9。
**Ethan [00:02:55]:** 从那以后,我继续研究视频模型,更多地从训练转向了视频模型的后训练。例如,参考到视频,有点像 Cameo 功能,以及视频扩展。在我离开之前,我研究世界模型,领导一个小团队专注于实时长时域视频生成。
**Swyx [00:03:24]:** 你能给出一个粗略的路线图吗?比如,你加入了一个全新的团队。Grok 之前只有文本,或者他们与 BFL 合作做图像生成。你们需要哪些构建模块?你有计算资源,数据可以去获取。就说说建立新团队时人们应该考虑的步骤顺序?
**Vibhu [00:03:43]:** 实际上甚至更深层,不只是数据可以获取。你们还得去获取数据,对吧?你们发货很快,但没错。
**Swyx [00:03:51]:** 三个月真是快得惊人。
**Ethan [00:03:55]:** 我要说,这要感谢我在 NVIDIA 的经历,因为我们第一次构建 Kosmos 的时候,大约花了一年时间。所以这是我第二次做这件事。大致知道该怎么做。我认为最重要的是人才。每个人都非常强大、聪明,彼此之间目标一致。这大大加速了事情。因此减少了人与人之间的沟通带宽,每个人都能朝着同一个目标努力。那时候日历上会议不多,大概每天一次同步会,之后就是全速构建。那段时光非常有趣。
**Ethan [00:04:47]:** 另一件事是,xAI 在数据推理、模型推理和支持方面有非常坚实的基础,这对模型开发帮助很大。当我看训练模型时,实际上最重要的不是别的,而是你每天能进行多少次迭代。你能做的迭代越多,就能更快地训练模型。如果你有非常强大的基础设施和大量计算资源,就能在很短的时间内训练这些模型。这给了你更大的容错空间,也让你有机会发现更多 Bug。
**Swyx [00:05:46]:** 什么是迭代?是几百步吗?还是什么?
**Ethan [00:05:50]:** 就是说训练模型,从获取新数据,可能设计新算法,然后训练一个新模型,也许是在较小规模上。
**Swyx [00:06:01]:** 所以是任何超参数搜索的周期时间。
**Ethan [00:06:04]:** 周期时间,以及调整到这个模型进行评估。这个模型是否比我上一个迭代更好?
**Ethan [00:06:11]:** 所以
**Swyx [00:06:11]:** 所以是在你之前,有人已经设置好了,让你可以非常快地迭代。
**Ethan [00:06:15]:** 我觉得那里的基础对于开发和研究的模型来说非常好。
**Ethan [00:06:23]:** 而且我经常发现,这有点无聊,但很多改进并非来自新算法,而是来自在数据管道、模型训练管道中找到一些微小的 Bug。这些 Bug 的修复给模型质量带来了最大的提升。
**Vibhu [00:06:46]:** 这很有趣,对吧?你说小团队,沟通带宽小,但很多质量提升又是通过找小 Bug。这看起来有点反直觉,对吧?人多了,你可以消灭更多这样的 Bug,但看到另一面也很有意思。
**Swyx [00:07:00]:** 我也好奇,你有没有尝试用 LLM 来找 Bug?我不知道。
**Ethan [00:07:05]:** 我记得那是 2025 年中期,编程模型还没那么成熟。我记得 2025 年 12 月的时候,它已经非常好了。是的,我当时就在用。它很有帮助。有时候它生成的代码难以维护,尽管第一次能极快地构建东西。但它会生成数千行的意大利面条式代码,我无法维护,而且 LLM 自己也搞不清楚哪里出了问题以及如何在此基础上改进。但现在我发现它好多了。是的,我想提出另一点:现在的编程模型效率更高,能帮助我们更快地实现东西。计算可能再次成为瓶颈,因为以前如果你想训练一个新模型,比如你想生成新的合成数据,或者写一个新算法,可能需要几个星期。在那段时间里,你可能没有实验可以运行。但现在你可以在几小时内构建好那个东西,然后立即训练一个模型。
**Ethan [00:08:24]:** 现在你必须拥有足够的计算资源来尝试所有想法。所以计算可能再次成为迭代速度的瓶颈。
**Swyx [00:08:36]:** 是的,老实说,我觉得这是一份压力很大的工作,因为你会想“我应该尝试所有东西,如果我没有,那我就是在干不好我的工作。”
**Vibhu [00:08:48]:** 还有另一种压力:你消耗着数千个 GPU。
相似文章
@swyx: 完整文章和链接在此
Latent Space 播客的一集讨论了这样一个论点:视频模型从大语言模型(LLM)中获取智能,下一个前沿是视频智能体。嘉宾 Ethan He(曾在 xAI 构建 Grok Imagine)分享了构建前沿图像和视频系统的见解。
您如何看待Higgsfield超级计算机和Invideo Agent One的对话式AI副驾视频制作方式?
讨论用于视频制作的对话式AI副驾方法,以Higgsfield超级计算机和Invideo Agent One为例,并质疑这种编排工作流程是否比直接使用底层模型更有价值。
@EthanHe_42: 在@latentspacepod播客中,我分享了关于视频生成、世界模型、LLMs、智能体、持续学习以及……的观点
Ethan He在Latent Space播客中分享了他的见解,讨论了关于视频生成、世界模型、LLMs、智能体、持续学习以及AI下一前沿的关键观点。
有没有人探索过AI视频智能体?这是新事物,但通过聊天机器人聊天来创建视频真的很有趣。
文章讨论了新兴的AI视频智能体概念,用户只需与聊天机器人对话即可生成完整视频,这可能简化并取代传统的多工具视频制作流程。
智能体“观看”视频的最佳方式?
本文讨论了AI代理处理和理解视频内容的最优方法,探索了各种视频分析技术。