@seclink: https://x.com/seclink/status/2057093284330430533

X AI KOLs Following 新闻

摘要

英伟达机器人负责人Jim Fan公开演讲,主张机器人应直接照搬大语言模型的成功路径,提出世界动作模型(WAM)、基于人类第一人称视频的数据革命以及神经模拟等方向,并预测95%概率在2040年前实现通用实体机器人终局。

https://t.co/MHnkTcIFjI
查看原文
查看缓存全文

缓存时间: 2026/05/20 14:31

英伟达机器人负责人:照搬大模型路线,95%概率2040年实现机器人终局

📌 内容来源: https://www.youtube.com/watch?v=3Y8aq_ofEVs

⚡ 开篇先看 金句: 我们这代人刚好生在解决机器人问题的正确时间点,95%把握2040年前就能走完机器人完整技术树过去三年机器人领域的主流模型方向走偏,新路线直接照搬大语言模型的成功逻辑 传统远程操作采数据的方法走到头,未来机器人训练数据主流会变成人类日常第一人称视频 机器人终局目标清晰,2040年前就能实现能自主进化的通用实体机器人

2026年,英伟达具身自主研究团队负责人Jim Fan公开抛出了行业炸弹。所谓具身智能,就是拥有实体身体、能在物理世界行动交互的人工智能,和大家熟悉的只存在于数字世界的聊天AI不是一回事。这次演讲直接推翻了过去三年行业的主流路线,给机器人画出了一张和大语言模型一模一样的成功路径图。

有意思的是,2016年夏天Jim Fan还是实习生的时候,曾经在全球第一台送给Elon和OpenAI团队的DGX-1——也就是英伟达推出的AI训练专用GPU服务器——的金属铭牌上签名,同场签名的还有Andre、Ilya。Ilya当时说过一句话:“如果你相信深度学习,深度学习就会相信你。”十年过去,这句话真的在机器人领域应验了。

🚀 核心路线:机器人直接抄大语言模型的作业

结论很简单:大语言模型已经走通了成功之路,机器人不用另起炉灶,打不过就加入,直接抄作业就行。

现在大家熟悉的大语言模型,也就是能生成文本的主流生成式AI,核心逻辑是“预测下一个字符”,靠「预训练-监督微调-强化学习」三步走完了发展路径。Jim Fan提出,机器人只需要把这个逻辑换个内核:把预测下一个文字字符,换成预测下一个物理世界的状态,再靠少量微调对齐动作,最后用强化学习搞定最后一公里,核心逻辑就是“如果打不过他们,就加入他们”。

过去三年行业的主流模型叫VLA,也就是视觉语言动作模型,问题出在资源分配错了:大部分参数都分给了语言模块,擅长记知识说名词,偏偏不擅长学物理规律和动作——也就是我们要机器人干的“动词”部分,属于典型的头重脚轻,走错了方向。

正确方向是世界动作模型,简称WAM,把视觉和动作当成模型的核心,先预测未来几秒物理世界会变成什么样,再输出动作。现在的代表方案Dreamer,已经相当于当年的GPT-2:能保证各种任务的动作大体正确,实现开放式的自然语言控制机器人,规律也很清晰:只要预测的未来世界准确,动作就成功,预测错了动作就失败。

📊 数据革命:传统遥操作已经走到尽头

结论先给:靠人远程操作机器人采集训练数据的老方法,天生带有物理上限,未来一两年,遥操作数据占比会降到几乎可以忽略。

遥操作是什么?就是人远程操控机器人做动作,把过程存下来给模型学。现在单台机器人一天最多只能收集3小时有效数据,量根本攒不出来。有意思的是,英伟达首席科学家Bill Dally曾经亲自上阵做遥操作采数据,他采出的那条轨迹,至今是整个研究数据集里最贵的一条。

新的数据路线叫传感化人类数据,核心就是:采数据不用机器人本体参与,直接采人的动作就行。代表方案就是通用操作接口UMI,让人把传感执行器戴在自己手上,做一遍动作,直接就能转成机器人能用的训练数据。针对五指灵巧手的升级版本Dex-UMI,是一比一映射的外骨骼设备,数据收集速度和成功率远高于传统遥操作,训练出来的机器人甚至完全不用遥操作数据就能自主运行。

更狠的是Ego-Exo模型:预训练只用了2.1万小时野外采集的人类第一人称动作视频,完全没用到任何机器人数据;微调只需要50小时高精度动作捕捉加4小时遥操作,遥操作数据占总数据量不到0.1%。就这样已经能搞定叠衬衫、操作注射器、转移液体这类高难度精细任务,测试时只需要看一次人类演示,就能学会新的动作策略。

从可扩展性来看:遥操作最差,穿戴设备能做到几十万小时,要是第一人称视频转起来数据飞轮,未来一两年就能轻松攒到1000万小时,这个量级是遥操作永远达不到的。目前UMI相关的研究,已经催生了两家独角兽创业公司,方向的可行性已经被资本验证。

🌐 模拟环境:算力就是数据,就是环境

结论:要训通用机器人,不可能靠堆一百万台实体机器人,纯数据驱动的神经模拟才是可扩展的路线。

想要训出能应付各种场景的通用机器人,需要百万级的多样化训练环境,真造一百万台实体机器人放在那,既不现实也太贵。英伟达给出的方案是Dream Dojo,一个纯数据驱动的神经模拟器。

和传统模拟器不一样,Dream Dojo没有预设物理方程,也不用传统的图形引擎,完全靠数据驱动:给它输入连续的动作信号,它就能实时输出下一帧画面和所有传感器状态,所有像素都是生成的,不需要真实拍摄。

现在已经有视频模型能靠这种方式,自学重力、浮力、光照反射这些物理规律,甚至能自发涌现出规划能力,自己找捷径解迷宫。这条路的终极形态就是“算力等于环境等于数据”,只要有算力就能源源不断产出训练数据,完全不用依赖实体机器人。

⏳ 终局判断:我们这代人就能等到

结论:Jim Fan给机器人终局画出了清晰的目标和时间表,95%把握2040年前就能全部实现。

什么是机器人的终局?需要解锁三个核心成就: 第一,通过物理图灵测试:也就是在广泛任务里,人类无法区分做任务的是机器人还是真人,Jim Fan判断这个目标2-3年就能实现,也就是2028-2029年。 第二,开放出物理API:机器人大舰队能像软件一样用命令配置,未来可以由大模型编排,造出相当于“原子打印机”的无人工厂,输入设计就能输出成品,还能自动化运行生命科学发现的湿实验室。 第三,实现物理自动研究:机器人可以自己设计、改进、建造下一代机器人,能力突破人类的极限。

时间判断的逻辑也很清晰:从2012年AlexNet诞生到2026年这次演讲,AI用了14年走到当前的水平,按照指数发展的规律,再往后推14年就是2040年。刚好这次研究,他们发现了灵巧操作的神经缩放定律——也就是AI领域的规律:模型效果和数据量、算力呈现可预测的正相关,数据算力越多效果越好——这个发现距离大语言模型最初提出神经缩放定律,刚好过去6年,和大语言模型的发展节奏完全对得上。

Jim Fan说:我们这代人,出生太晚来不及探索地球,出生太早来不及探索星辰,却刚好赶上解决机器人问题的时代。技术是指数发展的,95%把握2040年前就能走完机器人完整技术树,到时候我们还年轻。

💡 核心金句

  • 如果你相信深度学习,深度学习就会相信你

  • 如果打不过他们,就加入他们——机器人直接照搬大语言模型的成功路径就行

  • 安息吧VLA,世界动作模型万岁

  • 我们出生太晚来不及探索地球,出生太早来不及探索星辰,却刚好赶上解决机器人问题的时代

  • 技术是指数发展的,95%把握2040年前就能走完机器人完整技术树,到时候我们还年轻

相似文章

@dotey: https://x.com/dotey/status/2053351712149135385

X AI KOLs Timeline

英伟达 Jim Fan 在 Sequoia AI Ascent 2026 上发表演讲,宣告 VLA 架构过时并提出世界动作模型(WAM)作为机器人新范式,介绍了 DreamZero、EgoScale 及神经仿真器 Dream Dojo 等关键技术。

@seclink: https://x.com/seclink/status/2067970118873993482

X AI KOLs Following

当前主流纯数据驱动机器人方案存在数据效率低、泛化性差的缺陷,新提出的神经符号物理智能范式将任务拆分为世界建模和规划两步,仅需1-10个演示即可学会新任务,泛化能力远超传统端到端方案,为通用机器人提供了更可靠的路径。

@seclink: 机器人世界模型(全新维度,0 去重 = 全新信息) 核心项目: - Awesome-WAM(OpenMOSS):World Action Models 综合论文列表,含 DreamDojo(从人类视频学习的通用机器人世界模型) - awe…

X AI KOLs Following

介绍了两个机器人世界模型相关的项目:Awesome-WAM(OpenMOSS)收录了World Action Models和DreamDojo等论文;awesome-physical-ai整理了VLA模型、世界模型和具身基础模型论文合集(含NVIDIA Cosmos Predict2.5)。

@seclink: https://x.com/seclink/status/2056715852914032662

X AI KOLs Following

Anthropic创始人Dario Amodei在Lex Fridman播客中预测强AI将在2026-2027年达到顶级人类水平,强调AI安全的核心在于防范权力集中与滥用,而非模型自主性,并讨论了缩放定律、Claude设计逻辑及AI安全分级(ASL)框架。