介绍 Odyssey-3:一个通用物理智能(阅读时长约15分钟)

TLDR AI 模型

摘要

Odyssey-3 是一个通用世界模型,它使物理代理能够以最少的任务特定数据控制多样化的系统,如机器人、车辆和无人机,展示了广泛的迁移学习能力。

Odyssey-3 是一个基础世界模型,配备了自回归扩散变换器,用于模拟高度多样化的场景。该模型能够控制机器人、驱动人形机器人、驾驶车辆、操控无人机、训练人工智能和玩电子游戏。它对物理、动态、因果关系、人类行为以及构成现实的其他概念有学习的理解。该模型将使物理代理能够与物理和虚拟系统原生接口。
查看原文
查看缓存全文

缓存时间: 2026/09/16 14:26

# 推出Odyssey-3:通用物理智能 来源:https://odyssey.systems/introducing-odyssey-3 Jeff和我在2010年代开始从事自动驾驶和机器人研究,当时该领域的一个长期目标是实现通用物理智能:一个能够理解世界运作范围、并能跨多种机器与任务运行的系统。实际上,该领域通过不断专业化的系统逐步推进,每个系统都针对相对狭窄的领域进行训练,且往往需要海量的任务特定数据。 我们于2023年创立Odyssey,基于的信念是世界模型能为实现这一更宏大的目标提供一条可靠的技术路径。通过学习一个关于世界运作方式的通用因果模型,世界模型可以为众多物理和虚拟系统提供共同基础,并以相对较少的任务特定经验将这些知识适配到新任务中。 今天,我们分享Odyssey-3的研究成果——这是迄今为止我们最强大的基础世界模型,也是单个学习智能体跨多种物理与虚拟系统运行的早期范例。Odyssey-3是一个自回归扩散Transformer,经过训练可模拟高度多样化的场景。同一个基础模型能够控制机器人、驱动人形机器人、操控车辆、驾驶无人机、训练AI,甚至运行电子游戏。 Odyssey-3在海量视觉观测数据上训练,已发展出对物理规律、动力学、因果关系、人类行为及其他构成现实世界的概念的学习理解。它能运用这种学习到的世界知识解决物理和虚拟任务,每个任务所需的经验数据量远少于以往系统。我们将Odyssey-3视为实现物理智能体的关键——这是一种新型智能体,它能理解世界的语言——从而使其能原生地与物理和虚拟系统交互。 ## 理解世界语言的物理智能体 Odyssey-3仅需数小时的经验数据就能展现出控制物理系统的优异性能,这得益于其预训练阶段获得的广博世界知识。这些经验数据将物理系统的观测与执行任务时采取的动作配对,提供其控制方式的示例。动作解码器——一个附加在世界模型上的学习输出组件——在这些示例上训练,将Odyssey-3的内部表征转化为物理系统所需的动作。 ### Odyssey-3可驱动机械臂 仅凭数十小时的机器人演示数据,Odyssey-3就能学会控制多种机械臂并完成复杂任务,这得益于预训练获得的广博世界知识。在我们的实验中,我们观察到了训练演示中未出现的恢复行为,例如在抓取失败后重新调整抓手角度,或拾取以非常见位置或姿态掉落的物体。这些行为表明Odyssey-3学到的物理理解能力能帮助机器人应对其未明确演示过的情况。这对追求样本效率的机器人学至关重要——因为收集每种可能故障及恢复情况的演示很快就会变得不切实际。 一个重要问题是这些能力在不同机器人和环境中的表现一致性如何。为此,我们很高兴宣布与Poke & Wiggle (https://pokeandwiggle.com/)展开紧密合作——该公司是机器人数据、机器人策略分析和大规模基准测试领域的领导者。我们将共同评估Odyssey-3在不同机身、视角和控制条件下的表现,以了解其知识迁移的适用范围、失效边界,以及这些发现如何指导进一步训练。 ###### “将麦片倒入碗中” ###### “把糖果袋放入盒子” ###### “把物品放入纸盒” ###### “把湿巾放入盒中” ###### “关上螺丝盒” ###### “把物品放入盒子并盖好” ###### “将咖啡倒入浓缩咖啡杯” ###### “用湿巾清洁盘子” ### Odyssey-3奠定Flexion人形机器人自主控制基础 今天,我们宣布与Flexion (https://flexion.ai/)开展深度研究合作——该公司是通用机器人智能领域的领导者,在强化学习和全身控制方面具有专长。Flexion正攻克机器人学中最具挑战性的问题之一:构建通用智能,使机器人能够在人类现有的建筑、工具和环境中完成有用工作。他们的研究融合了感知、操作和全身控制,旨在开发能执行长时间任务并在故障时自主恢复的机器人。 以Odyssey-3作为基础模型,Flexion进行了大量研究和工程开发,才实现此处展示的人形控制策略。仅凭数十小时的人形遥操作数据,所得系统就能实时执行任务,通过Flexion在机器人学习与控制领域的工作应用Odyssey-3的预训练表征。在我们的评估中,这些策略比测试的VLA基线更好地适应环境变化,能在导致基线策略失效的光照变化条件下继续执行任务。我们将这些结果视为Flexion机器人学专长与强大基础世界模型结合所能取得成就的鼓舞人心的展示,并期待继续推进这项研究。 ###### “打开蓝色容器并取出纸盒” ###### “将盘子移到桌子中央,然后把杯子放在盘子上” ###### “把盒子靠在木墙角放置” ###### “打开纸盒” ### “Odyssey-3令我们兴奋之处在于,它建立在远超机器人自身演示所获得的物理知识基础之上。将这一基础与我们在人形机器人学习和控制方面的研究相结合,为机器人如何快速掌握实用技能并适应陌生场景开启了令人振奋的可能性。” ——Nikita Rudin,Flexion联合创始人兼CEO ### Odyssey-3可驾驶车辆 仅凭20小时的模拟驾驶数据,Odyssey-3就能在印度街道的闭环环境中自主驾驶车辆,实时生成行驶轨迹。预训练的世界模型在训练过程中保持冻结,提取的视觉表征输入一个相对较小的驾驶策略模型,该模型预测车辆前方的路径点。驾驶策略因此学会借助现有的世界理解,模拟经验教会它如何将这种知识应用于驾驶。 ###### “从第一个环岛出口驶出” ###### “沿道路行驶” ###### “沿道路行驶” ###### “沿道路行驶” ###### “向左进行180度掉头” ###### “沿道路行驶” 我们将完全在模拟中训练的策略与在真实驾驶画面中训练的策略进行对比,在有频繁干扰的繁忙道路上对两者进行评估。两者都能在保持车道的同时过弯,处理从两侧超车的车辆,并在繁忙路口转弯。在真实道路上,完全在模拟中训练的策略在两次安全员干预之间的行驶距离约为真实画面训练策略的77%。 ### Odyssey-3可训练AI Odyssey-3能够生成AI可居住的环境,使其在其中采取行动并从结果中学习。这些世界支持递归学习系统——一个智能体在另一个智能体内部运行,彼此推动以提升能力。 我们关于PROWL (https://odyssey.systems/introducing-prowl-1)的研究直接探索了这一方向:智能体发现故障以指导世界模型改进,而可靠的模拟经验则为智能体本身提供训练。随着世界模型改进,它能支持更复杂的体验;随着智能体改进,它们能发现能力较弱的智能体无法触及的弱点。每种智能体都能持续扩展对方的学习边界,帮助生成推动进一步进展所需的经验。 这些世界还为我们提供了研究日益强大的智能体在自由行动时如何表现的方法。随着语言模型和其他智能体承担更大责任,我们需要在潜在危险行为造成现实世界危害之前,找到发现和研究这些行为及其后果的场所。 #### 语言模型可为达成目标而工作 #### 智能体可探索模拟世界 ### Odyssey-3可驾驶无人机 遵循与驾驶实验相同的训练方案,我们训练空中导航策略,使其根据近期相机观测、无人机运动状态和高层导航提示生成飞行路径点。该策略运用Odyssey-3的预训练视觉表征,模拟飞行演示教会动作专家如何将这些表征转化为运动指令。使用数十小时的模拟无人机数据,我们训练出一个策略,在模拟室内环境中能稳定飞行并避开障碍物。 为探究骨干网络在策略训练前已掌握的知识,我们还对其权重冻结时在空中导航任务上的预测进行了可视化。在这些定性演示中,我们观察到合理的定向飞行和避障运动,以及与世界语义内容相符的响应。这些观察表明预训练提供了关于空间结构和运动的有效知识。 ###### “起飞,导航至桌子后方并悬停” ###### “起飞,飞入桌子下方并在书柜后降落” ###### “起飞,探索房间并在桌子上方悬停” ###### “起飞,导航至房间右端并降落” ### Odyssey-3可运行电子游戏 Odyssey-3能为电子游戏策略提供基础。我们使用游戏画面录像配合键鼠输入训练这些策略,同时保持预训练的世界模型冻结。在游戏中,策略观察近期游戏画面,生成控制指令,并利用产生的观测结果选择下一步行动。控制物理系统的相同方法转变为与虚拟世界交互的方式。 我们的实验在Rockstar Games的《GTA V》中产生了连续的游戏环节,并提供了驾驶、射击和近身格斗的精选示例。我们还观察到早期迁移迹象:在GTA上训练的策略在Rockstar Games的《荒野大镖客2》中实现了移动,在Square Enix的《热血无赖》中实现了摩托车骑行,且无需在这些游戏上进行额外策略训练。在一项实验中,基于约两小时GTA画面训练的移动策略,在《荒野大镖客2》中产生了骑马移动,将一款游戏中学到的控制方式应用于不同角色、载具和环境。 结合我们在机器人、人形机器人、驾驶、训练和无人机方面的成果,这些游戏实验表明Odyssey-3是通用具身智能体的强力基础。共享的预训练世界模型可支持跨不同机身、环境和控制条件的策略,且有早期证据表明学习到的行为能在它们之间迁移。 ## 物理智能体的初现 现实世界中的智能体(如人类)通过观察和交互来理解世界运作方式,使其在学习新任务时能借鉴已有知识。我们可以在18岁学会操作危险机械——即使此前从未使用过——因为我们已通过导航空间、观察无数运动物体、了解其受力反应、在多种场景下观察人类使用工具,并认识到碰撞的危险性,建立了直觉认知。 当今许多机器人系统通过重复演示特定任务来训练操作物体的能力,积累大量狭窄经验以完成单一任务。我们认为这表明这些系统正以蛮力解决问题,用不断增长的任务特定数据量来弥补通用世界理解的缺乏。人类无需在数千小时特定任务观察后才具备能力,因为必要的知识已通过更广泛的世界体验获得。 同样,真正的物理智能体应具备超越人类的世界理解,包括支配现实演化的物理规律、动力学和因果关系。这种理解将使其与物理系统形成原生接口,使其能够以人类所需或更少的经验训练量适应新任务。Odyssey-3实现了早期物理智能体,代表了世界模型性能与成熟度的飞跃,能够将其学习到的理解应用于机器人、人形机器人、汽车、无人机和电子游戏,且仅需数小时经验数据。 随着物理智能体发展,我们相信它们将使我们能够自动化日益复杂的物理工作,承担使人暴露于危险的任务,协助处理因衰老、疾病或残疾而困难重重的日常任务,让更多人能够独立生活。这些能力同样能加速科学与工程实验,让我们有更多时间陪伴彼此、从事有意义的工作,最终使我们能在人类从未亲身经历的环境中运作——包括超越我们自身的世界。 这些模型还将改变智能本身的发展方式,生成未来智能体学习所处的世界,并从智能体在物理世界中行动时的发现中学习自身。更强大的世界模型将支持更强大的智能体,其经验和发现反过来将改进塑造它们的世界,使双方都能超越我们手工构建环境的局限性。 世界模型是学习型动态系统。作为基础层,它们通过支持在精确的开放环境中进行决策与推理,代表了通用智能的终极目标。结合视觉语言模型智能体后,它们可以直接在这些表征中进行推理。然而,前沿世界模型仍落后于这一潜力:主要因为它们尚未达到规模化,比语言模型小约两个数量级。我们很欣喜在Odyssey-3中看到这一潜力的早期信号,并期待在接下来几周内公开发布它。

相似文章

Cosmos 3 如何帮助物理 AI 在行动前思考

NVIDIA Blog

NVIDIA 宣布推出 Cosmos 3,这是一个开放的世界基础模型,结合了视觉推理、多模态生成和动作预测,帮助机器人、自动驾驶车辆和 AI 代理理解并预测现实世界的动态。