@aimalysheva: 潜在行为正当时,尤其在机器人领域:不再预测机器人的实际关节指令或游戏…

X AI KOLs Following 新闻

摘要

潜在行为在机器人领域越来越受关注,它使得从无动作标签的无标注视频中学习成为可能。DeepMind和FAIR的最新论文展示了从受控游戏环境到野外互联网视频的进展,有望实现模仿学习的可扩展训练。

潜在行为正当时,尤其在机器人领域:不再预测机器人的实际关节指令或游戏控制器输入,而是学习一个紧凑的潜在编码,仅解释两帧之间发生的变化,训练全程无需任何动作标签。 Genie(Bruce等人,DeepMind 2024,http://arxiv.org/abs/2402.15391)是一个简洁的概念验证:一个逆向模型查看连续帧,推断出一个小的离散潜在动作,解释帧间变化,仅凭这一学习到的动作空间,就能使生成的视频逐帧可控,尽管模型从未见过一个真实动作标签(同样的潜在空间还能迁移,可用于在未经任何特定机器人标注的视频上训练模仿智能体)。 (在同一研究集群中:'视频作为现实世界决策的新语言',http://arxiv.org/abs/2402.17139,由@sherryyangML等人撰写,提出了更广泛的论点,即视频本身作为通用界面,而不仅仅是针对潜在动作。) 更难的问题是将潜在动作推广到狭窄领域之外:Genie是在平台游戏录像上训练的,其中具有一致的主体和清晰的信号,而FAIR的一篇新论文(@garridoq_、Nagarajan、Terver、Ballas、@ylecun、Rabbat,http://arxiv.org/abs/2601.05230)则将潜在动作学习推进到实际的野外互联网视频中,这意味着不同片段之间没有共享的主体,在潜在动作具有任何一致含义之前,需要过滤掉更多环境噪声。 为什么机器人领域特别关心?动作标签需要远程操作或动作捕捉,这难以扩展,然而世界上发生的事件的无标注视频几乎是无限的,因此如果潜在动作空间能够泛化,就可以利用所有这些视频进行训练,而不仅仅是那些我们付费标注的视频。
查看原文
查看缓存全文

缓存时间: 2026/07/20 11:30

潜在动作正在迎来高光时刻,尤其是在机器人领域:不再预测机器人的实际关节指令或游戏控制器输入,而是学习一个紧凑的潜在编码,仅用以解释两帧之间的变化,无需在训练中任何地方使用动作标签。

Genie(Bruce et al, DeepMind 2024,http://arxiv.org/abs/2402.15391)是这一概念的清晰验证:一个逆模型观察连续帧,推断出一个解释帧间变化的小型离散潜在动作,仅凭这个学得的动作空间就足以使生成的视频逐帧可控,尽管模型从未见过任何真实动作标签(这个潜在空间竟然还能够迁移——你可以用它来训练模仿智能体,使用的视频从未针对任何特定机器人进行过标注)。

(在同一研究聚类中:@sherryyangML 等人的论文《视频作为现实世界决策的新语言》,http://arxiv.org/abs/2402.17139,提出了更广泛的论点,认为视频本身就是通用接口,不仅限于潜在动作。)

更难的问题是将潜在动作泛化到狭窄领域之外:Genie 是在平台跳跃游戏视频上训练的,这些视频具有一致的化身和清晰的信号;而 FAIR 的新论文(@garridoq_, Nagarajan, Terver, Ballas, @ylecun, Rabbat,http://arxiv.org/abs/2601.05230)将潜在动作学习推向了实际的互联网视频,这意味着不同片段之间没有共享的化身,而且在潜在动作获得任何有意义的连续性之前,需要过滤掉更多的环境噪声。

为什么机器人领域特别关注这一点:动作标签需要远程操作或动作捕捉,这无法规模化;而世界上发生事物的未标注视频几乎是无限的。因此,如果潜在动作空间能够泛化,你就可以利用所有这些视频进行训练,而不仅仅是那些你付费标注的部分。


Genie:生成式交互环境

来源:https://arxiv.org/html/2402.15391 \pdftrailerid

redacted\correspondingauthorAshley Edwards ([email protected] (https://arxiv.org/html/2402.15391v1/mailto:[email protected]))、Jack Parker-Holder ([email protected] (https://arxiv.org/html/2402.15391v1/mailto:[email protected]))。\bannerfigures/hook.pdf一个全新的世界:Genie 能够将多种不同的提示转化为可交互、可玩的虚拟环境,你可以轻松创建、步入并探索它们。这是通过一个从互联网视频中完全无监督学习得到的潜在动作界面实现的。右侧展示了在两种潜在动作下生成的几个步骤。请在我们的网站 (https://sites.google.com/view/genie-2024/home) 上查看更多示例。

Michael Dennis共同第一作者Google DeepMindAshley Edwards共同第一作者Google DeepMindJack Parker-Holder共同第一作者Google DeepMindYuge (Jimmy) Shi共同第一作者Google DeepMindEdward HughesGoogle DeepMindMatthew LaiGoogle DeepMindAditi MavalankarGoogle DeepMindRichie SteigerwaldGoogle DeepMindChris AppsGoogle DeepMindYusuf AytarGoogle DeepMindSarah BechtleGoogle DeepMindFeryal BehbahaniGoogle DeepMindStephanie ChanGoogle DeepMindNicolas HeessGoogle DeepMindLucy GonzalezGoogle DeepMindSimon OsinderoGoogle DeepMindSherjil OzairGoogle DeepMindScott ReedGoogle DeepMindJingwei ZhangGoogle DeepMindKonrad ZolnaGoogle DeepMindJeff CluneGoogle DeepMind不列颠哥伦比亚大学Nando de FreitasGoogle DeepMindSatinder SinghGoogle DeepMindTim Rocktäschel共同第一作者Google DeepMind

摘要

我们提出了 Genie,这是第一个生成式交互环境,其训练基于来自未标注互联网视频的无监督方式。该模型可以被提示生成无限多种由文本、合成图像、照片甚至草图描述的、动作可控的虚拟世界。Genie 拥有 11B 参数,可被视为一个基础世界模型。它由一个时空视频分词器、一个自回归动力学模型以及一个简单且可扩展的潜在动作模型组成。尽管训练时没有任何真实动作标签或世界模型文献中常见的其他领域特定需求,Genie 仍能使用户在逐帧的基础上对生成的环境进行操控。此外,所学的潜在动作空间便于智能体从未见过的视频中模仿行为,为训练未来的通用智能体开辟了道路。

关键词:

生成式 AI,基础模型,世界模型,视频模型,开放性

1. 引言

过去几年见证了生成式 AI 的兴起,模型能够生成新颖且富有创意的内容。得益于 Transformer 架构 (Vaswani et al.,2017)、硬件进步以及对模型和数据集规模化的近期关注,我们现在能够生成连贯、对话式的语言 (Radford et al.,2018,2019; Brown et al.,2020),以及从文本提示生成的清晰且美观的图像 (Ramesh et al.,2021,2022; Saharia et al.,2022; Rombach et al.,2022)。早期迹象表明,视频生成将是又一个前沿领域,近期结果暗示此类模型也可能受益于规模化 (Hong et al.,2023; Ho et al.,2022a; Esser et al.,2023; Blattmann et al.,2023a)。尽管如此,视频生成模型的交互水平和参与度与 ChatGPT 等语言工具之间仍存在巨大差距,更不用说更沉浸的体验了。

如果我们能够利用来自互联网的大量视频语料,不仅训练出能够生成新颖图像或视频的模型,还能生成完整的交互式体验,那将会怎样?我们提出了生成式交互环境,这是一种生成式 AI 的新范式,其中交互式环境可以从单个文本或图像提示生成。我们的方法 Genie 在超过 20 万小时的公开互联网游戏视频数据集上进行训练,尽管训练过程中没有使用动作或文本标注,但通过学得的潜在动作空间,可以在逐帧的基础上进行控制(见表 1,与其他方法的比较)。Genie 拥有 11B 参数,展现出通常见于基础模型的特性——它可以接受未见图像作为提示,从而创建和玩完全想象的虚拟世界(例如图 1)。

参照图注图 1:多样化的轨迹:Genie 是一个可用作交互环境的生成式模型。该模型可以通过多种方式提示,无论是使用生成的图像(上方)还是手绘草图(下方)。在每个时间步,模型接受用户提供的潜在动作来生成下一帧,从而产生带有有趣且多样化的角色行为的轨迹。Genie 基于最先进的视频生成模型 (Villegas et al.,2023; Gupta et al.,2023) 的思想,其核心设计选择是使用时空 (ST) 变换器 (Xu et al.,2020),该变换器用于我们所有模型组件中。Genie 使用一种新颖的视频分词器,并通过一个因果动作模型提取潜在动作。视频令牌和潜在动作都被传递给一个动力学模型,该模型使用 MaskGIT (Chang et al.,2022) 自回归地预测下一帧。我们对架构的批大小和模型大小(从 40M 到 2.7B 参数)进行了严格的扩展性分析。结果表明,我们的架构随着计算资源的增加而优雅地扩展,从而得到最终的 11B 参数模型。我们在来自数百个 2D 平台跳跃游戏的经过筛选的 3 万小时互联网游戏视频数据集上训练 Genie,为这一场景生成了一个基础世界模型。

为了展示我们方法的通用性,我们还在来自 RT1 数据集 (Brohan et al.,2023) 的无动作机器人视频上单独训练了一个模型,学习了一个具有一致潜在动作的生成式环境。最后,我们展示了从互联网视频中学得的潜在动作可用于从未见过的无动作视频中推断策略(针对模拟强化学习环境),这表明 Genie 或许掌握着解锁无限数据以训练下一代通用智能体的关键 (Open Ended Learning Team et al.,2021; Bauer et al.,2023; Reed et al.,2022; Clune,2019)。

参照图注图 2:Genie 模型训练:Genie 将 TT 帧的视频作为输入,通过视频分词器将其分词为离散令牌 z\bm{z},并通过潜在动作模型推断每帧之间的潜在动作 a~\tilde{\bm{a}}。然后两者都被传递给动力学模型,以迭代方式生成后续帧的预测。表 1:一种新型生成式模型:Genie 是一种新颖的视频和世界模型,可在逐帧基础上进行控制,训练时仅需视频数据。

2. 方法论

Genie 是一个仅从视频数据训练的生成式交互环境。在本节中,我们首先介绍一些预备知识,然后解释模型的主要组成部分。

Genie 架构中的几个组件基于视觉变换器 (ViT) (Vaswani et al.,2017; Dosovitskiy et al.,2021)。值得注意的是,变换器的二次内存成本对视频构成了挑战,视频可能包含多达 O(104)O(10^4) 个令牌。因此,我们在所有模型组件中采用了一种内存高效的 ST 变换器架构(灵感来自 Xu 等人 (2020),见图 3),以平衡模型容量与计算约束。

参照图注图 3:ST 变换器架构。该架构由 LL 个时空块组成,每个块包含一个空间层、一个时间层和一个前馈层。每种颜色代表一个自注意力图,空间层关注单个时间步内的 H×WH×W 个令牌,时间层关注跨 TT 个时间步的相同令牌。与每个令牌都关注所有其他令牌的传统变换器不同,ST 变换器包含 LL 个时空块,其中空间和时间注意力层交错排列,后接一个标准注意力块的前馈层 (FFW)。空间层中的自注意力关注每个时间步内的 1×H×W1×H×W 个令牌,时间层中的自注意力关注跨 TT 个时间步的 T×1×1T×1×1 个令牌。与序列变换器类似,时间层假设具有因果结构的因果掩码。关键在于,我们架构中计算复杂度的主导因素(即空间注意力层)随帧数线性扩展,而非二次扩展,这使得它在扩展交互中具有一致动态的视频生成方面更加高效。此外,请注意在 ST 块中,我们在空间和时间组件之后仅包含一个 FFW,省略了空间后的 FFW,以便扩展模型的其他组件,我们观察到这显著改善了效果。

2.1 模型组件

如图 2 所示,我们的模型包含三个关键组件:1)潜在动作模型,用于推断每对帧之间的潜在动作 a\bm{a};2)视频分词器,用于将原始视频帧转换为离散令牌 z\bm{z};3)动力学模型,给定潜在动作和过去的帧令牌,预测视频的下一帧。该模型按照标准自回归视频生成流程分两个阶段训练:我们首先训练视频分词器,它用于动力学模型;然后我们联合训练潜在动作模型(直接基于像素)和动力学模型(基于视频令牌)。

潜在动作模型 (LAM):为了实现可控视频生成,我们将每一帧的未来预测条件化为在之前帧上采取的动作。然而,互联网视频中很少提供此类动作标签,且动作标注成本高昂。相反,我们以完全无监督的方式学习潜在动作(见图 4)。

参照图注图 4:潜在动作模型:从未标注的视频帧中无监督地学习动作 ata_{t}。首先,一个编码器接收所有之前帧 x1:t=(x1,⋯xt)\bm{x}_{1:t}=(x_{1},\cdots x_{t}) 以及下一帧 xt+1x_{t+1},并输出一组连续的潜在动作 a~1:t=(a~1,⋯a~t)\tilde{\bm{a}}_{1:t}=(\tilde{a}_{1},\cdots\tilde{a}_{t})。然后,一个解码器接收所有之前帧和潜在动作作为输入,并预测下一帧 x^t+1\hat{x}_{t+1}。

为了训练该模型,我们利用基于 VQ-VAE 的目标函数 (van den Oord et al.,2017),这使我们能够将预测的动作数量限制为一小组离散的编码。我们将 VQ 码本的词汇大小 |A||A|(即可能的潜在动作的最大数量)限制为较小的值,以允许人类可玩性并进一步加强可控性(在我们的实验中,我们使用 |A|=8|A|=8)。由于解码器只能访问历史信息和潜在动作 a~t\tilde{a}_{t},因此 a~t\tilde{a}_{t} 应编码过去与未来之间最有意义的变化,以便解码器成功重建未来帧。请注意,此解码器仅用于为 LAM 提供训练信号。实际上,除了 VQ 码本之外,整个 LAM 在推理时被丢弃,并由用户的动作替代。

我们对潜在动作模型采用我们的 ST 变换器架构。时间层中的因果掩码使我们能够将整个视频 x1:T\bm{x}_{1:T} 作为输入,并生成每帧之间的所有潜在动作 a~1:T−1\tilde{\bm{a}}_{1:T-1}。

视频分词器:借鉴先前工作 (Villegas et al.,2023; Gupta et al.,2023; Yan et al.,2023),我们将视频压缩为离散令牌,以降低维度并实现更高质量的视频生成(见图 5)。我们再次使用 VQ-VAE,它接受 TT 帧视频 x1:T=(x1,x2,⋯,xT)∈RT×H×W×C\bm{x}_{1:T}=(x_{1},x_{2},\cdots,x_{T})\in\mathbb{R}^{T\times H\times W\times C} 作为输入,为每一帧生成离散表示 z1:T=(z1,z2,⋯,zT)∈IT×D\bm{z}_{1:T}=(z_{1},z_{2},\cdots,z_{T})\in\mathbb{I}^{T\times D},其中 DD 是离散潜空间的大小。分词器通过以下方法训练:

相似文章