通过视频预训练学习玩 Minecraft
摘要
OpenAI 推出了视频预训练(VPT),这是一种半监督方法,通过学习 70,000 小时的未标注人类游戏视频和少量标注数据集来训练神经网络玩 Minecraft。该模型使用原生人类界面(键盘和鼠标)学习复杂的序列任务,展示了制作钻石工具和柱子跳跃等能力,代表了朝向通用计算机使用代理的进步。
我们通过在大规模未标注的 Minecraft 人类游戏视频数据集上进行视频预训练(VPT),同时仅使用少量标注的承包商数据,来训练神经网络玩 Minecraft。经过微调,我们的模型可以学会制作钻石工具,这项任务通常需要熟练的人类花费 20 多分钟(24,000 次操作)。我们的模型使用原生人类界面的按键和鼠标移动,具有很强的通用性,代表了朝向通用计算机使用代理迈出的一步。
查看缓存全文
缓存时间: 2026/04/20 14:46
# 通过视频预训练学习玩 Minecraft
来源:https://openai.com/index/vpt/
我们通过视频预训练(VPT)在大规模无标注的人类 Minecraft 游戏视频数据集上训练了一个神经网络,同时仅使用了少量标注的承包商数据。经过微调,我们的模型可以学会制作钻石工具,这项任务通常需要熟练的人类花费超过 20 分钟(24,000 次操作)。我们的模型使用原生人类界面的按键和鼠标移动,具有很强的通用性,代表了向通用计算机使用代理的一步发展。
互联网上包含大量可公开获取的视频,我们可以从中学习。你可以看到有人做出精美的演示、数字艺术家绘制美丽的日落,以及 Minecraft 玩家建造复杂的房屋。然而,这些视频只提供了*发生了什么*的记录,而不是精确的*如何实现*的记录,即你无法知道确切的鼠标移动和按键序列。如果我们想在这些领域中构建大规模[基础模型](https://arxiv.org/abs/2108.07258),就像我们在语言领域用 [GPT](https://proceedings.neurips.cc/paper/2020/hash/1457c0d6bfcb4967418bfb8ac142f64a-Abstract.html) 所做的那样,这种缺乏动作标注的问题就会成为一个新挑战,在语言领域中不存在这样的问题,因为"动作标注"就是句子中的下一个单词。
为了充分利用互联网上大量无标注的视频数据,我们引入了一种新颖而简洁的半监督模仿学习方法:视频预训练(VPT)。我们首先从承包商处收集一个小数据集,不仅记录他们的视频,还记录他们采取的动作,在我们的案例中是按键和鼠标移动。使用这些数据,我们训练一个逆动力学模型(IDM),它可以预测视频中每一步正在采取的动作。重要的是,IDM 可以使用过去*和未来*的信息来推测每一步的动作。这项任务要简单得多,因此所需的数据远少于行为克隆任务(仅根据*过去的视频帧*预测动作),后者需要推断这个人想要做什么以及如何完成。然后我们可以使用训练好的 IDM 来标注更大规模的在线视频数据集,并通过行为克隆学会执行动作。
我们选择在 Minecraft 中验证我们的方法,因为:(1)它是世界上最活跃的电子游戏之一,因此有大量免费可用的视频数据;(2)它是开放式的,有各种各样的事情可以做,类似于计算机使用等真实应用。与 Minecraft 的[先前工作](https://arxiv.org/abs/2106.14876)[不同](https://arxiv.org/abs/2009.14108),这些工作使用简化的动作空间来简化探索,我们的 AI 使用了更通用但也更困难的原生人类界面:20Hz 帧率的鼠标和键盘。
在 70,000 小时的 IDM 标注在线视频上训练,我们的行为克隆模型("VPT 基础模型")完成了用强化学习从头开始几乎不可能实现的 Minecraft 任务。它学会了砍树收集木材、将木材制作成木板,然后将木板制作成工作台;这个序列对于 Minecraft 熟练者来说大约需要 50 秒或 1,000 个连续的游戏动作。
此外,该模型还执行了其他复杂技能,如游泳、狩猎动物获取食物和进食等。它还学会了"柱跳"的技能,这是 Minecraft 中的一种常见行为,通过反复跳跃并在下方放置方块来提升自己。
基础模型的设计目的是具有广泛的行为特征,并在各种任务上具有通用能力。为了纳入新知识或让它们在更狭窄的任务分布上专门化,常见的做法是将这些模型微调到更小、更具体的数据集。作为 VPT 基础模型如何有效地微调到下游数据集的案例研究,我们要求我们的承包商在全新的 Minecraft 世界中玩 10 分钟,并用基本 Minecraft 材料建造一个房屋。我们希望这会增强基础模型可靠执行"早期游戏"技能(如构建工作台)的能力。在微调到该数据集时,我们不仅看到了基础模型中已经存在的早期游戏技能的大幅改进,而且微调后的模型还学会了更深入地进入技术树,制作木制和石制工具。有时我们甚至看到了一些初级庇护所建筑和代理搜索村庄(包括掠夺箱子)。
也许我们工作中最重要的假设是,使用标注的承包商数据来训练 IDM(作为 VPT 管道的一部分)远比直接从相同的小承包商数据集训练 BC 基础模型更有效。为了验证这一假设,我们在 1 到 70,000 小时的递增数据量上训练基础模型。在 2,000 小时以下数据上训练的模型在最初收集的具有真实标注的承包商数据上进行训练,而在 2,000 小时以上的模型在我们的 IDM 标注的互联网数据上进行训练。然后我们取每个基础模型并将其微调到前一部分描述的建房数据集。
随着基础模型数据的增加,我们通常看到制作能力的提高,只有在最大数据规模时,我们才看到石制工具制作的出现。
当可以指定奖励函数时,强化学习(RL)可以是一种强大的方法来获得高性能,甚至可能是超人类的性能。然而,许多任务需要克服艰难的探索挑战,大多数 RL 方法用*随机*探索先验来处理这些问题,例如模型经常被激励通过熵奖励随机行动。VPT 模型应该是 RL 的一个更好的先验,因为模仿人类行为可能比采取随机行动更有帮助。我们给我们的模型设置了收集钻石镐的具有挑战性的任务,这是 Minecraft 中前所未有的能力,当使用原生人类界面时更加困难。
制作钻石镐需要一系列长而复杂的子任务。为了使这项任务易于处理,我们为序列中的每个项目奖励代理。
我们发现从随机初始化训练的 RL 策略(标准 RL 方法)几乎无法获得任何奖励,从不学会收集木材,仅偶尔收集木棍。与此相反,从 VPT 模型微调不仅学会了制作钻石镐(它在 10 分钟的 Minecraft 游戏中以 2.5% 的成功率做到这一点),而且甚至在收集所有导致钻石镐的物品方面达到了人类水平的成功率。这是首次有人展示了一个能在 Minecraft 中制作钻石工具的计算机代理,这对人类来说平均需要超过 20 分钟(24,000 次动作)。
VPT 为代理通过观看互联网上的大量视频来*学会行动*铺平了道路。与只会产生*表示*先验的生成视频建模或对比方法相比,VPT 提供了在不仅仅是语言的更多领域中直接学习大规模*行为先验*的令人兴奋的可能性。虽然我们仅在 Minecraft 中进行了实验,但该游戏非常开放式,原生人类界面(鼠标和键盘)非常通用,所以我们相信我们的结果对其他类似领域,如计算机使用,是一个好兆头。
有关更多信息,请参阅[我们的论文](https://arxiv.org/abs/2206.11795)。我们还开源了我们的承包商数据、Minecraft 环境、模型代码和模型权重,我们希望这将有助于 VPT 的未来研究。此外,我们与今年的 MineRL NeurIPS 竞赛合作。参赛者可以使用和微调我们的模型来尝试解决 Minecraft 中的许多困难任务。有兴趣的人可以查看[竞赛网页](https://www.aicrowd.com/challenges/neurips-2022-minerl-basalt-competition)并竞争赢取 100,000 美元的蓝天奖以及 20,000 美元的常规奖池。为自我认证的代表性不足的群体和个人提供了赠款。
相似文章
一个通用的目标条件Minecraft模型
Pantograph推出了Pan,一个拥有40亿参数的目标条件模型,该模型在互联网视频上进行训练,能够在Minecraft中执行各种任务,例如与怪物战斗、建造结构和探索。该方法利用事后重新标记在预训练期间学习目标导向行为。
Procgen 和 MineRL 竞赛
OpenAI 联合组织 MineRL 2020 竞赛,推进样本高效的强化学习算法研究,这些算法能够利用人类示范。参赛者需要在仅有 800 万个模拟器样本和 4 天单 GPU 训练时间的限制下,在 Minecraft 中获得钻石,同时可以访问 6000 多万帧的人类示范数据集。
从单个演示中学习蒙特祖玛的复仇
OpenAI 展示了一种通过单个人类演示来训练强化学习智能体玩蒙特祖玛的复仇的方法,通过课程学习和仔细的超参数调优来解决稀疏奖励的挑战。该方法在这款臭名昭著的 Atari 游戏上取得了强劲表现,但在其他游戏上的泛化能力有限。
ForgeWM:一种用于少步数动作条件视频世界模型的渐进式因果训练方法
ForgeWM 是一个渐进式框架,它将双向视频生成器蒸馏为高效的少步数交互式世界模型,支持低延迟交互和重放时优化,在 Minecraft 和 FPS 游戏中展示了改进。
AI的下一个进化:从你的蹩脚游戏技能中学习
一家英国初创公司 Worldmodeldata 正在使用视频游戏数据来训练 AI 世界模型,旨在克服数据短缺问题,以便教 AI 理解并与物理世界互动。