介绍S1:一个从单一示例中学习的机器人模型
摘要
S1是一个通用的机器人基础模型,通过上下文学习从单个视频演示中学习复杂、长时间的任务,无需大量数据收集,即可实现灵活、稳健的性能。
暂无内容
查看缓存全文
缓存时间: 2026/08/30 08:00
**概要:** S1是一个通用的机器人基础模型,它通过上下文学习,仅从单次视频演示中学习复杂的长时间任务,无需大量数据收集即可实现灵活稳健的性能。
## 传统机器人训练的挑战
教授机器人新任务的传统方法需要海量数据和重新训练。文稿强调,对于当前的视觉-语言-动作(VLA)模型,要达到S1仅用单个提示示例所展示的精度,通常需要 **50到100小时的数据采集**。这限制了强大的机器人技术只能被拥有大量资源、愿意为整合而彻底改造整个系统的大组织所部署。
## S1介绍:从单个视频中学习
S1被定位为一个“通用机器人基础模型”。其核心创新在于能够**仅通过观看一个视频演示**来学习多种新任务。该模型能够理解并执行长时间持续的任务,具体**时长超过10分钟**。这是通过将演示视频作为上下文窗口中的提示来处理而实现的。
## 上下文学习的威力
驱动S1的能力是**上下文学习**,演讲者直接将其与GPT-1、GPT-2和ChatGPT等大型语言模型的突破联系起来。这个过程被简单地解释为:“你将演示放入上下文窗口,就像一个带有示例的提示,它将输出机器人动作来完成任务。”这使得机器人能够在部署时从视频提示中学习,而无需为每个新技能在大型数据集上进行离线训练。
## 演示的能力与泛化性
S1可以通过单个视频被教授各种现实世界的任务。文稿提供了几个具体例子:
* **制作煎饼。** 当机器人第一次翻转煎饼时,团队感到惊讶,因为他们花了两天时间验证在他们的预训练数据集(约**一百万小时**)中不存在任何翻煎饼的数据。机器人仅通过观察演示视频中锅铲的动作就学会了这项技能。
* **制作咖啡。** 它完全复制了视频中展示的方法。
* **给植物换盆。** 它遵循提示中提供的步骤。
* **组装卫生用品包。** 这被强调为一个复杂任务,其中具体的物品及其排列方式不太可能出现在训练分布中。尽管在部署前一刻才看到演示,S1仍成功记住了每个组件和所有组装步骤。
这些例子凸显了S1所弥合的关键区别:在其预训练数据中的**已知任务**与**全新任务**之间的区别。虽然它在已知任务上的表现与语言提示的VLA模型相当,但在面对新的、未见过的任务时,其优势呈指数级增长。
## 涌现的鲁棒性与适应性
S1的大型有效上下文窗口带来了几种鲁棒行为:
1. **对新配置的泛化:** 如果物体或场景布局被移动或重新排列,机器人可以基于演示适应新的设置。
2. **错误纠正:** 即使在执行过程中犯了错误,机器人也可以即兴发挥并进行调整,而这种纠正在人类演示视频中并未明确显示。
3. **意图推断与常识:** 如果视频中的人类操作不佳或出错,S1可以猜测用户的最终意图并运用常识来实现正确的目标。
这种适应性意味着,单次录制的演示可以可靠地部署在多个略有不同的环境中,因为模型的精度会随着变化而平缓地衰减。
## 对机器人技术民主化的影响
从单个示例中有效学习的能力极大地降低了准入门槛。S1消除了之前为新任务所需的“数月的数据收集和后期训练”。所描绘的愿景是,机器人技术将不再局限于大公司。演讲者总结道,想象这样一个未来:“每个小企业、每家杂货店、每家医院、每个组织,都能获得同样强大的机器人能力。”
这些成果被定位为迈向“具身通用智能”——一种扎根于并与物理世界交互的人工智能——这条新道路的初步迹象。
## 来源
视频:介绍S1:一个从单个示例中学习的机器人模型(YouTube)
相似文章
全新 Figure/PI/Tesla/Sunday 竞争者刚刚亮相
S1 是一款全新的基础模型,能够从单一示例中学习,并从视频提示中执行10分钟的任务而无需微调,已在实时操作中展示。
单次模仿学习
OpenAI 提出了一个元学习框架,用于单次模仿学习,使机器人能够从单个演示中学习新任务,并泛化到新实例而无需任务特定的工程设计。该方法使用软注意力机制,使在多样化任务对上训练的神经网络能够在测试时对看不见的任务表现良好。
@felixwyw: 在8月3日晚上10:06,我目睹了一台机器人完成了一件我认为还需要多年才能实现的事情。我们当时正在进行少量梯度学习……
作者描述了一个突破,其中使用GEN-1.5模型的机器人在单次演示后无需微调即可模仿任务,标志着在物理提示的少样本学习方面取得了重大进展。
@SigGravitas:这对于机器人学乃至整个人类来说都是一个巨大的时刻,然而却无人关注。这个视频竟然……
一个新的机器人基础模型名为Gen1-5,能够通过单次示范进行即时学习和泛化,展示了机器人学中涌现的物理问题解决能力。
学习的机器人
# 学习的机器人 来源:[https://openai.com/index/robots-that-learn/](https://openai.com/index/robots-that-learn/) 该系统由两个神经网络驱动:视觉网络和模仿网络。视觉网络接收来自机器人摄像头的图像,并输出表示物体位置的状态。如[前所述\(在新窗口中打开\)](https://blog.openai.com/spam-detection-in-the-physical-world/),视觉网络使用数十万个模拟