机器人演示很简单。可靠性才是难题 — Jason Ma,Dyna Robotics [26:41]
摘要
Dyna Robotics 通过结合大规模数据金字塔、专用奖励模型和迭代部署,致力于解决机器人领域的可靠性差距问题,以实现接近完美的任务表现,迈向商业级自主能力。
暂无内容
查看缓存全文
缓存时间: 2026/09/27 17:54
**简而言之:** Dyna Robotics通过构建大规模数据金字塔、专用主动学习奖励模型以及迭代部署,解决了机器人的"可靠性差距"问题,实现了接近完美(99.4%)的任务完成率,将技术从令人惊艳的演示推进到商业级的自主应用。
## 使命:为机器人构建强健的基础模型
Dyna Robotics成立于2024年9月,其使命是为现实世界中的自主机器人构建高度强健的基础模型。这家公司在A轮融资中筹集了约1.2亿美元,旨在创建一个能执行多种具有经济价值的物理任务的统一平台。其核心论点是:要实现真正的商业可行性,必须将尖端研究与大规模部署相结合。
## 研究与部署飞轮
为了突破机器人部署的挑战,Dyna运营着一个"研究与部署飞轮"。其具体流程包括:
1. **内部研发与硬件创新:** 指导公司锁定哪些商业任务和工作流程作为目标。
2. **积极部署:** 公司拥有超过五个活跃站点,在此过程中收集高质量的部署数据。
3. **产品与数据反馈:** 部署过程揭示了模型和硬件的不足,从而将研究聚焦于最关键的、来自真实世界的问题——这些正是区分YouTube演示视频与有影响力应用的关键。
## 训练通用型机器人模型
### 数据金字塔
由于机器人数据稀缺,Dyna采用分层数据金字塔来训练其模型:
* **非机器人数据:** 包括来自穿戴式摄像头的人类数据、公共数据集以及仿真数据。
* **机器人数据:** 跨多种任务和环境(工业、家庭、洗衣、酒店)收集。
* **部署数据:** 来自真实世界使用的高质量数据,用于弥合仿真到现实的差距。其训练流水线已积累超过**20万小时**的数据。
### 模型架构与能力
模型架构包含一个高层推理模型和一个底层“世界动作模型”,用于细粒度的灵巧控制。这种设计对于需要语义理解和精确交互以从错误中恢复的物理任务至关重要。凭借强大的预训练,该模型可以用**不到一小时**的特定任务数据进行微调。然而,这些通用模型在实践中通常只能达到**80-90%**的可靠性,因此不适合连续的现实世界操作。
## 核心问题:实现100%的鲁棒性
Dyna面临的核心挑战是将一个通用预训练和微调后的模型,转变为能够针对特定、有价值的任务实现**接近100%鲁棒性**的模型。他们选择了**餐厅餐巾折叠**这项任务——这是一个重复、单调但具有明确商业需求且成功标准清晰的任务(例如,“五层折叠”与松垮的“三层折叠”)。
### Dyna-1模型:可靠性案例研究
最终成果是**Dyna-1模型**,这是其基础模型专门为折叠餐巾而微调的版本。在一次24小时的耐力测试中,它达到了**99.4%的成功率**。这次测试并非一次性的;它被成功地重复了四次。视频延时摄影显示,即使环境光照从夜晚变化到白天,模型也能稳健运行。
**任务复杂性:** 机器人必须使用平行夹爪从一叠餐巾中精准夹起一张,将其折叠,并放入一个容器中。失败通常源于夹爪的精度问题,这要求模型能够从诸如夹起多张餐巾等错误中恢复。
## 如何实现近乎完美的可靠性
### 克服标准微调的局限性
最初,使用标准的“预训练+微调”方法只能达到**80%的成功率**。一旦模型出错,它就会偏离其训练分布,并无法自我恢复。
### 解决方案:用于可扩展监督的奖励模型
为了解决这个问题,Dyna开发了一个专用的**奖励模型**,可以通过分析机器人视频来评估任务进展。该模型输出一个从0(任务开始)到1(完成)的分数。关键是,当机器人犯错时,分数会**下降**,从而为错误检测提供信号。
### 主动学习循环
这个奖励模型实现了“可扩展监督”和一个强大的主动学习循环:
1. **自主执行:** 机器人尝试折叠餐巾,同时奖励模型在后台运行。
2. **自动错误检测:** 当奖励模型的分数表明出现错误时,该案例会被标记出来。
3. **针对性数据收集与训练:** 研究人员或操作员收集关于该错误的特定数据,并针对该失败模式训练模型。
4. **迭代改进:** 模型使用这些新数据进行再微调,从而增强其从错误中恢复的能力。
经过数次这样的循环迭代后,模型变得异常强健,能够从各种意外的错误中恢复,例如意外抓起多张餐巾甚至碰倒整叠餐巾。正是这种持续的错误纠正能力,使得Dyna-1在24小时内实现了**99.4%**的可靠性,为商业级性能展示了一条清晰的道路。
**来源:** 机器人演示很容易,可靠性才是难题——Jason Ma,Dyna Robotics (https://www.youtube.com/watch?v=Sjfz1TqxzEs)
相似文章
@heyshrutimishra:这就是机器人技术以惊人速度扩展的方式。超过一百万小时的人们日常任务数据。完全没有机器人数据。……
Dyna Robotics 推出了 Dyna-2,一个在超过一百万小时人类视频上预训练的世界动作模型,发现了机器人操作的新扩展定律。
@FinanceYF5:最让我惊讶的是:Dyna-2从未在单条机器人轨迹上训练过,但它看到的人类视频越多,在机器人任务上的表现就越好……
Dyna Robotics 推出了 Dyna-2,这是一个在一百万小时人类视频上预训练的世界-动作模型,揭示了缩放定律,并表明具身差距更像是一个适应问题,而非知识问题。
@ycombinator:机器人已经可以折叠衣物、制作意式浓缩咖啡、清洁厨房并组装物品。更困难的问题是让它们……
在2026年的Startup School上,Chelsea Finn讨论了强化学习如何推动机器人技术向通用系统发展,强调可靠性和长期自主性。
最令人印象深刻的AI智能体演示仍然是最简单的
文章指出,最有效的AI智能体演示简单可靠,专注于明确任务和结构化输出,而非完全自主,这标志着行业正健康地向可靠性转变。
机器人技术困难的原因
文章概述了机器人开发中的15项技术挑战,对比了软件中人工智能的快速发展与创建广泛能力机器人时遇到的物理困难。