AI代理创建虚拟游乐场,帮助机器人获取关键训练数据
摘要
MIT CSAIL与丰田研究所推出SceneSmith,该系统利用GPT-5.2驱动的AI代理自动生成丰富的3D虚拟场景,为机器人训练提供多样化的模拟环境,无需大量真实世界测试。
<p dir="ltr" id="docs-internal-guid-05b868f3-7fff-b07e-2fb7-b4c0c1cdb0f4">机器人走在街上,周围是惊讶的围观者,这正变得越来越常见。但这些机器还不是你希望在厨房或工厂中工作的全能助手,一个主要瓶颈是数据。与人类相似,机器人通过经验学习效果最佳。挑战在于,物理上教导这些机器在不同环境中完成如此多的动作既费时又费力。 <br><br>“一个自然的想法是利用模拟作为训练场。虽然过去几年中,驱动机器人模拟器的物理引擎取得了显著进展,但剩余的挑战之一是创建足够丰富和多样的模拟内容,以捕捉真实世界的复杂性,”麻省理工学院电气工程与计算机科学(EECS)、航空航天学以及机械工程学的丰田教授,同时也是麻省理工学院计算机科学与人工智能实验室(CSAIL)的首席研究员Russ Tedrake说。</p><p dir="ltr">事实证明,AI代理,即那些能够‘思考’并完成明确任务的半自主程序,可以帮助生成机器人所需的逼真虚拟环境。由麻省理工学院CSAIL和丰田研究所的研究人员开发的新“<a href="https://scenesmith.github.io/" target="_blank">SceneSmith</a>”系统使用三个代理来构建物体的组合、墙壁以及3D场景的整体外观。它对室内空间(如餐厅、卧室和酒店)的再现比之前的系统更逼真且更详细,帮助机器人在启动前练习技能并尝试不同的任务执行方式。反过来,工程师节省了真实世界测试的时间。<br><br>这些代理对日常场所应有的样子有感知,因为它们各自调用一个称为视觉语言模型(VLM)的多模态系统,特别是最先进的VLM <a href="https://openai.com/index/introducing-gpt-5-2/" target="_blank">GPT-5.2.</a>它经过互联网上大量文本和图像训练,以处理更多视觉提示。这个高级模型赋予每个代理一定的空间知识:首先,一个“设计师”代理生成场景元素,然后一个“评论家”代理评估其是否逼真,最后,一个“编排者”代理管理它们的来回互动,决定设计何时完成。一旦三个VLM完成创意协作,场景就可以直接加载到物理模拟软件中。</p><p dir="ltr">“我们发现这个系统可以像人类设计师一样构建3D场景,”麻省理工学院EECS博士生、CSAIL研究员Nicholas Pfaff说,他是与Tedrake共同发表这篇工作的论文的第一作者。“我们使用一个具有互联网规模先验知识的前沿VLM制作了超过1300个场景,它做出了极其创意且多样的布局。我并没有在提示中教系统这么做;它只是即兴发挥。”</p><p dir="ltr"><strong>与我的代理对话</strong></p><p dir="ltr">得益于VLM代理,你可以要求SceneSmith执行诸如“生成一个车库,里面有汽车、工作台、角落堆放的轮胎,以及靠墙的梯子”等任务,并得到一个充满机器人可以摆弄的物体的虚拟游乐场。这些房间每场景的物品数量比先前方法多达六倍,非常适合帮助机器人学习技能,例如将杯子放入水槽、将水果放在盘子上、将汽水罐从架子移到桌子上。</p><p dir="ltr">有了这么多丰富的虚拟环境,你可以评估机器人是否准备好部署,而无需在物理世界中进行大量试错。研究人员在SceneSmith的数字世界中测试了不同的行动方案(也称为“策略”),在此过程中生成了100个独特空间。一个VLM代理评估了每次尝试,发现机器人的计划有缺陷,机器经常在任务中失败。人类在超过99%的情况下同意模型的判断,这可以帮助机器人专家在机器人进入真实世界之前,在模拟中剔除有缺陷的方法。</p><p dir="ltr">但这些虚拟世界到底有多逼真?这很难直接证明,因此研究人员从多个角度探讨了这个问题。最有力的测试是:他们将一个预训练的机器人策略——一个主要基于真实世界数据训练的AI控制器,从未见过任何SceneSmith场景——放入生成的环境中。在一次测试中,用户告诉系统“从碗里取出苹果并放在切菜板上”,模拟机器人准确地执行了。如果场景与策略学习过的真实环境不相似,它根本就不会成功。 </p><p dir="ltr">该团队还通过远程操作让机器人穿越虚拟空间,引导它们打开橱柜、放好瓶子以及在房间之间导航。他们的实验表明,这些环境能够承受持续的物理交互,超越了视觉检查。<br><br><strong>幕后</strong><br><br>SceneSmith使用的每个代理在生成过程中都有明确定义的角色,分阶段充实场景。它们基本上创建了一个平面图并将其变为现实。 <br><br>假设你想创建一个类似于房子首层的场景。“设计师”VLM从一个通用布局开始,“评论家”进行审查,然后“编排者”批准。代理们对每一步重复这种方法:添加家具,将物体放置在墙壁上然后天花板上,最后放入机器人可以操作的物体。例如,VLM可以添加机器人可以打开和关闭的橱柜——这是一个铰接式物品,之前的基线方法通常没有。<br><br>在每个阶段,第二个VLM确保场景实用,例如建议将浴缸从客厅移除。第三个VLM确保生成高质量场景,如果视觉效果不达标,甚至会倒退几步重新设计。一旦三个VLM完成创意协作,物理世界的力学特性便通过模拟软件添加。</p><p dir="ltr">凭借对房间应如何呈现、物体应放置何处以及真实世界物理的深入理解,SceneSmith相比先前方法具有显著优势。与诸如“<a href="https://arxiv.org/abs/2503.16848" target="_blank">HSM</a>”和“<a href="https://arxiv.org/abs/2312.09067" target="_blank">Holodeck</a>”等场景生成基线相比,SceneSmith创建了包含更多物体的环境,包括私人办公室、陶器店,甚至一个Minecraft主题的游戏室。</p><p dir="ltr">SceneSmith也是超过200名用户的偏爱之选。用户发现其视觉效果在超过90%的情况下更逼真。他们还观察到,通常来说,它比其它方法更严格地遵循提示。换句话说,它在生成用户实际想看到的虚拟游乐场方面表现最佳。<br><br><strong>多才多艺的系统</strong><br><br>逼真度、多样性和丰富性都是SceneSmith的强项,即使是在生成单个3D物体时也是如此。你可以提示它创建一个滚动推车,它会生成一个2D图像,然后将其转化为具有质量、摩擦力和惯性等物理属性的详细模型。<br><br>然而,如此详细的过程确实伴随着速度的权衡。生成一个场景可能需要数小时,因为代理们正在创建并仔细审视每个物体。有了更多的计算能力,该系统的效率可以大幅提升。CSAIL的工程师们还希望,如果有广泛的3D库可用,系统能扩展到可变形物体(如海绵)。</p><p dir="ltr">“SceneSmith r
查看缓存全文
缓存时间: 2026/07/13 22:50
# AI代理创建虚拟训练场,帮助机器人获取关键训练数据
来源:https://news.mit.edu/2026/ai-agents-create-virtual-playgrounds-to-help-robots-get-crucial-training-data-0713
机器人走在街上,周围满是惊讶的围观者,这正变得越来越常见。但这些机器还不是你希望在厨房或工厂里工作的全能助手,一个主要瓶颈在于数据。和人类一样,机器人通过经验学习效果最好。挑战在于,要亲自教会这些机器在不同环境中完成如此多的动作,既费力又耗时。
"一个自然的想法是利用模拟作为训练场。尽管在过去几年中,为机器人模拟器提供动力的物理引擎取得了显著进展,但剩下的挑战之一是创建足够丰富和多样化的模拟内容,以捕捉现实世界的复杂性,"MIT电气工程与计算机科学系(EECS)、航空航天学及机械工程系的丰田教授、MIT计算机科学与人工智能实验室(CSAIL)首席研究员Russ Tedrake说。
事实证明,AI代理——即能够"思考"并完成明确定义任务的半自主程序——可以帮助生成机器人所需的逼真虚拟环境。MIT CSAIL和丰田研究所的研究人员开发的新系统"SceneSmith"使用三个代理来拼凑3D场景中的物体、墙壁和整体外观。它对餐厅、卧室和酒店等室内空间的再现比之前的系统更逼真、更详细,帮助机器人在实际通电前练习技能并尝试不同的任务执行方式。反过来,工程师在真实世界测试上节省了时间。
这些代理知道日常场所应该是什么样子,因为它们各自调用一个称为视觉语言模型(VLM)的多模态系统,具体来说是先进的VLMGPT-5.2。它经过大量来自互联网的文本和图像训练,以处理更多的视觉提示。这个高级模型给每个代理赋予了一种空间知识:首先,一个"设计师"代理生成场景的元素,然后一个"评论家"代理判断其是否逼真,最后,一个"编排者"代理管理它们之间的反复沟通,决定设计何时完成。一旦三个VLM完成它们的创意协作,场景就可以直接加载到物理模拟软件中。
"我们发现系统可以像人类设计师一样构建3D场景,"MIT EECS博士生、CSAIL研究员、与Tedrake共同撰写介绍该工作的论文的主要作者Nicholas Pfaff说。"我们使用一个具有互联网规模先验知识的领先VLM制作了超过1300个场景,它做出了极其创意和多样化的布置。我并没有在提示中教导系统这样做;它只是即兴发挥。"
**与我的代理对话**
得益于VLM代理,你可以要求SceneSmith做类似"生成一个车库,里面有一辆车、一个工作台、堆在角落的轮胎,以及靠墙的梯子"的事情,然后得到一个充满机器人可以摆弄的物体的虚拟训练场。这些房间每场景的物品数量是先前方法的六倍之多,非常适合帮助机器人学习技能,例如将杯子放入水槽、将水果放在盘子上,以及将易拉罐从架子移到桌子上。
拥有如此丰富的虚拟环境,你就可以在没有那么多真实世界试错的情况下评估你的机器人是否准备就绪。研究人员在SceneSmith的数字世界中测试了不同的行动方案(也称为"策略"),过程中生成了100个独特的空间。一个VLM代理评估了每次尝试,发现机器人的计划存在缺陷,机器经常在任务中失败。人类与模型的判断一致率超过99%,这可以帮助机器人专家在机器人进入真实世界之前,在模拟中剔除有缺陷的方法。
但这些虚拟世界到底有多逼真?直接证明可能很困难,因此研究人员从多个角度探讨了这个问题。最有说服力的测试是:他们将一个预训练的机器人策略——一个主要基于真实世界数据训练、从未见过SceneSmith场景的AI控制器——放入生成的环境中。在一次测试中,用户告诉系统"从碗里取出苹果放到切菜板上",模拟机器人就这样做了。如果场景与策略学习过的真实环境不相似,它根本不会工作。
研究团队还通过远程操作让机器人穿过虚拟空间,引导它们打开柜子、放好瓶子以及在房间之间穿行。他们的实验表明,这些环境在持续的物理交互下仍然可靠,超越了视觉检查的范畴。
**幕后机制**
SceneSmith使用的每个代理在生成过程中都有明确定义的角色,分阶段构建场景。它们基本上创建了平面图并将其变为现实。
假设你想创建一个类似于房子首层的场景。"设计师"VLM会从一个通用布局开始,"评论家"进行审查,然后"编排者"签字确认。代理们在每个步骤都重复这种方法:添加家具、在墙壁上放置物品,然后在天花板上放置物品,最后放入机器人可以操作的物体。例如,VLM可以添加机器人可以打开和关闭的柜子——一种铰接式物品,先前的基线方法通常没有这种功能。
在每个阶段,第二个VLM确保场景是实用的,例如建议将浴缸从客厅中移除。第三个VLM确保生成高质量的场景,如果视觉效果不达标,甚至会将设计过程回退几步。一旦三个VLM完成创意协作,物理世界的力学特性通过模拟软件添加进来。
凭借对房间外观、物体放置位置以及真实世界物理的深刻理解,SceneSmith相比先前方法具有明显优势。与"HSM"和"Holodeck"等场景生成基线方法相比,SceneSmith制作了包含更多物体的环境,包括私人办公室、陶器店,甚至一个Minecraft主题的游戏室。
SceneSmith也是超过200名用户的最爱。他们在超过90%的情况下认为系统的视觉效果更逼真。他们还观察到,总体而言,它比其他方法更严格地遵循提示。换句话说,它最擅长生成用户真正想要看到的虚拟训练场。
**多才多艺的系统**
逼真性、多样性和丰富性都是SceneSmith的强项,即使在生成单个3D物体时也是如此。你可以提示它创建一个滚动服务车,它会生成一个2D图像,然后将其转化为具有质量、摩擦力、惯性等物理属性的详细模型。
然而,如此详细的过程确实以速度为代价。生成一个场景可能需要几个小时,因为代理正在创建并仔细审查每个物体。随着计算能力的提高,系统的效率有望大幅提升。CSAIL的工程师们还希望,如果有广泛的3D库可用,系统能够扩展到可变形物体(如海绵)。
"SceneSmith通过提供一个基于代理的框架,仅从简单的文本提示即可生成可用于模拟的室内环境,在这方面代表了重要进步,"亚马逊机器人公司的应用科学家Jeremy Binagia说,他没有参与这项研究。"它在多个方面推动了最先进技术的发展,包括突破模拟环境中物体密度的极限,确保所有物体在物理上准确(而不仅仅是视觉逼真),以及创建不局限于固定库的资源,因为它们可以通过文本到3D生成。"
Pfaff和Tedrake与MIT博士生、CSAIL研究员Thomas Cohn SM '24,以及丰田研究所的机器人专家Sergey Zakharov和Rick Cory SM '08、PhD '10共同撰写了这篇论文。他们的工作部分得到了亚马逊、美国海军研究办公室、丰田研究所和美国国家科学基金会的支持。
该团队在上周的国际机器学习大会上作为焦点报告展示了他们的研究成果。
相似文章
SimFoundry:模块化与自动化场景生成用于策略学习与评估
SimFoundry 是一个模块化系统,可从视频自动化真实到仿真场景构建,生成数字孪生体并保留功能属性的变体,用于零样本机器人策略训练,实现了向真实世界任务的强迁移和高仿真到真实性能预测。
使用可视化编程环境构建AI代理
可视化编程环境允许用户通过更好的可组合性和可观察性来组合AI代理,包括一个部件套件和一个嵌入式代理,以便更轻松地调试和自我改进。
凭借对物理的感知,AI模型能模拟更广泛的现实世界场景
MIT CSAIL和清华大学的研究人员提出了GeoPT,这是一种预训练方法,利用合成动力学帮助AI模型更高效地学习物理,以模拟车辆安全和机器人测试等现实世界场景。其达到峰值性能的速度提升两倍,训练所需数据最多减少60%。
SimWorlds:用于动态3D场景创作的多智能体系统
SimWorlds是一个多智能体框架,能够通过自然语言生成动态、可编辑的4D场景。它利用Blender特定的程序化知识以及规划-编码-审查工作流,性能优于先前基线。
AI代理独立发展足球位置
研究人员测试了AI代理是否会在足球模拟中使用强化学习自主发展角色专业化,从而在没有明确指令的情况下形成攻击手和守门员等不同位置。