凭借对物理的感知,AI模型能模拟更广泛的现实世界场景
摘要
MIT CSAIL和清华大学的研究人员提出了GeoPT,这是一种预训练方法,利用合成动力学帮助AI模型更高效地学习物理,以模拟车辆安全和机器人测试等现实世界场景。其达到峰值性能的速度提升两倍,训练所需数据最多减少60%。
<p>人工智能模型多才多艺,包括写作、生成图像和创建3D模型。但在不同环境中测试机器人或车辆设计时,它们就没那么有用了,因为模型对物理的理解不如对像素或文本的理解。</p><p>要构建一个能够可靠模拟各种物理场景的AI系统,工程师需要一定规模范围内的物理数据,而目前这还不可行。这是因为让神经网络获得哪怕少量能理解的数据点也非常耗时。它们依赖称为“数值求解器”的算法来计算3D形状不同点的物理属性。这是一个彻底的过程,但耗时太长,以至于限制了你能获得的数据量,例如测试你的飞机设计是否安全且符合空气动力学。<br><br>一种名为“GeoPT”的新预训练方法由MIT计算机科学与人工智能实验室(CSAIL)和清华大学的研究人员开发,让模拟模型能够以更广泛、更高效的方式学习物理。它实际上在3D中重现了日常的机械交互,展示了粒子到达物体某个部分时如何停止。这些模拟让模型对物理如何运作有所感知,帮助它们更准确地建模现实世界,达到峰值性能的速度提升两倍,并且与领先模型相比,训练所需数据最多减少60%。</p><p>很快,该项目可以帮助工程师预测车辆(如汽车和飞机)、日常物品(包括椅子和容器)以及机器人对各种物理元素的反应,例如风、水和碰撞。研究人员认为,他们的工作也可能是向物理基础模型迈出的一步。这种模型是一个在大量数据上训练出的骨干系统,可以帮助AI工具泛化到不同任务。</p><p>“我们认为物理是AI模型的第三种模态,仅次于文本和像素,”MIT博士生、CSAIL研究员Minghao Guo说,他是介绍GeoPT的<a href="https://arxiv.org/abs/2602.20399">论文</a>的共同第一作者。“我们的通用模型具有多样性,可以帮助构建物理世界模型。许多模型,例如生成机器人数据和视频的模型,已经精通文本和视觉数据,但有了物理精度,它们将获得更真实的结果。”</p><p><strong>易于使用</strong></p><p>要使用GeoPT,用户只需上传物体(如战舰、客机和卡车)的3D模型,并指定要模拟的力的方向和速度。结果是一种热力图,显示物体在不同位置将如何受到影响。如果你知道要模拟的力的速度和方向(速度矢量),就可以在GeoPT中捕获它。当你想要模拟诸如汽车撞墙后的样子、光线在物体周围反弹的方式,以及船是否能在汹涌的波浪中保持漂浮等情况时,这会很方便。</p><p>但GeoPT为何能如此“理解”物理?其知识来自“合成动力学”,即小粒子与复杂3D形状之间的一系列交互。GeoPT研究了130万个合成动力学样本,其中微小的球体以各种速度和角度移动,直到停在物体上的某个点。</p><p>这些粒子一旦接触物体,基本上就会“粘”在物体上,而不是穿过或弹开。想象一下用弹珠和动作人偶来学习物理交互——类似地,模拟模型可以在使用标注数据训练之前,利用合成动力学来获得对物理的感知。</p><p><strong>行业成功</strong></p><p>研究人员发现,GeoPT特别擅长模拟工业场景,因为它在各个基准测试中都优于最先进的模拟模型。共同点是:它比其他工具更快达到峰值性能,同时需要的标注数据要少得多。</p><p>例如,在一个包含复杂3D形状及其对气流和表面压力响应的数据集上,GeoPT在速度、准确性和效率方面都超越了最先进的模型。在捕捉战斗机对风的响应方面,它在速度和准确性上也有类似的成功。当GeoPT测试船体如何处理空气和波浪时,它捕捉这两种物理力所需的标注数据减少了60%,达到峰值准确度的速度比顶级基线快四倍。</p><p>该系统甚至成功模拟了不同类型汽车与另一物体碰撞后的样子。它正确预测了3D车辆将如何变形,同时使用的数据少于最先进的基线。同样,它模拟光如何穿过本质上是一个玩具兔子的物体时也相当准确,尽管事先从未在该3D模型或光物理上进行过训练。</p><p>“如果你的模型在工业基准测试中表现良好,那就意味着它能解决最困难的物理任务,”共同第一作者、MIT博士后、CSAIL研究员Haixu Wu说。“GeoPT能在几秒钟内生成具有超过1亿个网格点的高保真模拟。这可以极大地帮助那些希望测试车辆蓝图而无需进行那么多物理实验的工程师。”</p><p>研究人员补充说,他们的系统只是他们一直在努力构建的物理世界模型的一个预览。团队希望扩大系统规模,在更多形状上训练,并模拟更复杂的物理现象。例如,更深入的方法可以帮助模拟天气模式、测试不同材料并生成逼真的视频。</p><p>“使用合成动力学数据是将物理注入基础模型的一个令人兴奋的范式,”Meta的AI研究科学家Fei Sha说,他没有参与这项研究。“它挑战了传统的观点,即物理和几何必然在计算中纠缠在一起,而且必须获取昂贵且专业的数据。在广泛的应用领域所展示的成功把我们带到了这个重要关头:我们已经准备好从现在开始、快速构建物理基础模型。”</p><p>Wu和Guo与MIT CSAIL的同事共同撰写了论文,包括实验室博士后Zongyi Li;CSAIL附属成员、MIT电子工程与计算机科学(EECS)博士生Zhiyang (Frank) Dou;实验室首席研究员、EECS副教授、Google DeepMind杰出科学家Kaiming He;以及资深作者、Joan and Irwin M. (1957) Jacobs EECS教授、CSAIL首席研究员Wojciech Matusik。清华大学副教授Mingsheng Long也是共同作者。该团队于7月在国际机器学习大会上展示了这篇论文。</p><p>研究人员的工作部分得到了Neural Modular Physics Twin for Robotics的支持。</p>
查看缓存全文
缓存时间: 2026/08/11 01:44
# 凭借对物理的感知,AI模型能够模拟更广泛的现实世界场景
来源:https://news.mit.edu/2026/ai-models-simulate-wider-range-of-real-world-scenarios-0810
人工智能模型身兼多职,包括写作、生成图像和创建3D模型。但在多种环境中测试机器人或车辆设计时,它们就没那么有用了,因为它们对物理的理解不如对像素或文本的理解。
要构建一个能够可靠模拟各种物理场景的AI系统,工程师需要一定规模的物理数据,而这一规模目前尚不可行。这是因为让神经网络获得即使少量可理解的数据点也非常耗时。它们依赖称为“数值求解器”的算法来计算3D形状不同点的物理属性。这是一个精细的过程,但耗时太长,以至于限制了可用于测试飞机设计是否安全且符合空气动力学等任务的数据量。
一种名为“GeoPT”的新预训练方法由麻省理工学院计算机科学与人工智能实验室(CSAIL)和清华大学的研究人员开发,让模拟模型有机会以更广泛、更高效的方式学习物理。它在3D环境中虚拟重现日常机械交互,展示粒子在到达物体某一部分时如何停止。这些模拟让模型对物理运作方式有所感知,帮助它们更准确地建模现实世界,达到峰值性能的速度快两倍,并且与一流模型相比,训练所需数据最多减少60%。
不久,该项目可帮助工程师预测车辆(如汽车和飞机)、日常用品(包括椅子和容器)以及机器人对风、水和碰撞等各种物理要素的响应。研究人员认为,他们的工作也可能朝着物理基础模型迈出一步,这是一种基于大量数据训练的骨干系统,可帮助AI工具泛化到不同任务。
“我们认为物理是AI模型的第三种模态,继文本和像素之后,”麻省理工学院博士生、CSAIL研究员、介绍GeoPT的论文(https://arxiv.org/abs/2602.20399)共同第一作者Minghao Guo说。“我们的通用模型具有多才多艺的特性,有助于构建物理世界的模型。许多模型,例如生成机器人数据和视频的模型,已经精通文本和视觉数据,但如果具备物理准确性,它们将获得更真实的结果。”
**易于使用**
使用GeoPT,用户只需上传物体(如战舰、客机和卡车)的3D模型,并指定要模拟的力的方向和速度。结果是一种热图,显示物体在不同位置将如何受到影响。如果你知道要模拟的力的速度和方向(即速度矢量),就可以在GeoPT中捕获它。当你想模拟汽车撞墙后的样子、光线如何在物体周围反弹以及船能否在湍急波浪中保持漂浮等情况时,这会很方便。
但GeoPT为何能如此深入地“理解”物理?它的知识来自“合成动力学”,即小颗粒与复杂3D形状之间的一系列交互。GeoPT研究了130万个合成动力学样本,其中微小球体以不同速度和角度移动,直到在物体上的某个点停止。
这些颗粒一旦接触物体,基本上就会“粘”在上面,而不是穿过或弹开。想象一下用弹珠和动作人偶来学习物理交互——类似地,模拟模型可以在使用标注数据训练之前,通过合成动力学获得对物理的感知。
**行业成功**
研究人员发现,GeoPT特别擅长模拟工业场景,在多项基准测试中优于最先进的模拟模型。共同点是:它比其他工具更快达到峰值性能,同时需要的标注数据少得多。
例如,在一个包含复杂3D形状及其对气流和表面压力响应的数据集上,GeoPT在速度、准确性和效率方面超过了最先进的模型。在捕捉战斗机对风的响应方面,它也取得了类似的速度和准确性胜利。当GeoPT测试船体如何同时承受空气和波浪时,捕获这两种物理力所需的标注数据减少了60%,达到峰值准确度的速度比顶级基线快四倍。
该系统甚至成功模拟了不同类型汽车与另一物体碰撞后的外观。它正确预测了3D车辆将如何变形,同时使用的数据少于最先进的基线。同样,它模拟光线如何穿过一个基本上是玩具兔子的物体的结果也很准确,尽管事先从未在该3D模型或光物理上进行过训练。
“如果你的模型在工业基准上表现良好,那就意味着它能解决最困难的物理任务,”共同第一作者、麻省理工学院博士后、CSAIL研究员Haixu Wu说。“GeoPT能在几秒钟内对超过1亿个网格点进行高保真模拟。这可使该工具对希望测试车辆蓝图而无需运行大量物理实验的工程师极为有用。”
研究人员补充说,他们的系统只是他们一直努力构建的物理世界模型的一个预览。团队希望扩展其系统,在更多形状上进行训练,并模拟更复杂的物理现象。例如,更深入的方法可帮助模拟天气模式、测试不同材料以及生成逼真的视频。
“使用合成动力学数据是将物理注入基础模型的一个令人兴奋的范式,”未参与该研究的Meta AI研究科学家Fei Sha说。“它挑战了传统观念,即物理和几何在计算中必然纠缠在一起,并且必须获取昂贵且专业的数据。在广泛的应用领域中所展示的成功将我们带到了这个重要关头:我们准备好了,现在就可以快速构建物理基础模型。”
Wu和Guo与MIT CSAIL同事共同撰写了这篇论文,包括实验室博士后Zongyi Li;CSAIL附属机构成员、麻省理工学院电气工程与计算机科学(EECS)博士生Zhiyang (Frank) Dou;实验室首席研究员、EECS副教授、Google DeepMind杰出科学家Kaiming He;以及资深作者、EECS Joan and Irwin M. (1957) Jacobs教授兼CSAIL首席研究员Wojciech Matusik。清华大学副教授Mingsheng Long也是合著者。该团队于7月在国际机器学习大会上展示了这篇论文。
相似文章
AI代理创建虚拟游乐场,帮助机器人获取关键训练数据
MIT CSAIL与丰田研究所推出SceneSmith,该系统利用GPT-5.2驱动的AI代理自动生成丰富的3D虚拟场景,为机器人训练提供多样化的模拟环境,无需大量真实世界测试。
物理AI仿真现状:概述
这篇NVIDIA博客文章概述了用于物理AI的仿真引擎,涵盖为什么仿真对于机器人数据生成至关重要,并比较了MuJoCo、Isaac Sim和Newton等工具。文章强调了仿真从调试工具向模型开发集成部分的转变。
利用AI生成代码实现物理模拟:解决物理问题之路?
探讨使用AI生成物理模拟代码,旨在通过自动化代码生成推进物理问题的解决。
新技术让AI模型边学边瘦、边学快
MIT CSAIL及其他机构的研究人员推出了CompreSSM技术,该技术通过在训练早期移除不必要的组件来压缩状态空间AI模型,从而在不牺牲性能的情况下实现更快的训练速度和更小的模型体积。
Accelerated Understanding | 人工智能:模拟与理解物理学,助力发明与发现。
Accelerated Understanding 正在构建模拟和理解4D物理学的AI模型,以加速发明和发现,提供传统实验所缺乏的方向性反馈。