生成式AI赋能穿透障碍物的无线视觉系统

MIT News — Artificial Intelligence 新闻

摘要

MIT研究人员开发了一种由生成式AI增强的无线视觉系统,该系统利用毫米波信号重建隐藏物体及完整房间场景,突破了以往在形状重建方面的局限性,为仓储机器人与智能家居应用带来了新的可能性。

<p>MIT研究人员在过去十余年间一直专注于研究一项技术:让机器人能够通过“透视”障碍物来寻找并操控隐藏物品。其方法利用能够穿透表面的无线信号,并捕捉从隐蔽物体上反射回来的回波。</p><p>如今,研究人员正在利用生成式AI模型来突破限制以往方法精度的长期瓶颈。由此产生的新方法能够实现更精确的形状重建,有望提升机器人可靠抓取和操作视线受阻物体的能力。</p><p>这项新技术首先根据反射的无线信号构建隐藏物体的部分三维结构,随后利用经过专门训练的生成式AI模型补全缺失的形状部分。</p><p>研究人员还推出了一套扩展系统,该系统利用生成式AI精准重建包含所有家具在内的整个房间场景。该系统通过一台固定雷达发射无线信号,并接收空间中移动人体产生的反射信号。&nbsp;&nbsp;</p><p>这一设计攻克了许多现有方法面临的关键挑战,即无需将无线传感器安装在移动机器人上即可扫描环境。此外,与一些流行的基于摄像头的技术不同,该方法能够有效保护环境中人员的隐私。</p><p>这些创新将使仓库机器人在发货前验证打包物品,从而减少因退货造成的浪费。它们还能让智能家居机器人感知人员在房间内的位置,从而提高人机交互的安全性和效率。</p><p>“我们目前已经开发出能够帮助理解无线反射信号的生成式AI模型。这不仅开启了诸多有趣的新型应用场景,在技术上更是一项质的飞跃——从此前无法看见盲区进行补全,到如今能够解析反射信号并重建完整场景,”MIT电气与计算机工程系副教授、MIT媒体实验室Signal Kinetics团队负责人兼该两项技术研究论文的高级作者Fadel Adib表示,“我们正在利用AI真正解锁无线视觉。”</p><p>Fadel Adib与第一作者兼研究助理Laura Dodds,以及研究助理Maisy Lam、Waleed Akbar和Yibo Cheng共同参与了<a href="https://arxiv.org/pdf/2511.14152" target="_blank">第一篇论文</a>的研究;与第一作者兼前博士后Kaichen Zhou、Dodds以及研究助理Sayed Saad Afzal共同参与了<a href="https://arxiv.org/pdf/2511.14019" target="_blank">第二篇论文</a>的研究。这两篇论文均将在IEEE计算机视觉与模式识别会议上发表。</p><p><strong>克服镜面反射难题</strong></p><p>Adib团队此前曾展示如何利用毫米波(mmWave)信号对隐藏在视线之外的三维物体(例如埋在杂物堆下的丢失钱包)进行&nbsp;<a href="https://news.mit.edu/2025/new-imaging-technique-reconstructs-hidden-object-shapes-0701" target="_blank">精准重建</a>。</p><p>这类信号与Wi-Fi使用的信号类型相同,能够穿透石膏板、塑料和纸板等常见障碍物,并从隐藏物体上反射回来。</p><p>然而,mmWave通常以镜面反射的方式传播,即电波撞击表面后会朝单一方向反射。因此,物体表面的大部分区域会将信号反射远离mmWave传感器,导致这些区域实际上成为“盲区”。</p><p>“当我们想要重建一个物体时,只能看到它的顶面,完全看不到底部或侧面,”Dodds解释道。</p><p>研究人员此前曾依靠物理学原理来解析反射信号,但这限制了重建三维形状的精度。</p><p>在这两篇新论文中,他们采用生成式AI模型来补全局部重建中缺失的部分,从而突破了这一限制。</p><p>“但随之而来的挑战是:如何训练这些模型来准确填补这些空白?”Adib问道。</p><p>通常情况下,研究人员需要借助超大规模数据集来训练生成式AI模型,这也是Claude和Llama等模型能展现出惊人性能的原因之一。然而,目前没有任何mmWave数据集能满足训练需求。</p><p>为此,研究人员对大型计算机视觉数据集中的图像进行了适配处理,使其模仿mmWave反射的特性。</p><p>“我们通过模拟镜面反射特性以及此类反射带来的噪声,成功将现有数据集迁移应用到本领域。若由我们亲自收集足够的新数据来完成此项工作,将耗费数年时间,”Lam表示。</p><p>研究人员将这些物理规律直接嵌入适配后的数据中,构建出一个合成数据集,用于训练生成式AI模型进行合理的形状重建。</p><p>这套完整的系统被命名为Wave-Former。它首先基于mmWave反射提出一组潜在的物体表面候选集,将其输入生成式AI模型以补全形状,随后不断迭代优化表面细节,直至实现完整重建。</p><p>Wave-Former成功对约70种日常用品(如罐头、纸箱、餐具和水果)生成了高保真重建结果,较当前最先进的基线模型提升了近20%的精度。这些物品均被纸板、木材、石膏板、塑料或织物遮挡。</p><p><strong>捕捉“幽灵”信号</strong></p><p>团队采用相同的方法构建了一套扩展系统,通过利用房间内移动人体产生的mmWave反射,实现对整个室内场景的完整重建。</p><p>Dodds解释道:“人体运动会产生多径反射。部分mmWave先照射到人体,再经墙壁或物体二次反射,最后返回传感器。”</p><p>这些二次反射形成了所谓的“幽灵信号”,它们是原始信号的反射副本,会随着人的移动而改变位置。传统做法通常将这些幽灵信号视为噪声予以丢弃,但实际上它们包含了房间布局的重要信息。</p><p>“通过分析这些反射随时间的变化,我们可以初步把握周围环境的宏观轮廓。但若试图直接解析这些信号,其精度和分辨率将受到极大限制,”Dodds指出。</p><p>他们采用了类似的训练方法来教导生成式AI模型解读这些粗略的场景重建结果,并理解多径mmWave反射的行为规律。该模型负责填补空白,不断优化初始重建效果,直至完成整个场景的构建。</p><p>团队使用单台mmWave雷达捕获的超过100条人类运动轨迹,对其名为RISE的场景重建系统进行了测试。结果表明,RISE生成的重建结果平均精度比现有技术高出约一倍。</p><p>未来,研究人员希望进一步提升重建结果的粒度与细节。他们还计划构建针对无线信号的大型基础模型,类似于语言与视觉领域的GPT、Claude和Gemini等大模型,这将开辟全新的应用场景。</p><p>本研究部分获得了NSF、MIT媒体实验室和亚马逊的支持。</p>
查看原文
查看缓存全文

缓存时间: 2026/04/21 01:12

# 生成式人工智能提升可穿透障碍物的无线视觉系统性能 Source: https://news.mit.edu/2026/generative-ai-improves-wireless-vision-system-sees-through-obstructions-0319 麻省理工学院的研究人员花了十多年时间研究相关技术,使机器人能够通过“透视”障碍物来寻找和操控隐藏物体。他们的方法利用能够穿透表面的无线信号,并通过隐藏在物品上的反射来工作。 如今,研究人员正利用生成式人工智能模型来克服长期以来限制先前方法精度的瓶颈。这一成果催生了新方法,能够生成更精确的形状重建结果,从而提升机器人可靠抓取和操作视野受阻物体的能力。 这项新技术基于反射的无线信号构建隐藏物体的部分重建模型,并利用经过专门训练的生成式 AI 模型填补其形状中缺失的部分。 研究人员还推出了一套扩展系统,该系统利用生成式 AI 精确重建整个房间,包括所有家具。系统使用从一个固定雷达发射的无线信号,这些信号会反射回房间内移动的人体。 这克服了现有许多方法面临的一个关键挑战:它们通常要求将无线传感器安装在移动机器人上以扫描环境。而且,与一些流行的基于摄像头的技术不同,他们的方法能够更好地保护环境中人员的隐私。 这些创新可以使仓库机器人在发货前验证已打包的物品,从而消除退货造成的浪费。它们还可以让智能家居机器人掌握某人在房间内的位置,从而提高人机交互的安全性和效率。 “我们现在所做的是开发能够帮助我们理解无线反射的生成式 AI 模型。这不仅开辟了众多有趣的新应用场景,在技术层面更是能力的质的飞跃——从之前无法看到的区域进行补全,到能够解析反射并重建整个场景。”麻省理工学院电气工程和计算机科学系副教授、MIT 媒体实验室 Signal Kinetics 小组负责人、该两项技术研究的高级作者 Fadel Adib 表示,“我们正在利用 AI 彻底解锁无线视觉技术。” Adib 在第一篇论文(https://arxiv.org/pdf/2511.14152)中与第一作者兼研究助理 Laura Dodds,以及研究助理 Maisy Lam、Waleed Akbar 和 Yibo Cheng 共同完成研究;第二篇论文(https://arxiv.org/pdf/2511.14019)则由第一作者兼前博士后 Kaichen Zhou、Dodds 以及研究助理 Sayed Saad Afzal 撰写。这两篇文章都将在 IEEE 计算机视觉与模式识别会议(CVPR)上发表。 **克服镜面反射难题** Adib 团队此前曾演示如何利用毫米波(mmWave)信号对隐藏的三维物体(例如埋在杂物堆下的丢失钱包)进行准确重建(https://news.mit.edu/2025/new-imaging-technique-reconstructs-hidden-object-shapes-0701)。 这类波与 Wi-Fi 使用的信号类型相同,能够穿透石膏板、塑料和纸板等常见障碍物,并从隐藏物体表面反射回来。 但毫米波的反射通常具有镜面特性,即波撞击表面后会朝单一方向反射。因此,表面很大一部分区域会将信号反射偏离毫米波传感器,导致这些区域实际上处于不可见状态。 “当我们想要重建一个物体时,只能看到它的顶面,完全无法看到底部或侧面。”Dodds 解释道。 研究人员过去曾利用物理原理来解读反射信号,但这限制了重建三维形状的准确性。 在新的研究中,他们通过引入生成式 AI 模型来填补部分重建结果中的缺失部分,从而突破了这一局限。 “但随之而来的挑战是:该如何训练这些模型来填补这些空白呢?”Adib 问道。 通常,研究人员会使用超大规模数据集来训练生成式 AI 模型,这也是 Claude 和 Llama 等模型能展现出惊人性能的原因之一。但目前没有任何毫米波数据集的数据量足以用于训练。 为此,研究人员对大型计算机视觉数据集中的图像进行了适应性处理,使其模拟毫米波反射的特性。 “我们在模拟镜面反射特性以及这些反射带来的噪声,以便将现有数据集应用到我们的领域中。若要我们自己收集足够的新数据来完成这项工作,至少需要花费数年时间。”Lam 表示。 研究人员将毫米波反射的物理特性直接嵌入这些经过处理的图像数据中,创建出一个合成数据集,用于训练生成式 AI 模型执行合理的形状重建。 这套完整的系统被称为 Wave-Former,它基于毫米波反射提出一组潜在的物体表面,将其输入生成式 AI 模型以补全形状,随后对这些表面进行迭代优化,直至实现完整重建。 Wave-Former 成功生成了约 70 种日常用品(如罐头、盒子、餐具和水果)的高保真重建结果,相比最先进基线模型的准确率提升了近 20%。这些物体被隐藏在纸板、木材、石膏板、塑料和织物后面或下面。 **捕捉“鬼影”信号** 研究团队采用相同的方法构建了扩展系统,通过利用房间内人体运动产生的毫米波反射,实现对整个室内场景的完整重建。 人体运动会产生多径反射。Dodds 解释称,部分毫米波先反射自人体,随后再次从墙壁或物体表面反弹,最后返回传感器。 这些二次反射产生了所谓的“鬼影信号”,它们是原始信号的反射副本,会随着人的移动而改变位置。此类鬼影信号通常被视为噪声而被丢弃,但实际上它们蕴含着关于房间布局的信息。 “通过分析这些反射随时间的变化,我们可以开始对环境形成粗略的认知。但若试图直接解析这些信号,其准确性和分辨率都会受到限制。”Dodds 指出。 他们采用了类似的训练方法来教导生成式 AI 模型解读这些粗略的场景重建结果,并理解多径毫米波反射的行为规律。该模型负责填补空白,对初始重建结果进行不断细化,直至完成整个场景的构建。 他们使用单个毫米波雷达捕获的 100 多条人类运动轨迹,对他们的场景重建系统(名为 RISE)进行了测试。平均而言,RISE 生成的重建结果精度是现有技术的两倍。 未来,研究人员希望进一步提升重建结果的粒度与细节。他们还计划为无线信号构建大型基础模型,类似于语言和视觉领域的 GPT、Claude 和 Gemini 基础模型,这将有望开辟全新的应用领域。 本研究部分获得了美国国家科学基金会(NSF)、MIT 媒体实验室以及亚马逊的支持。

相似文章

AI系统学会让仓库机器人交通顺畅运行

MIT News — Artificial Intelligence

来自MIT和Symbotic的研究人员开发了一种深度强化学习系统,用于优化自主仓库中的机器人交通。该系统通过动态优先调度机器人来避免拥堵,实现了比现有方法高出25%的吞吐量提升。