AI能告诉你你把钥匙落在哪了吗?
摘要
麻省理工学院的研究人员开发了一种名为DAAAM的长期记忆框架,使机器人能够使用语言形成和回忆环境的时空记忆,从而回答诸如“我的钱包落哪儿了?”之类的查询。该方法结合了先进的地图表示与丰富的描述,性能优于当前最先进的方法。
<p>一位汽车工厂工人能记得前一天晚上她将半组装的零件放在哪个储物箱里,并迅速回到那个位置取回零件。但与她并肩工作的机器人却难以建立和调用同样的“时空”记忆。</p><p>现在,麻省理工学院的研究人员开发了一种长期记忆框架,使机器人能够快速形成并回忆复杂、大规模环境的详细心理模型。</p><p>未来,这一进步可以让工厂工人只需说一句“去拿我们昨晚开始组装的那个零件”,就能让机器人助手取来物品。</p><p>这种新方法结合了先进的地图表示与机器人长时间移动过程中收集的丰富环境描述。机器人可以快速访问这段记忆,并用自然语言回答关于其环境的复杂查询。</p><p>这个记忆框架在回答问题时比现有最先进的方法更准确,并且运行速度足够快,可供移动机器人实时使用。</p><p>除了在机器人领域的潜在应用,这种方法还可用于增强现实系统,帮助维护工人进行异常检测,或协助通勤者导航。</p><p>“如果我们希望机器人与人类并肩工作并更好地与人类互动,它们必须使用相同的语言。机器人必须像人类一样推理时间和空间。这正是我们方法所做的。它将传统地图转化为基于语言的地图,使机器人更容易用语言思考和访问。”麻省理工学院航空航天系副教授、信息与决策系统实验室首席研究员兼麻省理工学院SPARK实验室主任Luca Carlone说。</p><p>参与该<a href="https://arxiv.org/pdf/2512.00565" target="_blank">论文</a>的还有第一作者、麻省理工学院研究生Nicolas Gorlo,以及前麻省理工学院研究科学家、现德国纽伦堡工业大学教授Lukas Schmid。该研究近日在计算机视觉与模式识别会议上发表。</p><p><strong>时空记忆</strong></p><p>记忆使人工智能系统(如聊天机器人)能够回答复杂问题并推理与用户的过往互动。</p><p>“我们希望设计一种新型记忆——时空记忆,使AI驱动的机器人能够记住真实世界的交互和传感器观测。就像ChatGPT,但扎根于现实世界,并能回答关于环境的任何问题,比如‘我的钱包落哪儿了?’”Carlone说。</p><p>为了开发这样的记忆框架,麻省理工学院的研究人员将计算机视觉和机器人地图构建两个领域的工作结合起来。</p><p>多模态计算机视觉模型能够理解并丰富地描述场景中的物体,但通常一次只能处理一个注释。另一方面,机器人地图构建框架可以创建环境(如整个公寓或大学校园)的3D地图,但往往缺乏对物体的详细描述,或者计算成本高昂。</p><p>麻省理工学院研究人员创建的方法名为“随时随地描述任何事物”,它结合了两种方法的优点。</p><p>使用这种方法,机器人在穿越环境时,会为看到的物体附上丰富的描述。例如,机器人可能注意到麻省理工学院校园内的一栋特定建筑名为斯塔塔中心,并采用某种建筑风格设计;或者一个自行车架上停着五辆自行车,其中红色那辆轮胎没气了。</p><p>它将这种详细信息存储在一个基于3D地图的表示中,该表示按空间排列,物体被分组到不同区域。这样,机器人就能记住那辆轮胎没气的红色自行车位于斯塔塔中心外的自行车架上。</p><p>但现有捕获如此丰富描述的技术通常需要几秒钟来注释几个物体。这对于实时性能来说太慢了,因为机器人在几分钟的探索中可能会看到数百个物体。</p><p>“机器人形成这种空间记忆的速度越快,它在环境中执行动作的效率就越高。”Carlone补充道。</p><p><strong>简化流程</strong></p><p>为了加快速度,该方法在移动过程中聚合附近的物体,并使用优化方法选择关键帧进行注释。这些是具有最清晰视角、包含多个物体的图像,使系统能够并行详细描述多个项目,从而将计算速度提高十倍。</p><p>当机器人探索空间时,它将每一批注释附加到3D地图上特定位置的多个物体上。</p><p>“我们只对每个物体注释一次,因此我们的框架可以在非常大的环境中实时运行。通过将物体聚类到区域,它可以回答关于环境中物体和位置的各种查询。”Gorlo解释说。</p><p>一旦系统构建了这种空间记忆,它必须高效地从包含大量物体和描述的数据库中检索信息。</p><p>为此,研究人员使用了一个LLM,它调用各种工具,能够快速检索特定信息,从而减少幻觉。这使得该方法能够在几秒钟内准确回答用户查询。</p><p>例如,如果用户询问机器人在麻省理工学院校园某建筑附近看到的一个特定雕塑,该方法可以使用语义搜索工具根据“雕塑”一词检索信息,或者使用另一个工具根据建筑位置检索信息。</p><p>在与其他方法对比测试中,该方法根据问题类型,准确率提高了21%到53%。</p><p>未来,研究人员希望扩展现有方法,使系统能够捕捉环境中发生的重大事件。他们还致力于将置信度水平纳入系统的回答中。</p><p>“最终,我们希望机器人能够协助完成各种任务。通过这个框架,我们试图创建基础,以实现一个能够执行你要求的任何任务的通才智能体。”Gorlo说。</p><p>这项研究部分由美国陆军研究实验室和海军研究办公室资助。Carlone目前作为亚马逊学者在休假;本文描述的工作在麻省理工学院进行,与亚马逊无关。</p>
查看缓存全文
缓存时间: 2026/06/17 12:53
# 人工智能能告诉你钥匙落在哪里吗?
来源:https://news.mit.edu/2026/could-ai-tell-you-where-you-left-your-keys-0617
一位汽车工厂工人能记住前一晚放置半组装零件的储物箱,并迅速返回该位置取回。但与她并肩工作的机器人,却难以建立并访问这种“时空记忆”。
如今,麻省理工学院(MIT)的研究人员开发了一种长期记忆框架,让机器人能够快速形成并调用复杂、大规模环境的详细心理模型。
未来,这项进展可以让工厂工人只需说“去拿我们昨晚开始组装的那个零件”,就能派遣机器人助手取回物品。
这种新方法结合了高级地图表示与机器人在长时间移动过程中收集的丰富环境描述。机器人能快速访问该记忆,用自然语言回答关于环境的复杂查询。
这个记忆框架在回答问题时比最先进的方法更准确,且运行速度足够快,可供移动机器人实时使用。
除了在机器人领域的潜在应用外,该方法还可用于增强现实系统,帮助维护人员检测异常,或协助通勤者导航。
“如果我们希望机器人与人类并肩工作并更好地互动,它们必须说同一种语言。机器人必须像人类一样推理时间和空间。这本质上就是我们的方法所做的。它将传统地图转化为基于语言的地图,让机器人更容易通过语言思考和访问。”MIT航空与航天学系副教授、信息与决策系统实验室(LIDS)首席研究员、MIT SPARK实验室主任Luca Carlone表示。
他与论文(https://arxiv.org/pdf/2512.00565)的第一作者、MIT研究生Nicolas Gorlo,以及前MIT研究科学家、现德国纽伦堡工业大学教授Lukas Schmid共同完成了这项研究。该研究近期在计算机视觉与模式识别会议(CVPR)上展示。
**时空记忆**
记忆使人工智能系统(如聊天机器人)能够回答复杂问题,并推理与用户之前的交互。
“我们希望设计一种新型记忆——时空记忆,使AI驱动的机器人能够记住真实的交互和传感器观测。就像ChatGPT,但扎根于现实世界,能够回答关于环境的任何问题,比如‘我把钱包落在哪里了?’”Carlone说。
为了开发这样的记忆框架,MIT研究人员将计算机视觉和机器人地图构建两条研究方向结合起来。
多模态计算机视觉模型能够理解并丰富地描述场景中的物体,但通常一次只处理一个标注。另一方面,机器人地图构建框架能创建环境的3D地图(如整个公寓或大学校园),但通常缺乏物体的详细描述,或者计算成本高昂。
MIT研究人员创建的方法被称为“随时随地描述一切”(Describe Anything, Anywhere, Anytime, at Any Moment, DAAAM),它结合了两者的最佳特性。
使用DAAAM,当机器人遍历环境时,它会为所见物体附加丰富的描述。例如,机器人可能会注意到MIT校园中某座建筑名为Stata Center,并采用某种特定建筑风格设计;或者某个自行车架上停着五辆自行车,其中红色的那辆轮胎没气了。
它将这一详细信息存储在以3D地图为基础的表示中,并按空间排列,使物体被分组到不同区域。这样,机器人就能记住那辆轮胎没气的红色自行车在Stata Center外的自行车架上。
但现有捕捉此类丰富描述的技术通常需要几秒钟来标注几个物体。这对实时性能来说太慢了,因为机器人在几分钟的探索中可能会看到数百个物体。
“机器人形成这种空间记忆的速度越快,它在环境中执行动作的效率就越高。”Carlone补充道。
**流程优化**
为了加快速度,DAAAM在移动过程中聚合附近的物体,并使用优化方法选择关键帧进行标注。这些是具有最清晰多个物体视角的图像,使得系统能够并行地详细描述多个项目,将计算速度提升十倍。
随着机器人探索空间,它将每一批标注附加到3D地图特定位置上的多个物体上。
“我们只对每个物体标注一次,因此我们的框架能够在实时情况下运行在非常大的环境中。而且通过将物体聚类到区域中,它可以回答关于环境中物体和位置的各种查询。”Gorlo解释道。
一旦系统构建了这种空间记忆,它必须高效地从包含大量物体和描述的数据库中检索信息。
为此,研究人员使用了一个LLM,它调用多种工具,能够快速检索特定信息,并减少幻觉。这使得DAAAM能在几秒钟内准确回答用户查询。
例如,如果有人问机器人它在MIT某栋建筑附近看到的一个特定雕塑,DAAAM可以使用语义搜索工具根据“雕塑”一词检索信息,或使用另一个工具根据建筑位置检索信息。
在测试和与其他方法比较时,DAAAM的准确率根据问题类型提高了21%至53%。
未来,研究人员希望扩展DAAAM,使系统能够捕捉环境中发生的重大事件。他们还在研究将置信度纳入系统响应中。
“最终,我们希望拥有能够协助完成各种任务的机器人。通过这个框架,我们试图创建基础,使一个通用型智能体能够执行你要求的任何任务。”Gorlo说。
这项研究部分由美国陆军研究实验室和海军研究办公室资助。Carlone目前作为Amazon Scholar休假;本文描述的工作是在MIT进行的,与亚马逊无关。
相似文章
@Oliviacoder1: MIT刚刚让每家AI公司的数十亿美元赌注看起来尴尬不已。他们解决了AI记忆问题。不是通过构建更大的……
MIT CSAIL研究人员提出了一种新颖的AI记忆方法,通过将文档存储在外部,并让AI自行导航和查询,从而避免了上下文腐烂,以更低成本实现了1000万令牌的有效上下文。
我为我的AI代理构建了本地长期记忆。4个月的日常使用,一个已发布的应用
一位个人开发者使用markdown文件和本地索引为AI代理构建了一个本地长期记忆系统,实现了跨会话的持久记忆,并包括针对虚假记忆的测试,计划未来可能将其产品化。
AI 智能体记忆机制详解(28 分钟阅读)
本文全面介绍了 AI 智能体记忆机制的技术原理,区分了工作记忆与长期记忆的实现方式,并探讨了上下文管理、基于嵌入的检索以及数据生命周期治理等关键策略。
你的AI助手为何总是忘记你:4个根本原因(以及我们的解决方案)
本文指出了当前AI代理记忆系统的四个关键缺陷——脆弱性、缺乏时间推理能力、遗忘困境和评估缺口——并提出了一种受代码代理启发的新型记忆架构,在基准测试中取得了高分,同时强调上下文学习是下一个挑战。
AI身份能否从外部记忆结构中涌现?
一份研究报告,详细描述了构建外部记忆架构的受控实验,该架构能够实现独立于模型权重的持久性AI身份。研究发现,在三种拓扑结构中,积累的片段历史在塑造输出方面始终主导系统提示。