谷歌的Genie世界模型现在可以通过街景模拟真实街道
摘要
谷歌DeepMind将街景数据集成到其Genie世界模型中,实现真实街道的交互式模拟,应用于机器人、自动驾驶和用户体验等领域。
谷歌DeepMind正在将街景与Project Genie集成,为机器人、游戏和旅行创建沉浸式交互世界模拟,让用户能够探索环境、天气变化和罕见场景。
查看缓存全文
缓存时间: 2026/05/19 19:12
# Google 的 Genie 世界模型现在可以通过街景模拟真实街道 | TechCrunch
来源: https://techcrunch.com/2026/05/19/googles-genie-world-model-can-now-simulate-real-streets-with-street-view/
我们都曾打开 Google 地图上的街景视图,向朋友展示我们童年时的家是什么样子,或者把那个小人图标拖到巴黎的街道上,看看自己订的酒店是不是在一条好街区里。想象一下,如果这种体验能变得更加沉浸、更加互动,让你能够真正模拟一条街道及其周边环境,甚至还能调整天气,或者看看它要是处于《后天》那样的场景中会是什么样子。
这正是 Google 最新整合的目标之一。从今天开始,Google DeepMind 将街景视图连接到 Project Genie(https://techcrunch.com/2026/01/29/i-built-marshmallow-castles-in-googles-new-ai-world-generator-project-genie/),这是该公司推出的通用世界模型,能够生成多样化的交互式环境。这项新功能是在 Google I/O 开发者大会上正式发布的。
“无论是在智能体(以及机器人)的应用场景中,还是在供人类玩赏的用途上,它都非常强大,而这也一直是 Genie 的核心理念,”DeepMind 开放式团队的研究科学家 Jack Parker-Holder 告诉 TechCrunch。
他举了一个例子:一个新型机器人被部署在伦敦,而伦敦很少见到阳光。Parker-Holder 说,Genie 可以模拟出那种罕见的时刻——阳光洒落在维多利亚式住宅上,这样当光线突然出现时,机器人就不会被惊到。
“与此同时,你可能会说,‘我要去纽约市,但不是这个季节,’”他继续说道。“那里会下雪。我想看看那条街区在雪中是什么样子。”
Google 通过装有摄像头的汽车和背着“追踪背包”的个人收集街景数据已经 20 年了。这家科技巨头已经收集了超过 2800 亿张图像,覆盖 110 个国家和七大洲。
“借助街景,我们拥有来自全球大量地方的图像,”Jack 说道。“你可以想象,将这一丰富的真实世界信息与数据源,和模拟世界的能力结合起来,会带来多么强大的潜力。”
Google 去年 8 月发布了其最新世界模型 Genie 3 的研究预览版(https://techcrunch.com/2025/08/05/deepmind-thinks-genie-3-world-model-presents-stepping-stone-towards-agi/),并于 1 月向美国的 Google AI Ultra 订阅者开放了该工具的访问权限,允许用户通过文本提示或图像创建交互式游戏世界。其目标是利用 Genie 进行教育体验、游戏和机器人训练。
Genie 3 已经在为 Waymo 的一个模拟器(https://waymo.com/blog/2026/02/the-waymo-world-model-a-new-frontier-for-autonomous-driving-simulation/)提供动力,用于训练其自动驾驶汽车应对“极其罕见的事件”,比如龙卷风或偶然遇到大象。将街景数据整合进去,可能有助于 Waymo 准备在全球更多城市推出服务。
Waymo 有自己的模拟器,依靠它扩展到了 11 个美国城市,并在更多城市中测试了其 AI 驾驶员。Parker-Holder 表示,不同之处在于,那些模拟都是从车辆视角出发的。而街景不仅可以模拟一个与现实地点绑定的世界,还能将视角切换到其他类型的智能体上,比如人类或机器人。
从今天开始,Google 会在 Genie 中向部分美国 Ultra 用户推出街景功能,并逐步扩大访问规模。据该公司称,全球的 Ultra 用户将在未来几周内获得访问权限。
DeepMind 的产品经理 Diego Rivas 表示,研究人员的目标是让尽可能多的人用到这一新能力。他提醒说,街景功能本身以及整个 Genie 仍然是一个实验,因此在准确性方面还有很多需要改进的地方。
在 Google 团队向我展示的样本中——包括一个我曾居住过的社区的水下模拟——结果令人印象深刻且可辨识,但仍是电子游戏级别的画质,而非照片级真实感。这些模型目前还不具备物理感知能力,也就是说它们还不理解因果关系。例如,在一个模拟中,一名女子在雪中的约书亚树国家公园奔跑,竟然直接穿过了仙人掌和灌木丛。
相比之下,比如 Google 的图像生成器 Nano Banana——现在可以在信息图中生成完美的文字——或者其视频生成器 Veo,它理解纸船会随水流漂浮、烟雾会在空气中扩散、布料会垂落在物体表面。
物理规则并不是被硬编码进这些模型的;它们通过被动观察,像生物一样随着时间的推移直觉地学会这些知识。
“我认为对于这类模型,在准确性和质量方面,它可能落后视频生成六到十二个月,所以我认为这是一个我们终将解决的问题,”Parker-Holder 说。
Jonathan Herbert 是 Google 地图的主管,12 年前他作为实习生加入了街景团队。他说 Genie 目前还无法忠实地重建一条街道。他认为真正的突破在于 AI 的空间连续性。如果你旋转 360 度,AI 会正确地记住并模拟出你身后的环境。从那个点开始,模型可以在此基础上构建出新的环境。
“我们长期都在思考,如何利用街景数据构建出最好、最丰富的世界模型,”Herbert 说。“很久以来,我们就有一个想法,那就是以新的方式使用地图数据,用于新类型的人工智能研究。”
*当您通过我们文章中的链接购买商品时,我们可能会获得少量佣金(https://techcrunch.com/techcrunch-affiliate-monetization-standards/)。这不会影响我们的编辑独立性。*
相似文章
利用 Project Genie 和 Street View 模拟真实世界地点
Project Genie 是 Google 的通用世界模型,现已与 Street View 集成,能够基于真实地点创建交互式环境,可供 Google AI Ultra 订阅用户使用。
@GoogleDeepMind:Project Genie中的街景图像正在向全球所有符合条件的Google AI Ultra订阅者(18岁以上)推出。立即尝试…
Google DeepMind正在向全球符合条件的Google AI Ultra订阅者推出Project Genie中的街景图像,使他们能够探索美国各地并生成风格。
Google Just Turned Street View Into a Video Game
Google 在 IO 大会上发布的 Genie 3 实时视频生成器,可将 Google Maps 街景图像转换为可交互的 3D 世界,让用户像玩游戏一样自由探索真实场景。
Genie 3:世界模型的新前沿
DeepMind 发布 Genie 3,一个通用世界模型,能够从文本提示生成交互式环境,分辨率达 720p、帧率 24fps,相比前代版本具有更好的一致性和实时交互能力。
Project Genie:探索无限交互世界的实验性项目
Google 推出了 Project Genie,这是一个面向 Google AI Ultra 订阅用户的实验性原型,允许用户使用 Genie 3 创建、探索和重新混合无限交互世界。