Introducing GWM Worlds 2, a Playable World Model | Runway

Reddit r/singularity 模型

摘要

Runway 发布了 GWM Worlds 2,这是一个可实时操控的交互式世界模型,支持 720p/24fps 视频和 48kHz 音频的实时生成,允许用户通过文本动作控制环境并接入智能体执行任务。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/03 18:20

# GWM Worlds 2:可实时操控的交互式世界模型 **TL;DR:** Runway 推出了 GWM Worlds 2,这是一个可实时操控的交互式世界模型,它通过“世界提示”机制分离场景的持久与动态元素,支持720p/24fps视频与48kHz音频的逐帧实时生成,允许用户通过文本动作直接控制环境,并能接入智能体自主执行任务。 ## 从模拟到实时操控 去年十二月,我们推出了 GWM Worlds——一款用于实时环境模拟的世界模型。它通过长序列运动保持空间的连贯性,而这正是难点所在。今天,我们展示 GWM Worlds 2。视频与音频生成,转变为实时操控的模拟体验。 ## 核心机制:世界提示(World Prompt) 丰富的控制需要一套描述世界的机制。我们的方案从一次分割开始:区分持久元素与动态变化。我们称之为“世界提示”。 * **持久部分(场景):** 构成场景的可行动主体及其遵循的规律。首帧为其奠基,此后世界即持续运转。 * **事件流:** 带时间戳的文本动作,可指向特定主体或自由作用于整个场景。 镜头运动作为独立输入逐帧提供,且保持连续性。 ## 技术实现与模型演进 为实现这一切,我们将基础音视频模型按世界提示格式进行微调,使其遵循相应结构。该模型原为双向结构,运行速度过慢无法实时交互。因此,我们通过后训练将其转化为无固定时长的自回归模型。 GWM Worlds 2 能生成 **720p 分辨率**、**24帧/秒**的视频与 **48kHz 音频**,逐帧实时渲染。后续所有演示均通过单次连续会话实时操控完成。 ## 实时控制与交互特性 1. **实时操控:** 所有内容均非预渲染片段。只要持续输入,世界便会延续扩展。 2. **操作便捷:** 常用动作可绑定按键以提升操控效率。动作并非必须针对特定角色,向场景发送指令即可引发洪水或沙尘暴。 3. **动态启动:** 你还可以从视频(而非静态图像)启动场景,环境与音频将无缝衔接。 4. **智能体控制:** 智能体也能接管控制权——赋予其目标后,它会自主行动。在首次测试中,指令依次前往红旗与蓝旗的任务被一气呵成完成。 5. **多用户协作:** 同一会话中,不同用户可扮演不同角色。 6. **便捷预设:** GWM Worlds 2 无需繁琐的场景配置,用一行文字描述世界,即可获得即玩即用的预设环境。 **GWM Worlds 2。边构建边体验的世界。** Source: [Introducing GWM Worlds 2, a Playable World Model | Runway](https://www.youtube.com/watch?v=pmjyB-lc4KQ)

相似文章

Micro-World - 动作控制的交互世界模型 - AMD

Reddit r/LocalLLaMA

AMD 发布了 Micro-World,这是一个基于 Wan2.1 系列构建的动作控制交互世界模型,并提供了开源权重、代码和精心整理的数据集,用于可控世界建模。

tencent/HY-World-2.0

Hugging Face Models Trending

HY-World 2.0 是腾讯开源的跨模态3D世界模型,能够从文本、图像和视频中重建和生成3D世界,生成可编辑的3D资产(网格/高斯泼溅),效果与闭源方法相当。

Wonder:更优的视频世界模型

Hugging Face Daily Papers

Wonder是一个通用的视频世界模型,能够从一张图像或条件视频中实现实时、可控制摄像头的世界探索。它通过密集坐标场引入摄像头条件化,采用稀疏注意力记忆机制,并改进蒸馏技术,从而支持以16 FPS生成分钟级的视频。

无限世界与多样交互

Hugging Face Daily Papers

本文介绍了LingBot-World 2.0,一个先进的世界建模系统,具有无界交互范围、实时720p 60fps视频生成、多样化的交互元素(例如攻击、施法),以及通过领航员和导演智能体实现的新型多智能体行为控制,还附带一个共享的多玩家界面。