介绍 Solaris(阅读时间约 17 分钟)

TLDR AI 模型

摘要

Runway 发布 Solaris,这是其 Interface World Models 系列中的首个 AI 模型,它通过直接合成帧来生成实时交互界面,无需编码,并支持动态设计和智能体训练。

Solaris 是一个 Interface World Model。它可以随着用户的交互,逐帧生成实时交互界面。Solaris 共同处理渲染和交互,生成每一帧和对用户输入的每一个响应,消除了对中间表示的需求。该模型为构建网站、应用程序和其他在线界面开辟了新途径。它还可用于在更动态的环境中训练智能体。
查看原文
查看缓存全文

缓存时间: 2026/09/01 23:40

# Runway 新闻 | 介绍 Solaris 来源:https://runway.com/news/research/introducing-solaris 介绍 Solaris 今天,我们分享 **Solaris**:这是我们称之为**界面世界模型**的全新 AI 系统家族中的首个模型。Solaris 从一个核心问题出发:**当操作系统在你使用时实时生成应用程序和网站,会发生什么?** 从早期终端到 Linux 和 macOS,每个操作系统都决定了屏幕上显示什么以及当人或程序对其操作时会发生什么。应用程序建立在这个层之上,并保持固定,直到有人推送更新。Solaris 则直接渲染这个层。它是一个实时交互模型,逐帧生成界面本身。每一帧都在你交互时合成,允许界面对你的操作做出持续响应。 设计比以往任何时候都更加视觉化,像素级完美的原型和图像模型可以生成与最终产品几乎无法区分的整个屏幕图像。但图像无法像网站或应用那样运行。当今构建的每个软件仍需要一个转换过程:视觉设计必须首先转换为中间表示(例如代码),然后才能发挥作用。 这种中间表示限制了界面的可能性及其对人类和智能体交互的响应方式。每个行为都必须提前明确定义和实现,因此软件的发布是对所有可能交互空间的一种有损压缩,在任何用户到来之前就已固化。同样的转换过程也牺牲了视觉保真度。一旦设计被简化为一种表示,界面可以快速响应,但代价是失去了原始设计的丰富细节。 Solaris 共同处理渲染和交互,消除了我们今天在设计中所面临的许多权衡。一个世界模型生成每一帧以及对用户输入的每一个响应,从而消除了对中间表示的需要。因为没有转换步骤,就没有信息损失,整个帧即成为界面本身。 我们认为 Solaris 为构建网站、应用和其他在线界面开辟了新的途径。但它也是在动态环境中训练智能体的一种新方式。即使是当今最好的大语言模型也难以完成(https://arxiv.org/abs/2606.29537)基本的计算机使用任务,比如预订酒店或购买杂货。因为基于文本的模型被训练来使用编码的界面,它们倾向于学习所训练的特定布局,无法适应略有不同的界面(例如,两个不同的酒店网站)。通过压缩动作与响应之间的空间,Solaris 让智能体得以在不断变化、布局可能从未存在过的界面上进行训练。 #### **新特性** Solaris 为软件带来了三项新能力。 首先,Solaris 完全基于视觉。当图像本身成为应用程序时,就不需要用户所见视觉效果之下隐藏的第二实现步骤。想象一下浏览一个虚拟服装店,其展厅本身就是界面。使用你自己的单张图像作为参考,你可以从衣架上拿起一件衬衫,拖到自己身上试穿,或像在实体店一样自然地重新布置展示。 其次,它是“活的”。因为应用程序是连续渲染的,它总是在演进,而不是等待用户的下一个动作。反射随光照变化,物体在被操作时自然响应。用户可以简单地说:“移动桌子,让我看看它看起来如何”或者“改变**沙发的颜色**”。结果就是,软件感觉不像在导航预先编写的页面,更像在与一个活生生的环境交互。 即使是相同的起始帧——这里是一只手的X光图像——对相同的拖拽操作也可能以两种完全不同的方式响应。 最后,它是开放式的。传统界面仅限于开发者在开发过程中预设的交互,但 Solaris 可以在同一场景中支持完全不同的行为,实时响应用户交互。这种灵活性将界面从预定义的工作流中解耦出来,转而由驱动世界模型的能力来决定什么是可能的。 Solaris 将界面转化为一种交互体验,而非一系列页面的序列。用户不再从菜单中选择选项,而是直接与场景本身交互。制作沙拉就像将食材拖入碗中一样简单,界面会随着每种食材的添加而自然响应。 今天,当人们在网上遇到困难时,会求助于大语言模型。但大语言模型用文本回答,而大多数实际操作任务并非基于文本的问题。Solaris 在你的上下文中用视觉渲染下一步,并且你可以引导它。例如,你可以生成一个燃烧过程的交互式演示,允许用户尝试不同的材料,并观察他们在交互时物理上可信的反应。 #### **为何此前不存在?** 数字界面建立在两个系统之上,直到现在,它们仍生活在不同的世界里。 - 那些“知道事物”的系统(例如,搜索引擎和AI助手)用静态内容回答:文本、一张图片,或者可能是一个嵌入的视频。 - 那些能实时响应的系统(例如,JavaScript/CSS、游戏引擎以及最近的交互式世界模型)创建了丰富的、交互式的体验,但它们对你的产品、你的任务或你试图完成的事情一无所知。 我们传统上将软件界面视为确定性程序,而世界模型是视觉内容的生成器。界面世界模型必须同时兼具两者:一个理解你的意图,同时持续在其周围渲染交互世界的系统。 一旦你尝试构建这样一个系统,三个工程挑战立刻显现: - **速度。**交互在大约半秒延迟时就会失去交互感(https://runway.com/news/engineering/building-runway-characters)。视频扩散模型需要几秒或几分钟来生成一段视频片段,这对内容创作来说可以接受,但对于界面而言则太慢了。要跨越这个阈值,模型必须顺序生成帧,每帧仅依赖于前一帧,并且要足够廉价以跟上用户的操作。 - **保持一致性。**界面必须在整个会话期间保持一致,而不仅仅是一个片段。它需要保持的东西(例如,文本、布局、对象的身份)正是生成视频历来难以维持的,而且随着生成持续,小错误会不断累积。 - **成本。**生成每一帧仍然比提供一个构建一次的页面成本更高。使 Solaris 实时运行的同一项工作,也使其运行成本比标准视频扩散模型降低了几个数量级,而且成本曲线仍在持续改善。 Solaris 是我们对克服这些概念和技术障碍的押注。我们构建它时聚焦于三个方面:实时交互、整个会话的一致性,以及在720p分辨率下保持的视觉质量。 #### Solaris 如何工作 Solaris 基于我们的 Gen-4.5(https://runwayml.com/research/introducing-runway-gen-4.5)视频生成模型构建,我们对其进行了适应性修改,使其(1)理解交互并(2)实时响应。它遵循了我们通过 GWM-1(https://runwayml.com/research/introducing-runway-gwm-1)——我们的通用世界模型——所开辟的路径。 **学习交互。** Solaris 将用户输入视为下一帧的条件,就像它处理文本或图像一样。模型在生成过程中观察点击、拖拽和其他交互,将它们作为下一步操作的信号。因为模型只看到已经发生的交互(从未预见过未来的),它学习到了用户动作与视觉结果之间的关系。这意味着它知道当某物被点击、拖拽或修改时应该发生什么,而无需显式编程这些交互。 **实时运行。** 标准的视频扩散模型在几十个去噪步骤中精炼整个片段,这个过程对于动态用户交互来说太慢了。我们通过三个阶段将 Solaris 转换为实时引擎。首先,我们教它自回归生成帧,每帧仅依赖于前一帧。接下来,我们将多步去馏过程精炼为仅仅几步。最后,我们在模型自身的输出上训练这个快速模型,使视觉质量在长时间交互中保持稳定。结果是以交互速度生成帧,同时保留了原始教师模型的视觉质量。 **推理与渲染。** Solaris 逐帧生成界面,而一个大语言模型决定这个界面如何演进。大语言模型解释用户请求,决定交互何时应修改当前场景与何时应切换到新场景,定义使世界感觉“活”的行为,并生成指导 Solaris 渲染每个状态的提示。大语言模型和世界模型共同将推理与渲染分离:一个决定应用程序下一步应该做什么,另一个生成该行为如何实时出现和响应。 **持续生成。** 你提供一个起始状态(例如一个品牌环境或产品场景),模型实时流式传输帧。当用户点击、拖拽或输入时,这些交互被纳入下一帧的生成中,场景在原位响应。没有预定义的屏幕,也没有可以依赖的模板。相反,文本提示指定了在特定场景中点击、拖拽和其他交互的含义。 **重新定义鼠标。** 一旦交互通过自然语言描述而非编程定义,它们就不必是预先固定的。场景中的每个对象都可以成为一种新的工具。点击一只猫,你的下一次点击就会将它的毛色和纹理应用到你接触到的任何东西上。点击一幅画,你可能开始以它的风格进行绘画。 #### 评估 Solaris **转换的成本** 早些时候,我们认为将界面转换为中间表示不可避免地会降低信息保真度。为了量化这种信息损失,我们测试了当今多模态语言模型从截图重建界面的忠实程度。 一个简单的产品网页与其由GPT-4o、Gemini 2.5 Pro和Fable 5重建的版本并列 一个图像丰富的活动海报与其由GPT-4o、Gemini 2.5 Pro和Fable 5重建的版本并列 一张厨房场景的自然照片与其由GPT-4o、Gemini 2.5 Pro和Fable 5重建的版本并列 为了测量这一点,我们评估了包括Claude Fable 5在内的最先进的多模态语言模型在从单张截图重建网站界面任务上的表现。我们在30个多样化的界面上进行评估,从简单的纯网页到图像丰富的网页和自然图像,这些界面评估了视觉理解的不同方面。 我们通过两种互补的方式来测量信息保留。首先,**结构相似性(SSIM)**将重建的界面与原始界面在原位进行比较,捕捉视觉外观被再现的忠实程度。其次,我们使用DINOv3特征将原始图像的每个区域与重建中任意位置最相似的区域进行比较,衡量即使元素移动或布局改变,底层视觉内容是否得以保留。 ***随着视觉复杂度增加的重建保真度。**即使多模态语言模型持续进步,随着视觉复杂度增加,重建质量始终下降,揭示了通过语言转换界面时丢失的信息。* 尽管近年来进展迅速,每个语言模型在重建过程中都会丢失信息。自然图像受影响最大,因为丰富的视觉细节无法在语言中准确表示。随着界面变得更复杂,即使对文本、布局或结构的小幅修改也会从根本上改变界面的行为方式。 Solaris 不是将界面转换为语言再重建,而是直接操作视觉界面本身。通过消除中间表示,它从第一帧起就保留了界面的完整视觉和语义状态。 **Solaris 与编码界面对比** 我们的重建基准测试衡量了将界面转换为代码时丢失了多少信息。接下来我们问:给定相同的界面和相同的用户交互,哪种方法能产生更好的结果?编码界面能否重现由界面世界模型生成的那种活生生的、响应式环境的感觉? 点击任何元素会使其脱离并缓慢向上漂浮,悬浮时保持其形状。 摄像机从灯塔阳台进行一次流畅、连续的向右平移和向下倾斜,最终定格在下方冲击岩石海岸的海浪上。 ***对比。**虽然两个系统对相同的交互请求都做出了响应,但 Solaris 保留了整个场景的一致性,产生的交互感觉更自然、更符合物理规律。* 为了回答这个问题,我们将 Solaris 与一个最先进的语言模型(Claude Opus 5)进行了比较。两个系统从相同的图像开始,接收相同的交互请求,我们记录了每个系统的响应。然后,我们在30个交互示例上对250名参与者进行了一项用户研究,收集了近7500个成对判断。对于每个比较,参与者回答两个问题:“哪个结果更好地遵循了给定指令?”以及“哪个在场景中的行为更自然?” 参与者在两个指标上都更倾向于 Solaris。对于遵循请求的交互,Solaris 在61%的比较中被偏好,而编码结果只有24%,13%被认为相当。对于自然行为,差异更大,Solaris 在71%的比较中被偏好,编码网站只有21%,6%被认为相当。 第二个结果凸显了两种方法之间的更广泛差异。编码界面通常可以重现请求的更改,但它将交互视为界面的孤立更新。而对于界面世界模型,因为模型已经理解物体、材料和环境的行为方式,它可以生成在场景内感觉连贯的交互,而不是将每个UI操作视为一个孤立的元素。 #### **当前局限** Solaris 在环境运动、点击拖拽交互和场景转换方面表现最强。仍有一些重要挑战: - **文本。**稳定、清晰的文本仍然是视频生成中最难的问题之一,但界面几乎比任何其他视觉领域都更依赖它。一个实际可行的路径是混合系统:当短暂的停顿可以接受时,用图像模型渲染文字密集的视图,而用视频模型处理连续交互。完全实时生成的文本仍是一个开放挑战。 - **信任度。**对于教学或商业体验,一个看似可信的错误答案比没有答案更糟糕。目前,Solaris 通过你提供给它的内容保持锚定。起始帧可以由真实产品图像和参考资料组合而成,这使场景扎根于实际存在的事物。在会话展开过程中,利用更丰富的验证上下文(参考图像、产品数据、文档)来条件化生成,是一个活跃的研究重点。 - **长会话。**在扩展、开放式交互中保持视觉和语义一致性仍是一个活跃的研究领域。 - **准确

相似文章