METAL LAB

Runway发布Solaris,每次点击都重新生成画面

Runway推出"界面世界模型",无需代码即可按帧实时生成用户界面

摘要

  • Runway于8月31日发布了新程序"Solaris"
  • 它不依赖预先写好的代码或布局,而是根据每次点击、拖拽按帧实时生成画面
  • Runway称在生成新界面方面,该模型在结构相似度和信息保留两项指标上都超过了前沿大语言模型
Introducing Solaris our first Interface World Model | Runway

每次点击都会重新绘制画面

Runway官网

image.png用户的一次点击通过虚线箭头作为信号传递给名为Solaris的循环引擎,Solaris又通过虚线双向箭头与画面相连。画面并非由预先设定的代码生成,而是每次都重新生成,其结果又反过来影响下一次点击,形成一个循环结构。用户的一次点击通过虚线箭头作为信号传递给名为Solaris的循环引擎,Solaris又通过虚线双向箭头与画面相连。画面并非由预先设定的代码生成,而是每次都重新生成,其结果又反过来影响下一次点击,形成一个循环结构。

根据Runway的介绍,Solaris不是把界面用代码预先写好,而是在用户每次点击或拖拽画面时,把相应的反应按帧实时绘制出来。Runway将这款程序称为全球首个"界面世界模型"(Interface World Model)。

具体来说,世界模型原本是视频生成AI用来预测下一个画面走向、进而逐帧作画的技术。Runway把预测的对象从视频换成了电脑画面,把用户的点击或拖拽当作"下一屏该如何变化"的信号来使用。

传统软件需要设计者事先写好代码,规定按下某个按钮后画面该跳转到哪里,而Solaris则彻底去掉了这套预先设计的蓝图。Runway发布的介绍视频用一句话概括了这种方式——"图像本身就是应用程序"。

把视频生成技术搬到画面生成上

世界模型最初是在视频、图像生成AI领域发展起来的技术,用来预测下一个场景并生成对应帧。METAL LAB此前在8月的一篇报道中也提到,Sora、Genie 3等世界模型被用于模拟物理状态的案例。而Runway把同样的概念用在了不同的预测对象上——不是视频帧,而是电脑画面本身。用户的每一个动作都决定着下一屏画面的样子。

点击不是指令,而是"下一屏的信号"

Runway把Solaris处理点击和拖拽的方式,类比为视频生成模型处理文本的方式。就像视频模型不会把文字当作要去查找的指令,而是当作绘制下一个场景的信号一样,Solaris也把用户的操作当作生成下一帧的信号,而不是数据库查询指令。Runway解释说,正因如此,系统里并不存在预先设定好的画面状态,即便是相同的操作,也可能因情境不同而生成不一样的画面。

项目传统软件Solaris
画面生成方式调用预先写好代码固定的画面每次点击按帧实时生成
布局由开发者事先设计无预设布局,图像本身即画面
用户输入处理方式解析为固定指令解析为生成下一帧的信号
homepage og card v3

性能方面的主张与在智能体训练上的应用

Runway表示,在生成新界面的任务中,Solaris在结构相似度和信息保留两项指标上都超过了前沿大语言模型。公司还表示,Solaris不仅会改变人类使用界面的体验,还为AI智能体学习操作画面开辟了新的方式。按照Runway的展望,今后将不再需要固定的、预先渲染好的操作系统和画面结构。

目前可以申请的内容

Runway在发布页面上表示正在接受Solaris的抢先体验申请。具体的上线时间、价格和支持平台在此次发布中均未公布,目前只公开了通过申请获得使用资格的流程。

编辑视角

继上个月推出把SDR视频转换为播出级HDR的Ruby之后,Runway这次把生成的对象从视频换成了软件本身。方向已经很清晰——公司把长期积累的帧预测技术,从视频领域延伸了出去。当其他公司还在琢磨用大语言模型写代码来完成画面时,Runway选择跳过写代码这一步,直接生成画面本身。

如果你曾在实际工作中用过视频生成模型,这种方式应该不会陌生。结果每次都会有细微差别,与此同时,也很难强制维持一套固定的流程。像登录页面或支付流程这类必须做到分毫不差、每次都完全一致运行的场景,这种生成方式反而可能成为负担。

对国内的产品策划人员或初创公司来说,有两点值得留意。一是在原型设计阶段,用它快速产出多套不同方向的界面草案,这一点相当有吸引力;二是要真正用到生产环境里,恐怕还为时尚早。因为画面每次都略有不同这一特性本身,就使得现有的QA和无障碍测试方式无法照搬使用。

它的产出能否超越原型级别,将是检验这项技术真正价值的第一道考验。

评论