METAL LAB

Runway发布带声音的可玩世界模型

三天前刚推出能实时绘制屏幕画面的Solaris,这次又拿出了连声音都配上的实时世界模型GWM Worlds 2。这家视频公司为何把重心转向了绘制空间?

Runway发布带声音的可玩世界模型

图片:由 METAL AI 生成

摘要

  • Runway于9月3日以研究预览形式发布了可玩世界模型GWM Worlds 2。
  • 该模型可实时生成720p、24帧的视频以及48,000Hz音频,并支持玩家、导演、智能体三种操控角色。

Runway于9月3日在其研究页面上发布了新的世界模型GWM Worlds 2。公司将其称为"可玩世界模型"——这并非只吐出一段视频的工具,而是能实时绘制出一个可以走进去四处探索的空间的模型。

短短三天内,同一家公司两次把预测帧的技术从视频领域延伸了出去。

720p加声音,这次还能用手操控

据官方介绍,GWM Worlds 2是一个自回归扩散模型,能同时生成720p、24帧的视频和48,000Hz的音频。相比上一版,这次最大的变化就是声音。此前的世界模型生成的世界大多接近无声电影。

会话时长的限制也基本被取消了。官方说明称,模型采用像窗口一样滑动记忆过去帧的方式,因此可以想玩多久就玩多久。

模型参考的信息分为三类:一是建立世界之初给出的描述和第一帧画面;二是当下这一刻的摄像机位置和用户输入的动作;三是仍留在记忆窗口内的过去画面。

三个操控席位

黄昏时分,田野上并排摆放着三把空的折叠椅,朝向同一条地平线
图片:METAL AI 生成

这次发布的核心在于,同一个世界可以从三种不同的角色去操控,这有点像拍摄现场演员和导演各司其职。

玩家以第一人称或第三人称操控角色移动。导演则不是对角色说话,而是对场景本身下指令,比如改变天气或点起篝火,来调整舞台设置。智能体这个席位则是由AI而非人类来驱动角色行动,官方表示这是特意留出的通道,用于机器人仿真或智能体评估。

由于角色分工明确,也可以多人同时进入同一个世界。比如玩家1、玩家2和导演各自拥有自己的操控对象,一同接入同一个世界。演示中使用的是实时传输技术LiveKit。

给世界起名字:World Prompt

车辙横穿雪地山丘,蜿蜒延伸
图片:METAL AI 生成

支撑这套操控体系的格式叫World Prompt。它把世界的状态拆分成了两部分:一部分是定义环境和角色、持续维持不变的Genesis Prompt;另一部分是带有时间戳的事件流。

事件部分是自由撰写的句子,但每句话都会附带"这是对谁说的"标签。就像用对讲机点名呼叫某位演员一样,指定了对象后,即便多人的指令同时叠加也不会混乱。

根据输入速度的不同,官方划分了三种模式:像电影一样提前全部写好再看的模式、像视觉小说一样一回合一回合交替的模式,以及需要在几十毫秒内做出反应的实时模式。据介绍,在实时模式下,由于经过LLM处理会太慢,系统会提前把写好的句子绑定到按键上使用。

创建一个全新的世界同样靠文字完成。官方说明,只要输入类似"雪地风景中第三人称视角的越野摩托"这样的描述,系统就会自动生成第一帧画面、Genesis Prompt以及操作按键。已经拍好的视频也可以放在前面,让模型从那之后接着往下玩。

绘制屏幕的一方与绘制世界的一方

把这两次发布放在一起看,就能看出Runway正在把帧预测技术推向何方——一个是软件界面,另一个是空间。

分类SolarisGWM Worlds 2
绘制对象应用和操作系统界面可行走的三维空间
用户输入点击和拖拽角色操控、场景指令、智能体行动
声音发布中未提及以48,000Hz同步生成
目标场景无代码界面、智能体训练游戏、视频制作、机器人训练

两者根系相同。去年12月11日发布的GWM-1就是这个根,当时Runway将其定位为能实时模拟现实的通用世界模型,并分为Robotics、Avatars、Worlds三条线发布,当时能生成最长2分钟的720p视频。这次的Worlds 2正是在Worlds这一条线上加入声音和操控能力后的后续版本。

目前仍是研究预览

尚未面向公众开放。发布页面明确标注为研究预览,只开放了咨询表单。此次发布中未公布定价或上线时间表。

局限性公司也自行列了出来。实时生成的机制是以画质换取速度,一旦摄像机大幅转动,物体的纹理和质感就会崩坏。此外,模型对很久之前经过的地点也无法准确记忆,除了第一帧画面外无法输入其他参考图像。若要让角色之间进行复杂的互动,还需要借助外部工具的力量。

编辑视角

去年12月看到GWM-1发布时,我还纳闷一家视频公司为什么在谈机器人。九个月后再看Worlds 2,拼图对上了。Runway卖的东西,正在从视频片段变成可操控的空间。

在实际工作中用过AI视频生成工具的团队,应该能立刻感受到这个转变的分量。到目前为止,AI视频最大的痛点在于,如果对某个画面不满意,唯一的办法就是改提示词重新生成一遍。而操控席位一分为三、还能指定对象下达指令之后,不用重新生成,而是可以直接在场景内部修改——比如只改天气,其他部分保持不动。

同一周,World Labs推出了只用几张照片就能生成3D空间的Atlas,这并非巧合。再算上上个月NVIDIA用Cosmos 3拓展物理AI生态,把这些放在一起看,今年下半年的竞争舞台已经不再是更漂亮的一张画面,而是转向了可以走进去的空间。

国内团队现在该准备的不是设备,而是素材。World Prompt这种方式用文字来搭建世界,也用文字来下达行动指令。游戏工作室或视频制作公司手里的世界观设定、角色行为规则、场景指示书,恰好可以直接作为输入使用。已经整理成文档的团队,模型开放的那天就能立刻接入;而那些内容只存在于人脑子里的团队,从现在起就得开始动笔记录了。

玩家、导演、智能体分屏共同操控同一画面的设计,把游戏引擎花了20年才搭建起来的架构,压缩成了几行文字就能实现的方案。Runway把视频公司的下一步,定位成了卖世界的公司。

评论