Autoregressive Diffusion Model
参考前一个画面来接续绘制下一个画面,同时每个画面本身又从模糊逐渐打磨清晰的一种视频生成方式
简单来说
自回归扩散模型是把两种方法合二为一的视频生成方式:一方面参考前一个画面来逐格接续绘制下一个画面,另一方面每个画面本身都是从模糊的草图逐渐打磨成清晰画面完成的。
可以想象一位画漫画的画师,他先看前一格来决定下一格的构图,而在画每一格时,又反复擦掉、重画草稿,把线条一点点打磨清晰。参考前一格来决定下一格,这是"自回归"的部分;把一格画面从模糊逐渐打磨清晰,这是"扩散"的部分。两者结合起来,画面就能不间断地持续下去,同时每一格的画质也能保持稳定。
这种方式尤其适用于无法提前知道用户何时会做出什么动作的场景。系统不需要提前把一整部影片全部计算好,而是可以只参考当前的摄像机位置或用户输入,即时生成紧接着的下一个画面,因此能够创造出一个没有固定时长限制、可以持续体验下去的空间。
在报道中是这样出现的
文章介绍称,Runway 的 GWM Worlds 2 采用自回归扩散模型,同时生成 720p、24 帧的视频以及 48,000Hz 的音频。人们通常以为扩散模型是一次性生成整段视频的工具,但值得指出的是,这里的模型并非如此:它会像一个滑动窗口一样记住过去的画面,并实时逐帧接续生成,因此会话长度几乎没有上限。
