单流全模态transformer
single-stream omni transformer
一种架构:不再分别制作画面和声音,而是由同一个神经网络一次性同时生成视频和音频。
简单来说
单流全模态transformer指的是由一个AI同时生成画面与声音的结构。以往的AI视频生成大多要经过三个步骤:一个工具负责画画面,一个工具负责生成声音,还有一个工具负责让口型对上声音,三者依次拼接完成。单流全模态transformer就是把这三个工具合并成了一个。
打个比方:原来的方式就像演员先拍无声电影,配音演员之后再录音,最后剪辑师把配音对上口型硬凑进去。而单流全模态transformer更像是演员边唱边演的现场实拍——画面和声音从一开始就在同一次运算中一起诞生,事后不需要再对齐。
因此,用这种结构生成的视频,说话声与口型无需额外的后期对口型处理就能自然对上。但代价是制作难度更高,因为必须把负责视频的神经网络和负责音频的神经网络合并成一个。
在报道中是这样出现的
文章在介绍MiniMax H3时提到:"其主体是一个33B规模的单流全模态transformer,由同一个transformer同时预测视频latent和音频latent。"一个常见的误解是把这理解成"在视频模型上加装了一个音频模块"。但实际上,这不是两个独立的模型,而是由一个神经网络同时计算出视频和声音。
