Native Stereo
在生成视频时,一次性同步生成具有左右立体感的立体声音效,无需事后单独剪辑配音
简单来说
Native Stereo 是一种在生成视频的过程中,同时生成向左右两侧扩散的立体声音效的功能。通常,视频生成 AI 会先生成画面,再单独叠加背景音或音效,采用的是后期配音方式。但 Native Stereo 不把这个过程拆开,而是在一次生成步骤中,把视频和声音一起制作出来。
打个比方,这就像不是先拍摄演员的表演、之后再请配音演员补录台词,而是直接把演员表演时发出的真实声音和现场音一起录下来使用。由于画面中的动作和声音从一开始就是一体生成的,口型和声音错位、方向感不自然等问题会因此减少。
在报道中是这样出现的
文章中提到:“MiniMax H3 可生成最长 15 秒、分辨率为 2K 的视频,并能为视频同步附加 Native Stereo 立体声音效。”这里容易被误解的一点是,这并不是在视频生成后自动挑选并配上音乐的功能。核心在于,视频和声音从一开始就是作为一个整体生成结果同时产出的。
亲手试一试
在向视频生成工具输入提示词时,不只描述画面,也一起写上声音描述,就能体会到这个功能带来的差异。例如可以这样写:
“波浪拍打的海滩,画面中同时能听到左右起伏的海浪声和远处传来的海鸥叫声”
可以观察画面中的海浪从左侧涌来时,声音是否也从左侧开始并逐渐移向右侧,由此判断声音是与视频分开叠加的,还是与视频一同生成的。
