
摘要
- vLLM-Omni与FastVideo的FastH3结合后,用MiniMax H3生成一段10.1秒的视频(含音频)只需8.7秒。
- 加速方案分两种实现路径:Turbo LoRA(可按请求切换的侧挂模块)与FastH3预览版(加载时融合权重)。
- 两种方式都把去噪迭代压缩到基于5个sigma采样点、仅需4次DiT运算的程度,但在灵活性和速度之间做出了不同取舍。
8.7秒完成一段10.1秒的视频
vLLM项目在9月1日公布的基准测试显示,用MiniMax视频模型H3生成的一段10.1秒MP4——包含与画面同步的音频——只用了8.7秒就完成了。也就是说,生成视频所花的时间已经比这段视频本身的播放时长还要短,这是在vLLM-Omni服务框架之上,叠加FastVideo团队开源的加速方案FastH3后得出的结果。
具体来说,MiniMax H3是一个输入文字或图片后能同时生成画面和声音的视频生成模型,vLLM-Omni则是vLLM项目运营的服务基础设施,用来让这类模型在实际应用中跑得更快。FastVideo团队打造的FastH3是一套开源加速方案,通过减少H3模型的迭代运算次数来提升速度,三者结合,才有了这次的结果。
MiniMax H3,这次因速度再度受到关注
MiniMax H3是今年8月3日以开放权重形式发布的视频生成模型。据METAL LAB此前实测,它的特点是能在一次推理中同时生成画面和32kHz立体声音频,当时在RTX 4070笔记本上生成一段15秒的视频耗时45分钟。同月8日,Luma宣布已将H3接入自家平台Luma Agents。从本地PC运行、云端平台接入,再到如今的服务端加速,短短一个月内,围绕H3的消息不断。
8.7秒是怎么做到的
视频生成模型通常从一片充满噪声的画面出发,反复运行扩散变换器(DiT,一种通过逐步去除噪声来绘制画面的神经网络)多次,才能得到完整的视频。根据vLLM项目公开的资料,这次加速把原本需要多轮迭代的过程,压缩成基于5个噪声强度采样点(sigma点)、仅需4次DiT运算的少步(few-step)方案,并且用两种不同方式实现了这一压缩。
第一种是"Turbo LoRA"方案。它利用LoRA——一种不训练整个模型、只训练一小块附加模块的低成本微调方法——保持基础权重(W)不变,每次请求进来时再挑选并挂载一小块名为A/B的侧挂模块。用公式表示就是y=Wx+B(Ax);如果采用DLO配置,基础模块会被流式加载,只有A/B缓冲区常驻在加速器上。
第二种是FastVideo团队推出的"FastH3预览版"。这种方式在模型加载阶段就直接把权重合并成一体——预先算出融合权重W*=W+BA+Δ,在分片之前就完成融合,之后所有请求都统一使用这套固定的四步权重。这样做速度更快,但代价是无法针对不同请求切换适配器,vLLM项目也表示目前尚不支持VSA变体或权重卸载(offload)。

两种方案,异同在哪
| 项目 | Turbo LoRA | FastH3预览版 |
|---|---|---|
| 权重合并时机 | 按请求(动态) | 模型加载时(固定) |
| 服务器形态 | 通用服务器+侧挂模块 | 专用服务器 |
| 支持模式 | FL2VA / T2VA | 仅T2VA(密集模式) |
| 按请求切换 | 支持 | 不支持 |
| 权重卸载 | 通过DLO支持基础模块流式加载 | 不支持 |
这张表整理自vLLM-Omni项目的PR #6476(Turbo)、#6550(Turbo+DLO)、#6714(FastH3预览版)中分别标注的内容。两种方案的目标一致——用4次DiT运算完成视频生成,只是抵达这个目标的路径上,各自在灵活性和速度之间做了不同取舍。
编辑视角
这次基准测试真正值得关注的,与其说是8.7秒这个数字本身,不如说是它是怎么被做出来的。视频生成模型此前普遍给人的印象是"慢没关系,画面出得来就行",但这次服务层(vLLM-Omni)和模型层(FastH3)分别用不同方式实现了四步压缩,才做出了接近实时的速度。Turbo LoRA选择了灵活性,FastH3则选择了速度,这种取舍在LLM服务领域早已是熟悉的套路——适配器切换的灵活度和响应速度之间,向来是此消彼长的关系,如今视频生成也原样继承了这套取舍逻辑。
上个月亲眼见证RTX 4070笔记本生成15秒视频要花45分钟,再对比这次的结果,完全是不同量级的差距。运行在本地PC上的模型,和经过少步蒸馏、部署到服务器级基础设施上的模型,速度差距正在急剧拉大。如果国内团队想把视频生成流程真正用到实际业务里,首先要想清楚的是:直接把开放权重模型部署到本地,还是使用这类经过服务端优化的接口——因为同一个模型,服务方式不同,实际体验到的速度会完全不一样。
FastH3预览版目前还不支持按请求切换适配器和权重卸载,这不算是缺陷,更应该看作是现阶段的产品定位。先用一套固定的专用服务器验证效果,再在后续阶段补上灵活性,这种推进顺序在开源服务项目中很常见。接下来几周内,FastH3很可能会补上VSA支持和权重卸载能力,或者这套少步压缩技术被移植到其他开源视频模型上的情况也不无可能。





评论