
METAL AI
MiniMax于8月3日以开放权重形式公开了视频生成模型H3。这是该公司首个开放权重的视频模型。同一天,ComfyUI合并了原生支持。
"能在我的电脑上跑"这句话在视频模型领域大多是夸张之词。所以我们亲自试了一下。以下是METAL LAB用一台笔记本电脑制作的成果。没有剪辑,没有配音,也没有做口型校正。
声音是同时出来的。这正是这个模型的核心。
海螺与H3——MiniMax的视频谱系
要理解H3,得先从海螺(Hailuo,海螺)说起。MiniMax是一家2022年从上海起步的AI公司,海螺是该公司旗下的视频生成品牌。其消费级网页应用的地址正是hailuoai.video。MiniMax是公司名,海螺是视频产品线的名称。
| 时间 | 模型 | 特点 |
|---|---|---|
| 2024.08 | video-01(海螺01) | MiniMax首个AI原生视频模型。720p·25fps·最长6秒 |
| 2025.06 | 海螺02 | 原生1080p。参数量增至3倍,训练数据增至4倍 |
| 2025.10 | 海螺2.3 | 动作、表情、物理效果改进。输出无声音 |
| 2026.08 | H3 | 第三代。开放权重+原生立体声音频 |
有两点值得注意。其一,2.3之后有超过9个月没有推出新的视频模型。其二,海螺系列此前一直是无声的,权重也一直未公开。H3一次性打破了这两点。模型名不叫"海螺03"而叫"H3",本身也体现了这种断层。
视频与声音一次性生成
H3的主体是一个33B规模的单流全模态Transformer。文本编码器直接复用Qwen3-VL-32B的权重,并接入其第50层的隐藏状态。视频latent和音频latent由同一个Transformer同时预测。
到目前为止,AI视频流程一直是三段式:用视频模型生成画面,用TTS生成语音,再用口型同步工具对齐嘴型。上面这段视频没有经过这三个步骤。输入参考素材和韩语台词后,一次运行就得到了结果。
官方规格如下。
| 项目 | 数值 |
|---|---|
| 时长 | 4~15秒 |
| 帧率 | 24fps |
| 音频 | 32kHz立体声 |
| 默认分辨率 | 短边768px(2K为单独模块) |
| 台词语言 | 包括韩语在内共11种 |
有两个检查点。FL2VA负责文本生成视频,以及首帧、尾帧条件控制。Ref2VA负责基于参考素材的生成。Ref2VA最多可输入图像9张、视频3个、音频3个(合计12个),并可为每个参考素材指定角色,例如"这是面部""这是声音""这是运镜"。本次测试下载了这两个检查点,分别使用了I2V和R2V工作流。

实测:RTX 4070笔记本,15秒耗时45分钟
| 项目 | 数值 |
|---|---|
| CPU | AMD锐龙AI 9 HX |
| GPU | RTX 4070 Laptop(显存8GB) |
| 系统内存 | 32GB |
| 运行环境 | 本地ComfyUI(I2V·R2V工作流) |
| 模型文件大小 | 约80GB |
| 输出 | 832×480 · 15.1秒 · 24fps · 含立体声音频 |
| 文件大小 | 0.9MB |
| 生成时间 | 约45分钟(1条) |
| 额外成本 | 0元 |
45分钟并不算短,相当于每秒视频耗时3分钟。不过这个数字的意义取决于比较对象。如果在商业服务上生成同样长度的口型同步视频,每次都要付费,而且人脸和声音数据要经过他人的服务器。而本地方案除电费外没有其他成本,素材也不会离开笔记本电脑。
33B模型能在8GB显存上运行,得益于ComfyUI一侧的优化。原本占全部参数约40%的调制权重被剪枝并替换为查找表,再叠加int8 convrot量化和专用内核,将显存占用从全精度的123.6GB降至42.5GB。此外还加入了动态显存卸载机制。ComfyUI方面表示该方案在RTX 3060上也能运行。

安装:先卡在硬盘容量上,而不是显存
| 文件 | 大小 |
|---|---|
| minimax_h3_fl2va_pruned_int8_convrot | 21.0GB |
| minimax_h3_ref2va_pruned_int8_convrot | 21.0GB |
| qwen3vl_32b_minimax_h3_nvfp4_awq(文本编码器) | 15.7GB |
| minimax_h3_video_vae_fp16 | 5.2GB |
| minimax_h3_audio_vae_fp32 | 0.6GB |
仅下载推荐组合就需要63GB。本次测试实际使用的容量约为80GB。
流程很简单。将ComfyUI升级到0.30.0以上,在Workflow → Browse Templates → Video中打开MiniMax H3模板,就会显示所需文件列表。如果没有声音输出,要检查两个VAE是否都已加载,以及VAEDecodeAudio节点是否连接到了SaveVideo。如果追求速度,可以加载Sage Attention,速度大约能提升到两倍。
目前还做不到的事
- 本地无法生成2K视频。 开放发布中只包含生成768p的H3-Base。用于重绘至2K的H3-Regenerate-2K,以及输入预处理系统H3-Context-IR均未公开,只能通过托管API使用。这也是本次成果为832×480的原因。
- 单条视频最长15秒。 超出部分需要拼接。
- 需要自行阅读许可协议。 并非Apache 2.0,而是MiniMax H3 Community License。
- 初期发布仅支持full attention。 训练后期加入的稀疏注意力机制未包含在此次公开版本中。
小结
如果只留下一个数字,那就是这个:显存8GB的笔记本电脑,45分钟,0元。 一条带有声音的15秒视频,就这样做出来了。
