每天早晨,用三行读完全球 AI 动态浏览品牌目录

METAL LAB

在RTX 4070笔记本上运行MiniMax H3

METAL LAB亲自在笔记本电脑上运行了8月3日以开放权重形式发布的MiniMax H3。视频和语音在一次推理中同时生成,一条832×480、时长15秒的视频耗时45分钟。以下原样呈现生成结果。

METAL AI

MiniMax于8月3日以开放权重形式公开了视频生成模型H3。这是该公司首个开放权重的视频模型。同一天,ComfyUI合并了原生支持。

"能在我的电脑上跑"这句话在视频模型领域大多是夸张之词。所以我们亲自试了一下。以下是METAL LAB用一台笔记本电脑制作的成果。没有剪辑,没有配音,也没有做口型校正。

声音是同时出来的。这正是这个模型的核心。

海螺与H3——MiniMax的视频谱系

要理解H3,得先从海螺(Hailuo,海螺)说起。MiniMax是一家2022年从上海起步的AI公司,海螺是该公司旗下的视频生成品牌。其消费级网页应用的地址正是hailuoai.video。MiniMax是公司名,海螺是视频产品线的名称

时间模型特点
2024.08video-01(海螺01)MiniMax首个AI原生视频模型。720p·25fps·最长6秒
2025.06海螺02原生1080p。参数量增至3倍,训练数据增至4倍
2025.10海螺2.3动作、表情、物理效果改进。输出无声音
2026.08H3第三代。开放权重+原生立体声音频

有两点值得注意。其一,2.3之后有超过9个月没有推出新的视频模型。其二,海螺系列此前一直是无声的,权重也一直未公开。H3一次性打破了这两点。模型名不叫"海螺03"而叫"H3",本身也体现了这种断层。

视频与声音一次性生成

H3的主体是一个33B规模的单流全模态Transformer。文本编码器直接复用Qwen3-VL-32B的权重,并接入其第50层的隐藏状态。视频latent和音频latent由同一个Transformer同时预测

到目前为止,AI视频流程一直是三段式:用视频模型生成画面,用TTS生成语音,再用口型同步工具对齐嘴型。上面这段视频没有经过这三个步骤。输入参考素材和韩语台词后,一次运行就得到了结果。

官方规格如下。

项目数值
时长4~15秒
帧率24fps
音频32kHz立体声
默认分辨率短边768px(2K为单独模块)
台词语言包括韩语在内共11种

有两个检查点。FL2VA负责文本生成视频,以及首帧、尾帧条件控制。Ref2VA负责基于参考素材的生成。Ref2VA最多可输入图像9张、视频3个、音频3个(合计12个),并可为每个参考素材指定角色,例如"这是面部""这是声音""这是运镜"。本次测试下载了这两个检查点,分别使用了I2V和R2V工作流。

笔记本散热口冒出的热气——45分钟内GPU持续满载运转

实测:RTX 4070笔记本,15秒耗时45分钟

项目数值
CPUAMD锐龙AI 9 HX
GPURTX 4070 Laptop(显存8GB)
系统内存32GB
运行环境本地ComfyUI(I2V·R2V工作流)
模型文件大小约80GB
输出832×480 · 15.1秒 · 24fps · 含立体声音频
文件大小0.9MB
生成时间约45分钟(1条)
额外成本0元

45分钟并不算短,相当于每秒视频耗时3分钟。不过这个数字的意义取决于比较对象。如果在商业服务上生成同样长度的口型同步视频,每次都要付费,而且人脸和声音数据要经过他人的服务器。而本地方案除电费外没有其他成本,素材也不会离开笔记本电脑。

33B模型能在8GB显存上运行,得益于ComfyUI一侧的优化。原本占全部参数约40%的调制权重被剪枝并替换为查找表,再叠加int8 convrot量化和专用内核,将显存占用从全精度的123.6GB降至42.5GB。此外还加入了动态显存卸载机制。ComfyUI方面表示该方案在RTX 3060上也能运行。

外置硬盘——本地运行H3仅模型文件就需要60~80GB

安装:先卡在硬盘容量上,而不是显存

文件大小
minimax_h3_fl2va_pruned_int8_convrot21.0GB
minimax_h3_ref2va_pruned_int8_convrot21.0GB
qwen3vl_32b_minimax_h3_nvfp4_awq(文本编码器)15.7GB
minimax_h3_video_vae_fp165.2GB
minimax_h3_audio_vae_fp320.6GB

仅下载推荐组合就需要63GB。本次测试实际使用的容量约为80GB。

流程很简单。将ComfyUI升级到0.30.0以上,在Workflow → Browse Templates → Video中打开MiniMax H3模板,就会显示所需文件列表。如果没有声音输出,要检查两个VAE是否都已加载,以及VAEDecodeAudio节点是否连接到了SaveVideo。如果追求速度,可以加载Sage Attention,速度大约能提升到两倍。

目前还做不到的事

  • 本地无法生成2K视频。 开放发布中只包含生成768p的H3-Base。用于重绘至2K的H3-Regenerate-2K,以及输入预处理系统H3-Context-IR均未公开,只能通过托管API使用。这也是本次成果为832×480的原因。
  • 单条视频最长15秒。 超出部分需要拼接。
  • 需要自行阅读许可协议。 并非Apache 2.0,而是MiniMax H3 Community License。
  • 初期发布仅支持full attention。 训练后期加入的稀疏注意力机制未包含在此次公开版本中。

小结

如果只留下一个数字,那就是这个:显存8GB的笔记本电脑,45分钟,0元。 一条带有声音的15秒视频,就这样做出来了。