
이미지: METAL LAB 생성
摘要
- MiniMax于8月13日发布开放权重文本转音乐模型MiniMax-Music3
- 仅凭歌词(含分段标签)和结构化说明两项输入,即可一次性生成最长5分钟、32kHz 16位立体声的完整歌曲
- 权重、推理代码以及SGLang-Omni、diffusers、ComfyUI三条运行路径于同日一并开放,可直接投入部署
- 공개일
- 2026년 8월 13일, 오픈웨이트 텍스트투뮤직 모델
- 출력
- 최대 5분 완곡, 32kHz 16비트 스테레오 WAV, 단일 생성
- 핵심 구조
- 8B Global LLM + 0.6B Local LLM(Hybrid-LM) + 2.4B 플로우매칭 + 123M Flow-VAE
- 토크나이저
- 8계층 RVQ, 시맨틱 코드북 16384개 + 어쿠스틱 코드북 7개(각 1024개)
- 실행 경로
- SGLang-Omni(GPU 2장) · diffusers(24GB 이하, 오프로딩 시 8GB) · ComfyUI(FP16/INT8)
- 라이선스
- 상업적 이용 허용, UI에 'MiniMax-Music3' 표시 의무, 연매출 2000만달러 초과 시 서면 승인 필요
- 베이스 모델 불일치
- 모델카드·라이선스는 Qwen3-8B, 미니맥스 리서치 포스트는 Qwen3.5-8B로 표기
一张歌词纸,就能生成完整的5分钟乐曲
制作一首歌通常需要分别经过作曲、编曲、演唱、混音等环节。MiniMax于8月13日发布的MiniMax-Music3将这一流程压缩为一次生成。只需输入带有分段标签的歌词和一段简短描述,即可直接生成最长5分钟的完整歌曲,输出为32kHz、16位立体声WAV文件。权重、推理代码以及三条运行路径在发布当天同步公开,意味着这不是研究演示,而是可以直接投入部署的状态。
MiniMax是一家自主训练文本、图像、视频、语音模型的中国公司,旗下还拥有视频品牌Hailuo和角色聊天应用Talkie。就在8月3日,该公司刚以开放权重形式发布了视频模型H3,证实其可在配备8GB显存的笔记本电脑上生成15秒视频;本月初还发布了编程智能体MiniMax Code 2.0。此次发布的音乐模型正是这一系列动作中的下一步。
歌词与描述文本,仅此两项输入
MiniMax-Music3所需输入只有两项。其一是歌词,每行需标注[Intro]、[Verse]、[Pre-Chorus]、[Chorus]、[Post-Chorus]、[Bridge]、[Instrumental]、[Solo]、[Outro]等分段标签,用以指定歌曲结构。其二是结构化描述文本,分为全局元数据(体裁、氛围等)、人声细节(Vocal Details)、编曲指示(Arrangement)三部分。即便只有简短描述也可以使用,MiniMax同时发布的描述重写智能体技能会将简短语句自动扩展为这套三段式格式。
内部由两个LLM与流匹配模块共同运作
训练所用的分词器采用8层残差矢量量化(RVQ)。第一个语义码本包含16,384个条目,承载歌曲的核心结构;其余7个声学码本各含1,024个条目,用于补充细节音效。在生成阶段,一个8B规模的Global LLM按帧预测第一个码本,把握长程结构;一个0.6B的Local LLM则在每帧内填充其余码本。MiniMax将这两个模型的组合称为Hybrid-LM。
值得关注的是合成阶段。系统并未直接解码离散令牌,而是将两个LLM的最后隐藏状态合并后送入一个2.4B规模的流匹配模块,再由继承自MiniMax Speech的123M Flow-VAE将其还原至潜空间。在推理阶段,离散分词器的解码器本身根本不会被加载。不过基础检查点的说法在文档间存在出入:模型卡与许可协议文档写明Global LLM初始化自Qwen3-8B,而MiniMax研究博客却称其为Qwen3.5-8B,准确版本尚未确定。
如何上手使用
目前已有三条运行路径被文档化。作为参考服务器的SGLang-Omni需要两块GPU,一块负责基于Qwen3的RVQ自回归生成,另一块分别承担流匹配与解码任务。Diffusers模块化流水线在完整精度下可在24GB以下显存运行,启用CPU卸载后约需22GB,若再配合逐层分组卸载,可降至8GB。ComfyUI上则已上线由Comfy-Org重新打包的FP16/INT8权重制作的原生Text to Music模板。
| 运行路径 | 硬件要求 | 特点 |
|---|---|---|
| SGLang-Omni | 2块GPU | 参考服务器,GPU分工明确 |
| diffusers | 24GB以下(卸载后8GB) | 模块化流水线 |
| ComfyUI | FP16/INT8重打包权重 | 提供原生模板 |
若要实际制作歌曲,首先需从Hugging Face或GitHub下载模型与推理代码,并根据自身GPU配置从上述三条路径中选择一种。随后输入带分段标签的歌词与三段式结构化描述,即可在5分钟内生成WAV格式的完整歌曲。如果只有简短描述,建议先用描述重写技能扩展格式,结果会更稳定。游戏背景音乐、广告声音品牌塑造、短视频背景配乐、作曲人草稿曲目制作、基于氛围生成播放列表等以往受限于单曲API成本的大批量生成任务,被认为是该模型的主要应用场景。
商业化使用需要了解的事项
MiniMax-Music3社区许可证允许商业使用,但附带条件。产品界面须显著标注"MiniMax-Music3"字样;使用该模型的产品若年营收总额超过2000万美元,相关机构须获得MiniMax另行出具的书面批准。若向第三方提供生成服务,还需自行构建并维护防止侵权内容产出的安全机制。
编辑观察
此次发布真正值得关注的,不是歌曲时长,而是将整条流水线合而为一的方式。此前大多数AI作曲工具都是分别处理旋律生成、人声合成与混音。MiniMax-Music3虽然生成了离散令牌,却在解码阶段直接舍弃这些令牌,转而将两个LLM的隐藏状态通过流匹配直接输出。这一设计背后的判断是:离散表示虽有助于学习结构,却是生成自然音效的瓶颈。回想同一家公司在视频模型H3中,也是将视频、音频、唇形同步整合进单次推理完成,可以看出MiniMax正把"每种模态三段式流水线简化为一段式"的策略,同样应用到了音乐领域。
以往实际测试开放权重音乐生成模型时,结论往往大同小异:短循环或背景音效果尚可,但一旦是带人声的完整歌曲,常出现段落衔接生硬、发音模糊等问题。此次模型加入分段标签与三段式描述这两层控制机制,原因或许正在于此。不过,需要24GB级GPU才能顺畅运行这一门槛,对个人创作者而言仍是障碍;而将显存需求降至8GB的分组卸载选项实际会牺牲多少速度,仍有待实测验证。
对于国内的游戏公司、广告代理商或短视频内容制作团队而言,目前可以先尝试用于制作демо曲目或替代背景音乐。但年营收超过2000万美元的机构,须提前审视界面标注义务与另行审批流程。要求自行构建防侵权安全机制这一条款也不容小觑——若采用向第三方转售生成服务的SaaS商业模式,这一条款可能会转化为实实在在的运营成本。
预计未来数周内,ComfyUI社区将涌现大量基于该模型的工作流。考虑到MiniMax在视频、编程,如今又到音乐领域,持续快速开放各模态权重的节奏,下一步很可能是将这三款模型整合为统一的创作工具。



