METAL

腾讯开源可生成也可编辑语音的模型

用自然语言下达指令,它就能生成人声,还能改掉情绪和语气。代码和权重以 MIT 许可一并放出,同时还有一个四步就出结果的轻量版。

腾讯开源可生成也可编辑语音的模型

摘要

  • 腾讯混元开源了把语音生成和语音编辑合进同一个模型的 AuK。参数为 15 亿,许可为 MIT,代码和权重同时开放。
  • 自然语言指令加参考音频这一个入口,就能处理零样本合成、内容编辑、情绪与音色变换、降噪与音乐分离等 16 项任务。
  • 训练用了 30.3 亿条指令与音频配对样本和 195 万小时的监督数据,轻量版 AuK-Flash 以四步推理快了约 4.5 倍。
AuK is officially here — an open-source foundation model for unified speech generation and editing

腾讯混元把"造出一个人声"和"修改一个人声"这两件事合进同一个模型,并将它以开源方式放了出来,名字叫 AuK。代码和权重一起传到了 GitHub 仓库,许可是 MIT。参数为 15 亿,跟当下动辄庞大的模型相比属于小的一类。

这次开源真正值得留意的地方,不是性能排名,而是入口被收成了一个。此前做音频这件事,等于不停地换工具:要把句子读成声音得叫语音合成器,要去掉杂音得叫修复模型,要把歌里的伴奏和人声拆开又得叫分离模型。而 AuK 只要给它一句自然语言写的指令和一段参考音频,这些活就在同一个地方办完。该公司在官方账号上把这个模型称作"音频版的 nano banana"。

实际挂在上面的能力有 16 项,归成五类。第一类是语音生成,包括听一小段陌生嗓音就能模仿的零样本合成,以及由指令决定语气的合成。第二类是内容编辑,可以替换录音里说的话,也可以改歌词。第三类是音响编辑,调整音高、语速和音量。第四类是副语言编辑,改情绪和音色、去口音、清掉不是话语的杂声,还能把普通说话变成耳语。第五类是降噪、说话人分离、音乐分离和特定说话人提取。

训练用了多少料,技术报告里写得很清楚:把指令和音频配成对的样本有 30.3 亿条,真正用于训练的监督数据有 195 万小时。研究团队在技术报告里说,这批材料是他们围绕上面那五类任务自行构建的。报告上署名的作者有 33 人。

结构是三块拼起来的。负责抓住话语含义的位置放的是多模态语言模型,负责抓住声音质感的位置放的是同时在人声、通用音频和音乐上训练过的 VAE。在这之上,混合整流流 Transformer 先经过分成两路的模块,再合成一路生成声音。训练顺序也做了切分:先只学生成,再把生成和编辑一起学,收尾阶段则把基于人类偏好的优化挂在编辑一侧,把基于奖励的强化学习挂在生成一侧。

一起放出的轻量版 AuK-Flash,在实际干活时可能更要紧。它是把原模型蒸馏后四步就给出结果,并且把原本用来把结果修得更好看的无分类器引导那一步整个省掉了。研究团队说,在同等条件下测得的挂钟时间比原模型快了约 4.5 倍。改一次要等的时间一旦变短,反复重跑到自己满意为止的工作方式就变得可行。

报告里也照写了没赢下来的地方。研究团队称在零样本合成、基于指令的生成以及用指令做的编辑上取得了领先性能,而在信号层面的修复任务上只写了"保持有竞争力的水平"。也就是说,在去杂音、把断掉的声音救回来这类传统领域,它还没能越过那些专门只做这件事的模型。

对做东西的人来说,条件发生变化的地方在许可。MIT 允许商用,也允许改完再分发,因此可以直接搭进视频剪辑工具或播客服务里。研究团队在报告中写道,他们"公开源代码与模型权重,以支持可复现性与后续研究",权重则同时挂在 Hugging Face 和 ModelScope 上。对于正在琢磨要拿什么填上以前请配音演员或租录音棚那个位置的团队,可以试的选项又多了一个。

同一个市场里也有公司选了相反的路。METAL 曾报道过 Suno 用华纳和 BMG 的正版曲库重新训练 v6,如果说那边走的是把权利关系理清后的封闭式服务,这次开源就站在把权重敞开的另一端。在处理人声的技术里,权利和开放的分界线正变得越来越清晰。

开源的节奏也很紧凑。技术报告 9 月 8 日上了 arXiv,两天后公司官方账号宣布代码、权重和演示都已上线,并请大家试用后反馈。先发论文、权重拖很久才放,这是常见做法;这次三样东西挤在同一周里出来。对使用者而言,这意味着性能主张不只能从文档上读,而是可以拿自己的数据直接跑一遍来核实。以开源方式放出的模型,价值往往不取决于公告里的数字,而取决于这种核实能多快完成。

METAL 核实过的官方介绍视频长 1 分 53 秒,没有人声,只有画面一段接一段。它依次展示输入指令后声音会怎样变化。仓库在开源后不久拿到了 218 颗星。

腾讯混元把造声音和改声音这两件事合到一个界面之后,连权重也一并开放。这次发布的分量,与其说在于多了什么新能力,不如说在于此前需要串起好几个工具才能完成的活,如今在同一个地方用一句指令就能办。接下来要看的有两点:与专做修复的模型之间的差距会不会在下一版收窄,以及把这批 MIT 许可的权重真正装进产品的服务什么时候出现。

评论