每天早晨,用三行读完全球 AI 动态浏览品牌目录

METAL LAB

audio.cpp 0.5发布:支持表现力TTS与跨语言音色迁移

新增7款模型支持,并加入ROCm/HIP支持。本地语音技术栈正在变厚。

프로젝트
audio.cpp
버전
Release 0.5
추가 기능
DramaBox 표현형 TTS · Confucius4 교차언어 음성 전이
모델
7종 추가 지원
백엔드
ROCm/HIP 지원 포함

audio.cpp 0.5发布了。表现力TTS(DramaBox)和跨语言音色迁移(Confucius4)加入其中,同时新增了7款支持模型和ROCm/HIP后端。

这意味着本地运行的语音技术栈又厚了一层。对于需要处理无法发送到云端API的语音的组织来说,选择变多了。

这两项功能改变了什么

表现力TTS不再只是照本宣科地朗读文本,而是能承载情感和语调。此前因合成音过于平淡而无法使用的场景——旁白、有声书、角色配音——由此打开了大门。

跨语言音色迁移能将用一种语言录制的声音特征迁移到另一种语言的发声上。这意味着用同一说话人制作多语言版本的工作可以在本地完成。在多语言配音中保持说话人一致性,是它最大的用处。

新增项目实际应用场景
DramaBox 表现力TTS旁白 · 有声书 · 角色配音
Confucius4 跨语言音色迁移多语言配音,保持说话人一致性
新增支持7款模型在质量、速度、容量之间选择更多
ROCm/HIP后端在AMD GPU上本地运行
工作室桌面上的模拟调音台
工作室桌面上的模拟调音台

ROCm支持才是低调的核心

此前,本地语音技术栈实际上一直被锁定在特定的GPU生态圈内。ROCm/HIP路径打开后,使用AMD显卡的环境也能运行同样的流程。

硬件选择变多,也意味着采购单价会下降。语音合成对内存的需求比大语言模型小,很多情况下用中高端消费级显卡就足够。一旦不再挑显卡型号,买有货的就行。

本地运行更有利的情况

条件本地云端API
原始语音不能对外发送
大量批处理成本急剧上升
需要即时响应的对话场景视设备而定网络延迟
少量、间歇性使用过度投入
始终想要最新品质更新负担

如果存在不能外泄的语音,比如内部会议记录、咨询录音、未公开内容,本地运行实际上是唯一的答案。

使用前应确认的事项

  1. 声音权利。 跨语言迁移会迁移真实说话人的音色特征。如果使用未经本人同意的声音作为源材料,会构成法律问题。即便是内部使用,最好留存同意文件。声优、播音员的音源还要另外确认合同中是否有关于合成使用的条款。
  2. 告知义务。 在内容中使用合成语音时,各平台的标注规定有所不同。广告、政治类内容的标准更为严格。
  3. 许可协议。 新增的7款模型各自的条款可能不同。是否可用于商业用途需要在模型卡中逐一确认。
  4. 质检流程。 表现力TTS存在语调过度承载的失败模式。如果省略人工试听最终版本这一步骤,就会出问题。

小结

本地语音技术栈变厚的趋势本身仍在持续。此刻需要关注的重点不在技术,而在流程。提前理清声音来源的权利关系,在公司内部建立标注合成内容的标准,即便工具更迭,这些做法依然适用。

来源:r/LocalLLaMA发布帖。详细规格请参考项目仓库。