매일 아침, 세계 AI 소식을 한국어 3줄 요약으로브랜드 디렉터리 보기

METAL LAB

audio.cpp 0.5 공개…표현형 TTS와 교차언어 음성 전이까지

모델 7종이 추가되고 ROCm/HIP 지원이 들어갔다. 로컬 음성 스택이 두꺼워지고 있다.

요약

  • audio.cpp 0.5가 공개되며 표현형 TTS와 교차언어 음성 전이 기능이 들어갔다.
  • 모델 7종이 추가로 지원되고 ROCm/HIP 백엔드도 포함됐다.
  • 로컬에서 돌리는 음성 생성 스택의 선택지가 넓어지는 흐름이다.
프로젝트
audio.cpp
버전
Release 0.5
추가 기능
DramaBox 표현형 TTS · Confucius4 교차언어 음성 전이
모델
7종 추가 지원
백엔드
ROCm/HIP 지원 포함

audio.cpp 0.5가 나왔다. 표현형 TTS(DramaBox)와 교차언어 음성 전이(Confucius4)가 들어갔고, 지원 모델 7종과 ROCm/HIP 백엔드가 함께 추가됐다.

로컬에서 돌리는 음성 스택이 한 단계 두꺼워졌다는 뜻이다. 클라우드 API로 보낼 수 없는 음성을 다뤄야 하는 조직에는 선택지가 늘었다.

두 기능이 무엇을 바꾸나

표현형 TTS는 문장을 그냥 읽는 것을 넘어 감정과 억양을 싣는다. 기존 합성음이 밋밋해서 쓰지 못했던 용도 — 내레이션, 오디오북, 캐릭터 보이스 — 가 열린다.

교차언어 음성 전이는 한 언어로 녹음된 목소리의 특성을 다른 언어 발화에 옮긴다. 같은 화자로 여러 언어 버전을 만드는 작업이 로컬에서 가능해진다는 뜻이다. 다국어 더빙에서 화자 일관성을 유지하는 것이 가장 큰 쓸모다.

추가 항목실무에서의 쓰임
DramaBox 표현형 TTS내레이션 · 오디오북 · 캐릭터 보이스
Confucius4 교차언어 음성 전이다국어 더빙, 화자 일관성 유지
지원 모델 7종 추가품질·속도·용량 사이의 선택지 확대
ROCm/HIP 백엔드AMD GPU에서의 로컬 구동
스튜디오 데스크의 아날로그 믹서
스튜디오 데스크의 아날로그 믹서

ROCm 지원이 조용한 핵심

로컬 음성 스택은 그동안 사실상 특정 GPU 생태계에 묶여 있었다. ROCm/HIP 경로가 열리면 AMD 카드를 쓰는 환경에서도 같은 파이프라인을 돌릴 수 있다.

하드웨어 선택지가 늘어난다는 건 조달 단가가 내려간다는 뜻이기도 하다. 음성 합성은 대형 언어 모델보다 메모리 요구가 작아서, 상급 소비자 카드로도 충분한 경우가 많다. 카드 종류를 가리지 않게 되면 재고가 있는 것을 사면 된다.

로컬로 돌리는 게 유리한 경우

조건로컬클라우드 API
원본 음성을 외부로 못 보냄
대량 배치 처리비용 급증
즉시 응답이 필요한 대화형장비에 따라네트워크 지연
소량·간헐적 사용과투자
최신 품질을 항상 원함업데이트 부담

사내 회의록, 상담 녹취, 미공개 콘텐츠처럼 밖으로 나가면 안 되는 음성이 있으면 로컬이 사실상 유일한 답이다.

쓰기 전에 확인할 것

  1. 목소리 권리. 교차언어 전이는 실존 화자의 음성 특성을 옮긴다. 본인 동의 없는 목소리를 소스로 쓰면 법적 문제가 된다. 사내 사용이라도 동의 문서를 남겨 두는 편이 낫다. 성우·아나운서 음원은 계약서에 합성 활용 조항이 있는지 별도로 봐야 한다.
  2. 고지. 합성 음성을 콘텐츠에 쓸 때 플랫폼별 라벨링 규정이 다르다. 광고·정치 콘텐츠는 기준이 더 엄격하다.
  3. 라이선스. 추가된 모델 7종은 각각 조건이 다를 수 있다. 상업적 사용 여부를 모델 카드에서 개별 확인해야 한다.
  4. 품질 검수 절차. 표현형 TTS는 억양이 과하게 실리는 실패 모드가 있다. 최종본을 사람이 듣는 단계를 빼면 사고가 난다.

정리

로컬 음성 스택이 두꺼워지는 흐름 자체는 계속되고 있다. 지금 시점에서 챙길 것은 기술보다 절차 쪽이다. 목소리 소스의 권리 관계를 정리해 두고, 합성물임을 표시하는 기준을 사내에 만들어 두면 도구가 바뀌어도 그대로 쓴다.

출처: r/LocalLLaMA 릴리스 게시글. 세부 사양은 프로젝트 저장소 참고.