표현형 TTS
Expressive TTS
글자를 소리로 바꿀 때 감정과 억양까지 함께 실어주는 음성 합성 기술이다.
쉽게 말하면
표현형 TTS는 컴퓨터가 글을 소리 내어 읽어줄 때, 그 안에 감정과 억양까지 함께 넣어주는 기술이다. 같은 대본이라도 뉴스 앵커가 담담하게 읽는 것과 배우가 감정을 실어 연기하듯 읽는 것은 전혀 다르게 들린다. 기존의 합성 음성은 대부분 앵커 쪽에 가까웠고, 표현형 TTS는 배우 쪽에 가까워지려는 시도다.
이 차이가 중요한 이유는 쓰임새 때문이다. 밋밋하게 읽기만 하는 목소리로는 오디오북 내레이션이나 게임 캐릭터의 대사가 살아나지 않는다. 슬픈 장면에서 슬프게, 다급한 장면에서 다급하게 들려야 콘텐츠로서 성립한다. 표현형 TTS는 바로 이 지점, 감정선이 필요한 음성 콘텐츠를 자동으로 만드는 데 쓰인다.
다만 억양이 지나치게 과장되는 실패 사례도 있어서, 최종 결과물을 사람이 직접 들어보고 다듬는 검수 단계가 여전히 필요하다.
기사에서 이렇게 나와요
기사는 audio.cpp 0.5에 추가된 기능을 "표현형 TTS(DramaBox)"라고 소개한다. 이는 목소리의 정체성을 다른 화자로 옮기는 기술(교차언어 음성 전이)과는 다른 기능으로, 하나는 같은 화자가 더 실감 나게 읽도록 만드는 것이고 다른 하나는 화자 자체를 바꾸는 것이다. 기사에서도 둘을 별도 항목으로 구분해 다룬다.
