교차언어 음성 전이
Cross-lingual voice transfer
한 언어로 녹음된 목소리의 색깔을 다른 언어 발화에 그대로 입히는 음성 합성 기술.
쉽게 말하면
더빙 현장을 떠올리면 쉽다. 원래 배우가 한국어로 연기한 목소리를 영어 대본에 그대로 입히려면 보통 다른 성우를 새로 캐스팅해야 한다. 교차언어 음성 전이는 이 과정에서 새 성우를 쓰지 않고, 원래 화자의 목소리 톤과 색깔만 뽑아서 다른 언어의 문장에 씌우는 기술이다. 말의 내용(언어)과 목소리의 정체성(화자)을 분리해서, 화자는 그대로 두고 언어만 바꿔 끼우는 셈이다.
이게 쓸모 있는 이유는 다국어 콘텐츠에서 같은 인물이 여러 언어로 말해도 목소리가 계속 같아야 하기 때문이다. 강연자 하나가 한국어·영어·일본어로 각각 말하는 영상을 만들 때, 언어마다 다른 사람이 더빙하면 인물의 일관성이 깨진다. 교차언어 음성 전이는 원본 화자의 목소리를 축으로 두고 언어만 갈아 끼워서 이 문제를 해결한다.
다만 이 기술은 실존하는 사람의 목소리 특성을 그대로 다루기 때문에, 본인 동의 없이 남의 목소리를 소스로 쓰면 바로 법적·윤리적 문제로 이어진다. 기술이 가능해졌다는 것과 써도 된다는 것은 별개의 문제다.
기사에서 이렇게 나와요
audio.cpp 0.5는 Confucius4라는 모델로 교차언어 음성 전이 기능을 추가했다고 소개됐다. 여기서 흔한 오해는 이걸 번역 기능으로 착각하는 것이다. 실제로는 문장의 언어는 이미 정해져 있고(번역은 별도), 그 문장을 원래 화자의 목소리 특성으로 읽어주는 쪽에 가깝다. 다국어 더빙에서 화자 일관성을 유지하는 용도로 쓰인다.
