제미나이 텍스트-투-스피치 (Gemini TTS)
Gemini TTS
구글이 만든, 글로 쓴 문장을 사람 목소리처럼 자연스럽게 읽어주는 음성 합성 기술.
쉽게 말하면
제미나이 텍스트-투-스피치(Gemini TTS)는 글자로 쓰인 문장을 사람이 말하는 것 같은 목소리로 바꿔주는 구글의 음성 합성 기술이다.
비유하자면 대본을 받아 읽는 성우와 비슷하다. 다만 사람 성우 대신 AI가 그 역할을 맡는다. 문장을 입력하면 억양과 발음이 자연스러운 오디오가 만들어지고, 밝게 읽어달라거나 차분하게 읽어달라는 식으로 말투까지 지정할 수 있다.
이 기술은 단순히 안내 방송을 읽어주는 데서 그치지 않는다. 최근에는 실제 사람처럼 대화 중간에 끼어들거나 억양을 바꾸는 데도 쓰여서, 음성으로 대화하는 AI 에이전트를 테스트할 때 가상의 사용자 목소리를 만들어내는 용도로도 활용된다.
기사에서 이렇게 나와요
직접 해보기
구글 제미나이의 텍스트-투-스피치 기능을 사용할 수 있다면, 같은 문장에 다른 톤을 지정해 결과를 비교해보세요.
- '다음 문장을 차분하고 낮은 톤으로 읽어줘: 회의는 오후 3시에 시작합니다.'
- '다음 문장을 밝고 경쾌한 톤으로 읽어줘: 회의는 오후 3시에 시작합니다.'
같은 문장이라도 지정한 톤에 따라 억양과 속도가 달라지는 걸 들어보면 이 기술이 하는 일을 바로 느낄 수 있다.
