
이미지: YouTube 제공
요약
- 일레븐랩스가 ElevenCreative 이미지·영상 도구에 블랙포레스트랩스의 FLUX 3와 바이트댄스의 Seedance 2.5를 추가했다
- 오디오북 원고를 올리면 등장인물을 구분해 목소리를 제안하는 Character Casting, 상담 대화를 실시간 채점하는 Spotlight가 새로 생겼다
- ElevenMusic은 보컬 생성 기능을 갖췄고, 8월 31일까지 열리는 콘테스트 Summer of Sound는 무료 이용자 생성 한도를 월 400회로 늘렸다
- ElevenCreative 신규 모델
- FLUX 3(Black Forest Labs), Seedance 2.5(ByteDance)가 이미지·영상 도구에 추가됨
- Character Casting
- 오디오북 원고 업로드 시 등장인물 자동 식별, 목소리 제안, 실제 대사로 미리듣기 지원
- Spotlight
- ElevenAgents의 통화·채팅 실시간 관찰, 주제 분류, 사용자 지정 기준별 점수화
- 지원 채널 확장
- SMS·Telegram·Intercom·Freshdesk가 기존 전화·웹·Zendesk·Slack·WhatsApp에 추가
- ElevenMusic 보컬
- 자신의 목소리 또는 보컬 라이브러리로 보컬이 들어간 곡 생성 가능
- Summer of Sound
- 8월 31일까지 진행, 무료 이용자 월 400회 생성, 상위 10곡 대상 5만 달러 상금
- Dubbing v2
- 대본이 아닌 원본 연기를 기준 삼아 톤·감정을 유지한 더빙 API
- Scribe v2 Realtime
- 개체 인식, 동일 스트림 내 보조 언어 인식, 배경음 필터링, 무보관 로깅 추가
오디오북 원고 하나를 통째로 올리면, AI가 알아서 등장인물을 골라내고 목소리까지 붙여준다. 인물마다 어울리는 목소리 후보를 제안하고, 실제 대사로 미리 들어본 뒤 확정할 수 있다.
일레븐랩스가 유튜브에 공개한 8월 변경 로그 영상에 담긴 신규 기능 'Character Casting'의 내용이다. 이 회사는 지난 8월 20일 실시간 대화용 음성 모델 'v3 Conversational'을 정식 출시한 데 이어, 한 달 사이 이미지·영상 생성 도구, 상담 에이전트, 음악 생성, 더빙 API까지 손을 댔다. 5분 남짓한 영상 하나에 담긴 업데이트만 여덟 가지에 이른다.
이미지·영상 도구에 외부 모델 두 개가 들어왔다
영상 콘텐츠 제작 도구 ElevenCreative의 이미지·영상 생성 기능에는 블랙포레스트랩스(Black Forest Labs)의 FLUX 3와 바이트댄스(ByteDance)의 Seedance 2.5가 새로 들어갔다. 두 모델 모두 외부 개발사가 만든 이미지·영상 생성 모델로, 일레븐랩스는 이를 자사 도구 안에서 골라 쓸 수 있도록 얹었다.
오디오북 제작 기능에는 Character Casting이 추가됐다. 원고를 업로드하면 등장인물을 자동으로 구분하고 인물별 목소리를 제안하는데, 확정하기 전에 실제 대사를 넣어 미리 들어볼 수 있다.
상담 대화를 실시간으로 채점하는 Spotlight
고객 상담 에이전트 제품 ElevenAgents에는 Spotlight라는 관찰 레이어가 새로 붙었다. 통화와 채팅 대화를 실시간으로 읽어 주제별로 묶고, 사용자가 일반 문장으로 적어 둔 기준에 따라 대화마다 점수를 매긴 뒤 무엇을 고쳐야 하는지 알려준다.
지원 채널도 늘었다. 기존 전화·웹·Zendesk·Slack·WhatsApp에 SMS, Telegram, Intercom, Freshdesk가 새로 합류했고, 채널별로 동작 방식을 따로 조정할 수 있게 됐다.
노래에 목소리를 얹는 ElevenMusic
음악 생성 도구 ElevenMusic은 보컬 기능을 갖췄다. 자신의 목소리나 보컬 라이브러리에 있는 목소리를 골라 일관된 보컬이 들어간 곡을 만들 수 있다. References 기능은 10초에서 5분 사이의 트랙을 올리면 그 스타일에 맞춰 새 곡을 생성해준다.
8월 31일까지 진행하는 콘테스트 'Summer of Sound'는 무료 요금제 사용자의 월 생성 한도를 400회로 늘렸고, 가장 많이 스트리밍된 상위 10곡에 5만 달러 규모의 상금을 나눠준다. 참가하려면 Summer of Sound 참가 페이지에서 8월 31일 전에 곡을 올리면 된다.
더빙과 실시간 전사도 손봤다
개발자용 ElevenAPI에는 더빙 v2가 추가됐다. 기존에는 대본을 기준으로 더빙했다면, 이번 버전은 원본 연기 자체를 기준 삼아 톤과 감정이 다른 언어로 옮겨질 때도 납작해지지 않고 살아남는다.
실시간 음성 인식 기능 Scribe v2 Realtime에는 개체 인식, 하나의 스트림 안에서 보조 언어를 함께 인식하는 기능, 배경음 필터링, 데이터를 저장하지 않는 무보관 로깅 옵션이 새로 붙었다.
이번 달 업데이트 한눈에 보기
| 제품 영역 | 새 기능 | 핵심 내용 |
|---|---|---|
| ElevenCreative | FLUX 3 · Seedance 2.5 | 외부 이미지·영상 모델을 도구 안에서 선택 |
| ElevenCreative | Character Casting | 오디오북 인물별 목소리 자동 제안 |
| ElevenAgents | Spotlight | 상담 대화 실시간 관찰·점수화 |
| ElevenAgents | 채널 확장 | SMS·Telegram·Intercom·Freshdesk 추가 |
| ElevenMusic | 보컬 생성 · References | 보컬 있는 곡 생성, 스타일 참조 |
| ElevenAPI | Dubbing v2 | 원본 연기 기준 더빙 |
| ElevenAPI | Scribe v2 Realtime | 개체 인식·다국어·무보관 로깅 |
어떻게 써보나
이미지·영상 생성과 오디오북 제작은 ElevenCreative 안에서 이뤄진다. 일레븐랩스 계정으로 로그인한 뒤 ElevenCreative의 이미지 도구, 영상 도구, 오디오북 도구로 들어가면 된다.
오디오북을 기준으로 한 단계별 순서는 이렇다. 1. 오디오북 도구에 원고 파일을 업로드한다. 2. Character Casting이 원고를 분석해 등장인물 목록을 보여준다. 3. 인물마다 제안된 목소리 후보를 확인한다. 4. 실제 대사를 넣어 미리 들어보고 마음에 드는 목소리로 확정한다. 5. 이미지나 영상이 필요하면 같은 화면에서 FLUX 3나 Seedance 2.5를 선택해 프롬프트를 입력한다.
국가나 요금제별 이용 조건은 이번 발표에서 구체적으로 밝혀지지 않았다. 다만 Summer of Sound 이벤트는 무료 요금제 사용자도 월 400회까지 곡을 생성할 수 있도록 열려 있다.
예를 들어 오디오북 제작자는 원고 하나로 등장인물별 목소리를 자동으로 배정받아 녹음 준비 시간을 줄일 수 있다. 콜센터 운영팀은 Spotlight로 상담 품질을 사람이 일일이 듣지 않고도 기준별로 점수화할 수 있다. 뮤지션은 References에 좋아하는 곡을 올려 비슷한 분위기의 새 곡에 자기 목소리를 얹어볼 수 있다.
에디터의 시선
이번 변경 로그가 흥미로운 지점은 일레븐랩스가 모델을 스스로 다 만들지 않는다는 사실을 굳이 감추지 않는다는 데 있다. FLUX 3와 Seedance 2.5는 각각 블랙포레스트랩스와 바이트댄스가 만든 모델이고, 일레븐랩스는 이를 자사 크리에이티브 도구 안에 얹어 사용자가 한 화면에서 골라 쓰게 했다. 음성이라는 원래 영역에서 이미지·영상까지 도구를 넓히는 방식이 자체 개발보다는 조립에 가깝다는 뜻이다. 지난 8월 20일 실시간 대화 모델 v3 Conversational을 GA로 내놓은 지 며칠 만에 이런 조립형 업데이트를 몰아서 낸 걸 보면, 이 회사는 음성 하나로 승부하기보다 텍스트·음성·이미지·영상을 한 계정 안에 모으는 쪽으로 방향을 잡았다.
음성 AI를 실무에 붙여본 팀이라면 이번 업데이트에서 가장 먼저 눈여겨볼 건 Spotlight다. 상담 품질 관리는 지금까지 대화를 다시 듣고 사람이 체크리스트를 채우는 방식이 많았는데, 기준을 문장으로 적어두면 대화가 끝나자마자 점수가 매겨지는 구조로 바뀌면 QA 인력을 다른 업무로 돌릴 여지가 생긴다. 다만 채널이 늘었다고 판정 정확도가 자동으로 좋아지는 건 아니다. SMS나 텔레그램처럼 문장이 짧은 채널에서 같은 채점 기준이 제대로 작동하는지는 실제로 붙여보고 확인해야 하는 몫으로 남는다.
오디오북 제작사나 개인 창작자 입장에서는 Character Casting 하나만으로도 원고 한 편을 녹음 스튜디오 없이 목소리 있는 콘텐츠로 바꾸는 문턱이 낮아진다. 다음 달 변경 로그에는 이번에 붙은 FLUX 3·Seedance 2.5 조합이 실제로 얼마나 쓰이는지, 그리고 Spotlight가 어떤 상담 지표를 기본값으로 잡는지가 나올 가능성이 높다.





댓글