
이미지: YouTube 영상 갈무리
摘要
- 一览实验室(ElevenLabs)在ElevenCreative图像·视频工具中加入了Black Forest Labs的FLUX 3和字节跳动的Seedance 2.5
- 新增的Character Casting功能可在上传有声书原稿后自动区分角色并推荐配音,Spotlight功能则可对客服对话进行实时评分
- ElevenMusic新增人声生成功能,截至8月31日举行的"Summer of Sound"活动将免费用户的月生成上限提升至400次
- ElevenCreative 신규 모델
- FLUX 3(Black Forest Labs), Seedance 2.5(ByteDance)가 이미지·영상 도구에 추가됨
- Character Casting
- 오디오북 원고 업로드 시 등장인물 자동 식별, 목소리 제안, 실제 대사로 미리듣기 지원
- Spotlight
- ElevenAgents의 통화·채팅 실시간 관찰, 주제 분류, 사용자 지정 기준별 점수화
- 지원 채널 확장
- SMS·Telegram·Intercom·Freshdesk가 기존 전화·웹·Zendesk·Slack·WhatsApp에 추가
- ElevenMusic 보컬
- 자신의 목소리 또는 보컬 라이브러리로 보컬이 들어간 곡 생성 가능
- Summer of Sound
- 8월 31일까지 진행, 무료 이용자 월 400회 생성, 상위 10곡 대상 5만 달러 상금
- Dubbing v2
- 대본이 아닌 원본 연기를 기준 삼아 톤·감정을 유지한 더빙 API
- Scribe v2 Realtime
- 개체 인식, 동일 스트림 내 보조 언어 인식, 배경음 필터링, 무보관 로깅 추가
只要上传一整份有声书原稿,AI就能自动识别出书中人物并为其配上声音。系统会为每个角色推荐合适的候选音色,用户可先用实际台词试听后再确定。
这是一览实验室在YouTube公开的8月更新日志视频中展示的新功能"Character Casting"的内容。该公司在8月20日正式发布实时对话语音模型"v3 Conversational"之后,一个月内又对图像·视频生成工具、客服智能体、音乐生成、配音API等多个领域进行了更新。仅一段五分钟左右的视频中就包含了八项更新内容。
图像·视频工具引入两款外部模型
视频内容制作工具ElevenCreative的图像·视频生成功能中,新加入了Black Forest Labs的FLUX 3和字节跳动(ByteDance)的Seedance 2.5。这两款均为外部开发商打造的图像·视频生成模型,一览实验室将其整合进自家工具中供用户选用。
有声书制作功能新增了Character Casting。上传原稿后系统会自动区分角色并为每个角色推荐配音,用户在确定之前可以先用实际台词进行试听。
对客服对话进行实时评分的Spotlight
客服智能体产品ElevenAgents新增了名为Spotlight的观察层功能。它能实时读取通话和聊天对话内容,按主题进行归类,并根据用户以普通语句设定的评判标准对每段对话打分,随后提示需要改进的地方。
支持的渠道也有所增加。在原有的电话、网页、Zendesk、Slack、WhatsApp基础上,新增了SMS、Telegram、Intercom、Freshdesk,且可针对不同渠道分别调整运行方式。
为歌曲配上人声的ElevenMusic
音乐生成工具ElevenMusic新增了人声功能。用户可选择自己的声音或音色库中的声音,制作出人声一致的完整歌曲。References功能则可上传10秒至5分钟的曲目,系统会据此风格生成新曲。
截至8月31日举行的"Summer of Sound"活动,将免费用户的月生成上限提升至400次,播放量最高的前10首歌曲将共同瓜分5万美元奖金。参与方式为在8月31日之前,在Summer of Sound活动页面上传作品。
配音与实时转录功能也有更新
面向开发者的ElevenAPI新增了Dubbing v2。此前的配音以剧本为基准,而新版本则以原始表演本身为基准,使语气和情感在转换为其他语言时不会被压平,能够更好地保留下来。
实时语音识别功能Scribe v2 Realtime新增了实体识别、单一语音流中同时识别辅助语言的功能、背景噪音过滤,以及不留存数据的无日志记录选项。
本月更新一览
| 产品领域 | 新功能 | 核心内容 |
|---|---|---|
| ElevenCreative | FLUX 3 · Seedance 2.5 | 可在工具内选用外部图像·视频模型 |
| ElevenCreative | Character Casting | 有声书角色配音自动推荐 |
| ElevenAgents | Spotlight | 客服对话实时观察与评分 |
| ElevenAgents | 渠道扩展 | 新增SMS、Telegram、Intercom、Freshdesk |
| ElevenMusic | 人声生成 · References | 生成带人声的歌曲,支持风格参考 |
| ElevenAPI | Dubbing v2 | 以原始表演为基准的配音 |
| ElevenAPI | Scribe v2 Realtime | 实体识别、多语言、无日志记录 |
如何使用
图像·视频生成与有声书制作均在ElevenCreative中完成。用一览实验室账号登录后,进入ElevenCreative的图像工具、视频工具或有声书工具即可。
以有声书为例,操作步骤如下:1. 在有声书工具中上传原稿文件。2. Character Casting分析原稿并展示角色列表。3. 查看为每个角色推荐的候选音色。4. 用实际台词试听,选定满意的声音后确定。5. 如需图像或视频,可在同一界面中选择FLUX 3或Seedance 2.5并输入提示词。
此次公告中并未具体说明按国家或套餐区分的使用条件。不过Summer of Sound活动向免费套餐用户开放,每月可生成最多400次。
举例来说,有声书制作者可凭一份原稿自动获得各角色的配音分配,从而缩短录制前的准备时间。呼叫中心运营团队可利用Spotlight按既定标准对客服质量打分,无需人工逐一收听。音乐人则可以在References中上传自己喜欢的曲目,制作出风格相近、并带有自己声音的新曲。
编辑视角
这次更新日志有意思的地方在于,一览实验室并不刻意掩饰自己并非所有模型都自主研发这一事实。FLUX 3和Seedance 2.5分别由Black Forest Labs和字节跳动打造,一览实验室将其嵌入自家创意工具中,让用户能在同一界面中自由选用。这意味着,该公司从语音这一原本的核心领域向图像、视频拓展工具版图的方式,更接近于"组装"而非"自研"。从8月20日正式发布实时对话模型v3 Conversational后仅隔几天,就集中推出这样一批组装式更新来看,该公司选择的方向并非单靠语音一决胜负,而是将文本、语音、图像、视频整合进同一个账号体系之中。
对于已经将语音AI用于实际业务的团队来说,这次更新中最值得关注的当属Spotlight。此前的客服质量管理大多依赖人工重听对话、逐项填写检查表,如今只要用一句话写下评判标准,对话结束后即可自动打分,这种结构变化意味着QA人力可以被释放去做其他工作。不过渠道增多并不意味着判定准确度会自动提升,像SMS或Telegram这类语句较短的渠道,同样的评分标准是否依然适用,还需要实际接入后才能验证。
对有声书制作公司或个人创作者而言,仅凭Character Casting这一项功能,就能大幅降低将一份原稿转化为有声内容的门槛,而无需依靠录音棚。下个月的更新日志中,很可能会披露这次新增的FLUX 3、Seedance 2.5组合的实际使用情况,以及Spotlight默认采用哪些客服评判指标。




评论