每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

一览实验室在ElevenCreative中加入FLUX 3、Seedance 2.5

从新增图像·视频生成模型,到有声书角色配音、音乐人声生成,我们梳理了8月的更新内容

이미지: YouTube 영상 갈무리

摘要

  • 一览实验室(ElevenLabs)在ElevenCreative图像·视频工具中加入了Black Forest Labs的FLUX 3和字节跳动的Seedance 2.5
  • 新增的Character Casting功能可在上传有声书原稿后自动区分角色并推荐配音,Spotlight功能则可对客服对话进行实时评分
  • ElevenMusic新增人声生成功能,截至8月31日举行的"Summer of Sound"活动将免费用户的月生成上限提升至400次
ElevenLabs Changelog: Everything We Shipped This Month
ElevenCreative 신규 모델
FLUX 3(Black Forest Labs), Seedance 2.5(ByteDance)가 이미지·영상 도구에 추가됨
Character Casting
오디오북 원고 업로드 시 등장인물 자동 식별, 목소리 제안, 실제 대사로 미리듣기 지원
Spotlight
ElevenAgents의 통화·채팅 실시간 관찰, 주제 분류, 사용자 지정 기준별 점수화
지원 채널 확장
SMS·Telegram·Intercom·Freshdesk가 기존 전화·웹·Zendesk·Slack·WhatsApp에 추가
ElevenMusic 보컬
자신의 목소리 또는 보컬 라이브러리로 보컬이 들어간 곡 생성 가능
Summer of Sound
8월 31일까지 진행, 무료 이용자 월 400회 생성, 상위 10곡 대상 5만 달러 상금
Dubbing v2
대본이 아닌 원본 연기를 기준 삼아 톤·감정을 유지한 더빙 API
Scribe v2 Realtime
개체 인식, 동일 스트림 내 보조 언어 인식, 배경음 필터링, 무보관 로깅 추가

只要上传一整份有声书原稿,AI就能自动识别出书中人物并为其配上声音。系统会为每个角色推荐合适的候选音色,用户可先用实际台词试听后再确定。

这是一览实验室在YouTube公开的8月更新日志视频中展示的新功能"Character Casting"的内容。该公司在8月20日正式发布实时对话语音模型"v3 Conversational"之后,一个月内又对图像·视频生成工具、客服智能体、音乐生成、配音API等多个领域进行了更新。仅一段五分钟左右的视频中就包含了八项更新内容。

图像·视频工具引入两款外部模型

视频内容制作工具ElevenCreative的图像·视频生成功能中,新加入了Black Forest Labs的FLUX 3和字节跳动(ByteDance)的Seedance 2.5。这两款均为外部开发商打造的图像·视频生成模型,一览实验室将其整合进自家工具中供用户选用。

有声书制作功能新增了Character Casting。上传原稿后系统会自动区分角色并为每个角色推荐配音,用户在确定之前可以先用实际台词进行试听。

对客服对话进行实时评分的Spotlight

客服智能体产品ElevenAgents新增了名为Spotlight的观察层功能。它能实时读取通话和聊天对话内容,按主题进行归类,并根据用户以普通语句设定的评判标准对每段对话打分,随后提示需要改进的地方。

支持的渠道也有所增加。在原有的电话、网页、Zendesk、Slack、WhatsApp基础上,新增了SMS、Telegram、Intercom、Freshdesk,且可针对不同渠道分别调整运行方式。

为歌曲配上人声的ElevenMusic

音乐生成工具ElevenMusic新增了人声功能。用户可选择自己的声音或音色库中的声音,制作出人声一致的完整歌曲。References功能则可上传10秒至5分钟的曲目,系统会据此风格生成新曲。

截至8月31日举行的"Summer of Sound"活动,将免费用户的月生成上限提升至400次,播放量最高的前10首歌曲将共同瓜分5万美元奖金。参与方式为在8月31日之前,在Summer of Sound活动页面上传作品。

配音与实时转录功能也有更新

面向开发者的ElevenAPI新增了Dubbing v2。此前的配音以剧本为基准,而新版本则以原始表演本身为基准,使语气和情感在转换为其他语言时不会被压平,能够更好地保留下来。

实时语音识别功能Scribe v2 Realtime新增了实体识别、单一语音流中同时识别辅助语言的功能、背景噪音过滤,以及不留存数据的无日志记录选项。

本月更新一览

产品领域新功能核心内容
ElevenCreativeFLUX 3 · Seedance 2.5可在工具内选用外部图像·视频模型
ElevenCreativeCharacter Casting有声书角色配音自动推荐
ElevenAgentsSpotlight客服对话实时观察与评分
ElevenAgents渠道扩展新增SMS、Telegram、Intercom、Freshdesk
ElevenMusic人声生成 · References生成带人声的歌曲,支持风格参考
ElevenAPIDubbing v2以原始表演为基准的配音
ElevenAPIScribe v2 Realtime实体识别、多语言、无日志记录

如何使用

图像·视频生成与有声书制作均在ElevenCreative中完成。用一览实验室账号登录后,进入ElevenCreative的图像工具、视频工具或有声书工具即可。

以有声书为例,操作步骤如下:1. 在有声书工具中上传原稿文件。2. Character Casting分析原稿并展示角色列表。3. 查看为每个角色推荐的候选音色。4. 用实际台词试听,选定满意的声音后确定。5. 如需图像或视频,可在同一界面中选择FLUX 3或Seedance 2.5并输入提示词。

此次公告中并未具体说明按国家或套餐区分的使用条件。不过Summer of Sound活动向免费套餐用户开放,每月可生成最多400次。

举例来说,有声书制作者可凭一份原稿自动获得各角色的配音分配,从而缩短录制前的准备时间。呼叫中心运营团队可利用Spotlight按既定标准对客服质量打分,无需人工逐一收听。音乐人则可以在References中上传自己喜欢的曲目,制作出风格相近、并带有自己声音的新曲。

编辑视角

这次更新日志有意思的地方在于,一览实验室并不刻意掩饰自己并非所有模型都自主研发这一事实。FLUX 3和Seedance 2.5分别由Black Forest Labs和字节跳动打造,一览实验室将其嵌入自家创意工具中,让用户能在同一界面中自由选用。这意味着,该公司从语音这一原本的核心领域向图像、视频拓展工具版图的方式,更接近于"组装"而非"自研"。从8月20日正式发布实时对话模型v3 Conversational后仅隔几天,就集中推出这样一批组装式更新来看,该公司选择的方向并非单靠语音一决胜负,而是将文本、语音、图像、视频整合进同一个账号体系之中。

对于已经将语音AI用于实际业务的团队来说,这次更新中最值得关注的当属Spotlight。此前的客服质量管理大多依赖人工重听对话、逐项填写检查表,如今只要用一句话写下评判标准,对话结束后即可自动打分,这种结构变化意味着QA人力可以被释放去做其他工作。不过渠道增多并不意味着判定准确度会自动提升,像SMS或Telegram这类语句较短的渠道,同样的评分标准是否依然适用,还需要实际接入后才能验证。

对有声书制作公司或个人创作者而言,仅凭Character Casting这一项功能,就能大幅降低将一份原稿转化为有声内容的门槛,而无需依靠录音棚。下个月的更新日志中,很可能会披露这次新增的FLUX 3、Seedance 2.5组合的实际使用情况,以及Spotlight默认采用哪些客服评判指标。

评论