METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

一览实验室在ElevenCreative中加入FLUX 3、Seedance 2.5

从新增图像·视频生成模型,到有声书角色配音、音乐人声生成,我们梳理了8月的更新内容

一览实验室在ElevenCreative中加入FLUX 3、Seedance 2.5

摘要

  • 一览实验室(ElevenLabs)在ElevenCreative图像·视频工具中加入了Black Forest Labs的FLUX 3和字节跳动的Seedance 2.5
  • 新增的Character Casting功能可在上传有声书原稿后自动区分角色并推荐配音,Spotlight功能则可对客服对话进行实时评分
  • ElevenMusic新增人声生成功能,截至8月31日举行的"Summer of Sound"活动将免费用户的月生成上限提升至400次
ElevenLabs Changelog: Everything We Shipped This Month

只要上传一整份有声书原稿,AI就能自动识别出书中人物并为其配上声音。系统会为每个角色推荐合适的候选音色,用户可先用实际台词试听后再确定。

这是一览实验室在YouTube公开的8月更新日志视频中展示的新功能"Character Casting"的内容。该公司在8月20日正式发布实时对话语音模型"v3 Conversational"之后,一个月内又对图像·视频生成工具、客服智能体、音乐生成、配音API等多个领域进行了更新。仅一段五分钟左右的视频中就包含了八项更新内容。

图像·视频工具引入两款外部模型

视频内容制作工具ElevenCreative的图像·视频生成功能中,新加入了Black Forest Labs的FLUX 3和字节跳动(ByteDance)的Seedance 2.5。这两款均为外部开发商打造的图像·视频生成模型,一览实验室将其整合进自家工具中供用户选用。

有声书制作功能新增了Character Casting。上传原稿后系统会自动区分角色并为每个角色推荐配音,用户在确定之前可以先用实际台词进行试听。

对客服对话进行实时评分的Spotlight

客服智能体产品ElevenAgents新增了名为Spotlight的观察层功能。它能实时读取通话和聊天对话内容,按主题进行归类,并根据用户以普通语句设定的评判标准对每段对话打分,随后提示需要改进的地方。

支持的渠道也有所增加。在原有的电话、网页、Zendesk、Slack、WhatsApp基础上,新增了SMS、Telegram、Intercom、Freshdesk,且可针对不同渠道分别调整运行方式。

为歌曲配上人声的ElevenMusic

音乐生成工具ElevenMusic新增了人声功能。用户可选择自己的声音或音色库中的声音,制作出人声一致的完整歌曲。References功能则可上传10秒至5分钟的曲目,系统会据此风格生成新曲。

截至8月31日举行的"Summer of Sound"活动,将免费用户的月生成上限提升至400次,播放量最高的前10首歌曲将共同瓜分5万美元奖金。参与方式为在8月31日之前,在Summer of Sound活动页面上传作品。

配音与实时转录功能也有更新

面向开发者的ElevenAPI新增了Dubbing v2。此前的配音以剧本为基准,而新版本则以原始表演本身为基准,使语气和情感在转换为其他语言时不会被压平,能够更好地保留下来。

实时语音识别功能Scribe v2 Realtime新增了实体识别、单一语音流中同时识别辅助语言的功能、背景噪音过滤,以及不留存数据的无日志记录选项。

本月更新一览

产品领域新功能核心内容
ElevenCreativeFLUX 3 · Seedance 2.5可在工具内选用外部图像·视频模型
ElevenCreativeCharacter Casting有声书角色配音自动推荐
ElevenAgentsSpotlight客服对话实时观察与评分
ElevenAgents渠道扩展新增SMS、Telegram、Intercom、Freshdesk
ElevenMusic人声生成 · References生成带人声的歌曲,支持风格参考
ElevenAPIDubbing v2以原始表演为基准的配音
ElevenAPIScribe v2 Realtime实体识别、多语言、无日志记录

如何使用

图像·视频生成与有声书制作均在ElevenCreative中完成。用一览实验室账号登录后,进入ElevenCreative的图像工具、视频工具或有声书工具即可。

以有声书为例,操作步骤如下:1. 在有声书工具中上传原稿文件。2. Character Casting分析原稿并展示角色列表。3. 查看为每个角色推荐的候选音色。4. 用实际台词试听,选定满意的声音后确定。5. 如需图像或视频,可在同一界面中选择FLUX 3或Seedance 2.5并输入提示词。

此次公告中并未具体说明按国家或套餐区分的使用条件。不过Summer of Sound活动向免费套餐用户开放,每月可生成最多400次。

举例来说,有声书制作者可凭一份原稿自动获得各角色的配音分配,从而缩短录制前的准备时间。呼叫中心运营团队可利用Spotlight按既定标准对客服质量打分,无需人工逐一收听。音乐人则可以在References中上传自己喜欢的曲目,制作出风格相近、并带有自己声音的新曲。

编辑视角

这次更新日志有意思的地方在于,一览实验室并不刻意掩饰自己并非所有模型都自主研发这一事实。FLUX 3和Seedance 2.5分别由Black Forest Labs和字节跳动打造,一览实验室将其嵌入自家创意工具中,让用户能在同一界面中自由选用。这意味着,该公司从语音这一原本的核心领域向图像、视频拓展工具版图的方式,更接近于"组装"而非"自研"。从8月20日正式发布实时对话模型v3 Conversational后仅隔几天,就集中推出这样一批组装式更新来看,该公司选择的方向并非单靠语音一决胜负,而是将文本、语音、图像、视频整合进同一个账号体系之中。

对于已经将语音AI用于实际业务的团队来说,这次更新中最值得关注的当属Spotlight。此前的客服质量管理大多依赖人工重听对话、逐项填写检查表,如今只要用一句话写下评判标准,对话结束后即可自动打分,这种结构变化意味着QA人力可以被释放去做其他工作。不过渠道增多并不意味着判定准确度会自动提升,像SMS或Telegram这类语句较短的渠道,同样的评分标准是否依然适用,还需要实际接入后才能验证。

对有声书制作公司或个人创作者而言,仅凭Character Casting这一项功能,就能大幅降低将一份原稿转化为有声内容的门槛,而无需依靠录音棚。下个月的更新日志中,很可能会披露这次新增的FLUX 3、Seedance 2.5组合的实际使用情况,以及Spotlight默认采用哪些客服评判指标。

评论