
图片:METAL
摘要
- 阿里巴巴通义千问于 9 月 19 日发布实时同声传译模型 Qwen3.8-LiveTranslate。
- Interleave 架构把平均延迟从 2.8 秒降到 2.3 秒,模型可听懂 60 种语言、以 29 种语言发声。
- 实时说话人分离、原文与译文同屏显示、长上下文消歧是本代新增的能力。
阿里巴巴通义千问于 9 月 19 日发布实时同声传译模型 Qwen3.8-LiveTranslate。平均延迟从 2.8 秒降到 2.3 秒,而本代的核心在于,多人轮流发言时它还能分清谁说了什么。
通义千问团队在发布文章中写道,同声传译不只是译得快,还要听得清、译得准。同一篇文章表示,团队希望同声传译传递的不只是语言,还有对话背后的人与语境。官方 X 帖子在一天内被阅读超过 13 万次。
先改变的是架构。这一被命名为 Interleave 的方式,把同声传译重新组织成音频与文本交织在一条线上的单一流。由于已听到的音频和已产出的译文会被缓存并复用,质量提升的同时,代表平均延迟的 LAAL 值从上一代的 2.8 秒降到 2.3 秒。模型由基于 Hybrid-MoE 的 Thinker 与 Talker 两个模块构成,Thinker 把视频、音频、原文与译文按时间顺序排成一条因果序列,Talker 再把译文与原始音频结合,合成保留说话人音色的语音。
新增能力有三项。第一是实时说话人分离,多人轮流发言时区分说话人,为每个句子标出归属,并让译出的语音更稳定地保留各自的音色。第二是原文与译文的同步显示。传译过程中两种语言并排对齐,既能即时理解又能核对原文,也为字幕显示、内容整理与检索等后续功能打下基础。第三是长上下文消歧,借助此前的句子与对话历史,理清专有名词和指代容易混淆之处,使表达保持一致。
性能以两组评测呈现。在处理多说话人长音频的 Omnilingua-MSpeaker 上,团队表示在覆盖 14 个语言方向的四个维度上领先当前主流实时传译系统,这四个维度是翻译的忠实度、流畅度、简洁度,加上说话人分离错误率。在公开语音测试集 FLEURS 上,评测了 70 个语言方向,并表示在翻译质量、平均延迟、语音识别准确率与语音合成质量四个维度上均领先上一代与主流系统。
输入与输出的覆盖范围不同。听音频并转为文本的一侧支持 60 种语言,以语音发声的一侧为 29 种。METAL 通读的通义千问官方博客支持语言表中,从中文、英文、韩文、日文到阿斯图里亚斯语、宿务语、塔吉克语,逐一列出了名称。
使用方式可以归结为一条 websocket。实时版模型名为 qwen3.8-livetranslate-flash-realtime,从麦克风采集的 16kHz PCM 音频送往服务器,返回 24kHz PCM 语音。说话人分离与原文同步输出在会话配置中开启,服务器会把说话人标识和原文文本随译文一并返回,因此无需另行调用语音识别接口。在专有名词密集的场合可以注册热词提升准确率,也可以上传图像帧,把画面中出现的内容作为翻译线索。
演示由《西游记》的两段对话和一组同音词示例构成。22 秒、28 秒、12 秒三段依次展示说话人归属与声音克隆、原文与译文的同步输出,以及语境和视觉信息如何化解歧义。
从做内容的一侧看,这次发布的分量在名牌而不在速度。此前的实时字幕传递了说话的内容,却放过了是谁在说;在对谈、圆桌这类说话人频繁切换的形式中,仅凭字幕难以还原对话。当每个句子都带上说话人、连声音的质感也一并跟随,直播、网络研讨会与多语种会议记录不经编辑也能成为可用的原始素材。原文与译文同屏出现这一点,也直接削减了审校成本。
METAL 曾报道过OpenAI 推出边听边说的语音模型,当时竞争的轴心是不中断的对话。这次发布在同一实时语音领域又立起一条轴。在说得多快之外,并排立着把每句话多准确地归到说话人名下。
通义千问团队写下的下一步有三个方向:把听见与译出之间的间隔压缩到极限,在同一项目、同一群人之间跨会话延续记忆,以及把覆盖扩展到长尾语言与地区方言。实时传译处理的单位正在从句子走向对话,再从对话走向关系。





评论