
摘要
- OpenAI 在 API 中发布了 GPT-Live-1。它在同一个模型里同时处理听和说,取代了过去把语音转文字、再把文字转回语音的三段式结构中的前端环节。
- 公司表示,在衡量实时你来我往的 Full Duplex Bench 上,新模型比上一代高出 30 个百分点;与 GPT-6 Astra 搭配时,在 Tau3 上排名第一。
- 语言学习应用 Speak 表示,在早期评测中,打断次数比此前的系统减少了近 80%。语音前端按每分钟五美分计费,后端推理和工具调用另行计价。
OpenAI 把语音模型 GPT-Live-1 通过 API 开放给了外部开发者。这个模型此前只能在 ChatGPT 内部使用,而它的关键之处在于能够同时听和说。公司在发布说明中写道:“GPT-Live-1 在单一模型内完成听与说,从而简化了语音层。”前端负责承接对话,真正需要判断的活儿则交给挂在后面的另一个模型。
在此之前,语音智能体都是由三块拼起来的:把语音转成文字的模块、负责思考的模型,以及把文字再变回语音的模块。公司解释说,每交接一次就会累积一次延迟,也更容易丢掉节奏、上下文和对话本身的自然韵律。这就像三个人接力做同声传译,每递一次接力棒就慢半拍。
结构改动的结果落在了评测分数上。公司表示,在衡量实时你来我往的 Full Duplex Bench 上,新模型比上一代 GPT-Realtime-2.1 高出 30 个百分点,在轮次交替的延迟和互动表现上差距尤其明显。公司还写道,当以中等推理强度把 GPT-6 Astra 挂在后面时,模型在端到端衡量语音智能体能力的 Tau3 上排名第一。
评测涵盖的项目也一并公开。公司让模型用语音处理航空、零售和电信领域的客服任务并计算完成率,在银行客服场景里则统计了需要同时用到知识检索和账户工具的 97 项任务通过了多少。此外还分别衡量了模型如何处理停顿、轮次交替、插话和附和,用户说完之后多快开始回应,以及在对方结巴或自我更正的请求中能否正确调用工具。
真实使用场景也给出了一个数字。公司表示,语言学习应用 Speak 在早期评测中发现,GPT-Live-1 给学习者留出了更多思考时间,打断次数比此前的轮次交替式系统减少了近 80%。在语音产品里,愿意等一个说话慢的人,其分量不亚于一项功能。
METAL 完整看过那段 76 秒的公开演示视频,视频有意在测试这一点。主持人在模型说话中途插话,又故意放出背景噪音,问对方还能不能听清。模型回答说听得很清楚,即使周围有噪音也能跟住他的声音,随后接着把话说完。在同一段视频里,模型一边把动作交给机器人和屏幕,一边让对话继续。
把语音前端合并进一个模型,也减少了开发者自己要写的代码。过去,用户插话时、短暂停顿时、改变话题时该怎么办,都得由开发者一步步规定。公司写道,这类协调一直压在开发者身上;如今前端就地处理插话和附和,只把更深的判断往后传。对话不停,事情在后面继续推进。
后面挂什么由开发者自己挑。公司举了搭配的例子:改预约、通知订单这类量大的活儿交给 Luna 这样的模型,需要推理的复杂客户问题则交给 Astra。保持同一个语音前端、只更换后端,就能按任务分别调整回答的深度、速度和成本。
前端交出来的东西也交代得很清楚。GPT-Live-1 会直接给出转写文本和回应文本,能听懂数字与字母混杂的表述,并提供让特定词更容易被识别的功能。它虽然不是轮次交替式模型,却保留了识别轮次边界的能力,让按旧方式开发的团队不必把架构整个推翻。
价格只标在前端。公司表示语音前端定为每分钟五美分,演示视频里紧接着就有一句说明:“那是前端的价格,后端推理和工具的费用另算。”这意味着一通对话实际花多少钱,取决于后面挂了什么,只看每分钟单价来做预算就会算错。
音色选择变多了,但仍在推进中。公司写道,实时语音已从少数几个扩展到覆盖不同口音、方言和语言,同时补充说未来几个月会继续增加音色和可用语言。定制音色目前只对通过销售渠道确认资格的客户开放。
面向企业的路径也另设了一条。公司同时介绍了基于该模型运行实时语音交互的 OpenAI Presence,称其能回答问题、解决问题、调用公司系统、执行已获批准的操作,必要时转交给人工。这说明公司的目标不止于卖一个语音前端,而是把整个工作流打包卖出去。
这种委派结构与 OpenAI 近来推进的方向一脉相承。METAL 曾报道过OpenAI 把能翻查公司内部资料作答的数据智能体放进 ChatGPT Work 的做法,当时同样是前端接下请求、真正的活儿交由后面的工具完成。语音如今从这套结构最后一道入口走了进来。
概括来说,OpenAI 用自家模型替换掉了开发者过去要自己拼接的三块中的前端那一块。前端吸收插话和噪音、判断往后传,这套分工就是这个模型的全部。接下来有两点值得观察:更换后端模型之后,对话的节奏能否保持;以及企业会用什么标准来核算叠加在每分钟单价之上的后端成本。





评论