
图片:METAL
摘要
- 谷歌于9月15日在 Gemini API 和 Google AI Studio 开放了 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款语音模型。
- Extended Thinking 在 Speech to Speech Quality Index 以82.6分排名第一,τ-Voice 得分68.6%,Big Bench Audio 得分97.7%。
- 模型卡写明两款模型基于 Gemini 3 Pro,相比 3.7 Flash 没有实质性的新能力。
谷歌在9月15日推出了两款面向语音对话的模型:Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。谷歌首席工程师 Tom Ouyang 与谷歌技术人员 Malini Jaganathan 在发布文中把它们称为"我们迄今最先进的实时对话模型"。一款主打规模与成本效率,另一款负责复杂任务的多步推理。两款模型当天就在 Gemini API 和 Google AI Studio 向开发者开放,Gemini 3.8 Live 还直接进入了谷歌应用的 Search Live。
发布文里的分工很清楚。Gemini 3.8 Live 把对话智能、流畅的对话节奏和视觉理解结合在一起,面向大规模部署和成本效率;Gemini 3.8 Live Extended Thinking 则瞄准高难度任务,提升了智能水平和多步推理能力。对开发者和企业来说,它们是可上线的语音智能体的部件;在 Gemini 应用、Google Workspace 和搜索里,它们则是用语音交办复杂任务的入口。
数字集中在 Extended Thinking 这边。发布文称,该模型在 Artificial Analysis 的 Speech to Speech Quality Index 上以82.6分位列总榜第一,在智能体任务完成测试 τ-Voice 上得到68.6%,在 Sierra 的 τ-Voice-banking 上得到35.1%。推理测试 Big Bench Audio 的得分是97.7%。公司写道,Gemini 3.8 Live 在衡量用户偏好的 Speech Agent Arena 中排名第二。在 ServiceNow 的语音智能体评测 EVA-Bench 上,谷歌称两款模型兼顾了准确率与对话质量,推进了复杂工作流的帕累托前沿。
从工程师的角度看,比基准测试更重要的是模型在对话过程中处理工作的方式。Gemini 3.8 Live 会在后台执行工具和 API 调用,同时继续说话。它先回应已收到请求,然后在任务完成前不中断对话,这在设计阶段就消除了语音智能体最尴尬的沉默区间。它还能近乎实时地处理视觉输入并用作对话上下文,并在对话中自动识别和切换97种支持的语言。
Extended Thinking 在此之上加入了边想边说的能力。发布文解释说,该模型会一边推理一边说话,先用"我查一下"这样的短句接下请求,再对多步骤后台任务的进展进行实时口头播报。这种做法不是消除等待时间,而是用对话填满等待时间。文字聊天中用户盯着空白屏幕等推理模型给出答案的问题,在语音里被用另一种方式解决了。
模型的骨架写在模型卡里。根据 METAL 核对过的6页 Gemini 3.8 Audio 模型卡,两款模型都基于 Gemini 3 Pro 构建,可接收音频、图像、视频和文本,上下文窗口最多128K token,输出音频和文本最多64K token。知识截止日期为2025年1月。公司在前沿安全评估中以 Gemini 3.7 Flash 为基准,并写明两款新模型相比 3.7 Flash 没有实质性的新能力或性能的显著提升,因此不太可能达到任何受追踪的能力等级。METAL 曾报道过 Gemini 3.7 Flash 的发布。
分发路径在开发者一侧最宽。发布文称,开发者可以通过 Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents 等平台使用 Gemini Live API,公司解释说这些平台在幕后处理实时媒体流基础设施,开发者只需专注于用户体验。Salesforce、Genspark 和 Lumeris 正围绕两款模型的延迟、流畅度和工具调用能力展开合作。企业客户先通过 Gemini Enterprise 的私密预览获得访问,Gemini Enterprise for Customer Experience 和 Google Workspace 商业客户也将很快跟进。
普通用户最先在搜索里遇到它们。据报道,谷歌搜索工程副总裁 Rajan Patel 写道:"新的 Gemini 音频模型刚刚上线,3.8 Live 现在驱动着 Search Live 的实时对话。"他补充说,这带来了附带网页链接以便深入了解的回答、对话中切换语言的能力,以及更自然的互动。在谷歌应用里点击 Live 图标开口提问,就会收到语音回答,点"文字记录"按钮可以看文本,也可以在 AI Mode 历史中接着聊。Extended Thinking 则进入 Gemini Live、Google AI Pro 和 Ultra 订阅者的 Docs,以及所有 AI 订阅者的 Gmail 和 Keep。
竞争格局取决于语音模型的设计差异。METAL 曾报道OpenAI 通过 API 推出了能边听边说的全双工语音模型 GPT-Live-1。据报道,Gemini 3.8 Live Extended Thinking 在 Speech to Speech 排行榜上领先于 OpenAI 最新的 GPT-Live-1,但对手采用同时处理听与说的全双工架构,在对话自然度上可能仍占优,从演示来看声音也更好。那篇报道的结论是,谷歌这一次又把重心放在了价格而非质量上。
生成的每一段声音都带有标记。公司表示,其 AI 产品生成的所有音频都嵌入了 SynthID 水印。这种人耳无法察觉的水印直接编织进音频输出,让 AI 生成的内容保持可检测;随着语音智能体越来越多地进入电话和客服场景,这一标记的用途只会更大。
对于开发语音智能体的团队来说,这次发布值得记住的不是榜单名次,而是两个设计选择:工具调用不会阻断对话,推理以说话而不是沉默的形式呈现。这两点在真实服务中能否站得住,把模型接入 Gemini API 的团队会最先知道。既然模型卡写明相比 3.7 Flash 没有新能力,这次发布的价值就不在智能的跃升,而在模型边说话边工作的方式发生了变化。





评论