工作日早上 7 点读 AI,周日早上 8 点读周报订阅邮件

METAL LAB

谷歌Gemini 3.5 Transcribe上线,自动去除语音中的"嗯""啊"

Live和Live Experimental也一同发布,但6月就预告的3.5 Pro至今仍未现身

녹색 추상 배경 위에 검은색 Xbox 로고가 중앙에 있다

이미지: The Verge AI

摘要

  • 谷歌为Gemini音频模型家族新增了3.5 Transcribe、Live、Live Experimental三款模型
  • 3.5 Transcribe能自动去除口头禅词汇,并自动识别85种以上语言和专业术语
  • 新功能从8月26日起陆续应用于macOS版Gemini应用和安卓Rambler,但6月预告的Gemini 3.5 Pro依然没有上线
신규 모델
Gemini 3.5 Transcribe, Gemini 3.5 Live, Gemini 3.5 Live Experimental
지원 언어
85개 이상 자동 감지
화자 구분
사전 녹음 오디오 기준 최대 3명 구분 + 단어 단위 타임스탬프
배포 시작
2026년 8월 26일, 영어 기준 맥OS 제미나이 앱 전체
안드로이드 적용
일부 국가·언어의 램블러(Rambler) 받아쓰기 기능
개발자 접근
제미나이 API, AI 스튜디오, Antigravity 퍼블릭 프리뷰
비교 대상
이전 트랜스크립션 모델 Chirp 3 대비 다국어 성능·오류율 개선(구글 발표)
미출시 항목
6월 예고된 제미나이 3.5 프로, 아직 공개 안 됨

谷歌为负责语音转文字的Gemini音频模型家族换了一整套新阵容。这次发布的是Gemini 3.5 Transcribe、3.5 Live和3.5 Live Experimental三款模型,其中3.5 Transcribe是全新推出的模型。它能自动过滤掉人们说话时习惯性带出的"嗯""啊"之类的口头禅,还能自主识别85种以上语言并完成转录。

从谷歌延伸出两支箭头。一支实线箭头指向已经落地的三款音频模型(Transcribe、Live、Live Experimental),另一支虚线箭头则指向6月就已预告、如今仍是空白的3.5 Pro。图中显示旁支功能已经成型,而核心模型却仍停留在边界之外。

这次发布正值谷歌去年6月预告的Gemini 3.5 Pro迟迟未见踪影之际。旗舰模型音讯全无,反倒是音频这条产品线先完成了更新。谷歌在官方博客中曾提到过3.5 Pro的发布计划,但这次的音频模型公告里并未附上Pro版本的新时间表。

新增了哪些功能

谷歌表示,3.5 Transcribe相比上一代转录模型Chirp 3"有了大幅提升"。多语言处理能力和词错率(转录出错的比例)都得到了改善。用户如果提前录入特定词汇表,模型就能自动识别专业术语或特殊拼写,从而减少后续手动修改的工作量。针对预先录制的音频,该模型最多能区分并标注三位发言人,并为每个单词附上时间戳信息。

3.5 Live和3.5 Live Experimental是在支撑Gemini语音聊天模式的现有语音识别技术基础上做的更新。3.5 Live在用户中途停顿或切换语言时能更准确地理解语意,实时屏幕识别处理能力也有所增强。3.5 Live Experimental则更进一步,在处理复杂推理任务时能实时逐步讲解自己当下正在做什么。

模型核心功能主要用途
Gemini 3.5 Transcribe去除口头禅、自定义词汇、区分发言人录音转录
Gemini 3.5 Live应对中断和语言切换、实时屏幕处理语音聊天模式
Gemini 3.5 Live Experimental实时讲解推理过程复杂任务处理

如何使用

这次更新从8月26日起,已面向英语环境下macOS版Gemini应用的全体用户开放。macOS用户无需额外设置,在Gemini应用中使用语音输入或转录功能时会自动调用新模型。

安卓端目前仅在部分国家和语言范围内,应用于Rambler转录功能。开发者可以通过Gemini API、AI Studio或Antigravity,以公开预览的形式提前体验3.5 Transcribe。谷歌表示,Chrome端的支持也将很快跟进。

举个例子,把会议录音上传到3.5 Transcribe后,它会按发言人分类整理内容,并去除口头禅,生成一份干净的会议记录。在医疗、法律等专业术语密集的领域,如果提前录入术语表,就能减少每次手动修改的麻烦。

Gemini 3.5 Pro去哪了

谷歌的Gemini模型家族最近的更新速度明显加快。正如《Gemini 3.7 Flash现身,版本迭代速度加快》一文所述,8月12日至13日期间,Gemini 3.6 Flash测试横幅和3.7 Flash的模型名称先后被发现。然而6月预告的旗舰版3.5 Pro依然没有露面,这次的音频模型发布中也没有透露新的上线日期。

编辑视角

谷歌搁置旗舰模型、先补齐旁支模型的策略,这已经不是第一次了。打磨一款大语言模型,从安全性验证到大规模算力调配都需要时间,而在这期间不断推出语音、图像等专项模型,能维持住"Gemini仍在持续进化"的观感。这和OpenAI在筹备下一代GPT期间先更新语音、图像工具的做法如出一辙。

从实际使用转录模型的经验来看,去除口头禅和区分发言人这两项功能,能明显缩短整理会议记录所花的时间。上一代模型一旦混入背景噪音或说话中途停顿,错字就会明显增多,而这次3.5 Transcribe显然是精准针对这个痛点做的更新。不过自定义词汇录入和发言人区分等功能目前还处于API预览阶段,想要真正投入日常工作流程,恐怕还得再观察几周,等它稳定下来。

国内团队现在最先应该确认的是韩语支持何时到位——毕竟目前只是从英语环境的macOS开始落地。Chrome支持和韩语扩展的时间点,将直接决定实际能不能用上。至于Gemini 3.5 Pro,我倾向于认为很可能在下个月内正式发布——先稳定住音频模型再推出旗舰版本,这个顺序符合谷歌近期的一贯节奏。

评论