
이미지: The Verge AI
摘要
- 谷歌为Gemini音频模型家族新增了3.5 Transcribe、Live、Live Experimental三款模型
- 3.5 Transcribe能自动去除口头禅词汇,并自动识别85种以上语言和专业术语
- 新功能从8月26日起陆续应用于macOS版Gemini应用和安卓Rambler,但6月预告的Gemini 3.5 Pro依然没有上线
- 신규 모델
- Gemini 3.5 Transcribe, Gemini 3.5 Live, Gemini 3.5 Live Experimental
- 지원 언어
- 85개 이상 자동 감지
- 화자 구분
- 사전 녹음 오디오 기준 최대 3명 구분 + 단어 단위 타임스탬프
- 배포 시작
- 2026년 8월 26일, 영어 기준 맥OS 제미나이 앱 전체
- 안드로이드 적용
- 일부 국가·언어의 램블러(Rambler) 받아쓰기 기능
- 개발자 접근
- 제미나이 API, AI 스튜디오, Antigravity 퍼블릭 프리뷰
- 비교 대상
- 이전 트랜스크립션 모델 Chirp 3 대비 다국어 성능·오류율 개선(구글 발표)
- 미출시 항목
- 6월 예고된 제미나이 3.5 프로, 아직 공개 안 됨
谷歌为负责语音转文字的Gemini音频模型家族换了一整套新阵容。这次发布的是Gemini 3.5 Transcribe、3.5 Live和3.5 Live Experimental三款模型,其中3.5 Transcribe是全新推出的模型。它能自动过滤掉人们说话时习惯性带出的"嗯""啊"之类的口头禅,还能自主识别85种以上语言并完成转录。
这次发布正值谷歌去年6月预告的Gemini 3.5 Pro迟迟未见踪影之际。旗舰模型音讯全无,反倒是音频这条产品线先完成了更新。谷歌在官方博客中曾提到过3.5 Pro的发布计划,但这次的音频模型公告里并未附上Pro版本的新时间表。
新增了哪些功能
谷歌表示,3.5 Transcribe相比上一代转录模型Chirp 3"有了大幅提升"。多语言处理能力和词错率(转录出错的比例)都得到了改善。用户如果提前录入特定词汇表,模型就能自动识别专业术语或特殊拼写,从而减少后续手动修改的工作量。针对预先录制的音频,该模型最多能区分并标注三位发言人,并为每个单词附上时间戳信息。
3.5 Live和3.5 Live Experimental是在支撑Gemini语音聊天模式的现有语音识别技术基础上做的更新。3.5 Live在用户中途停顿或切换语言时能更准确地理解语意,实时屏幕识别处理能力也有所增强。3.5 Live Experimental则更进一步,在处理复杂推理任务时能实时逐步讲解自己当下正在做什么。
| 模型 | 核心功能 | 主要用途 |
|---|---|---|
| Gemini 3.5 Transcribe | 去除口头禅、自定义词汇、区分发言人 | 录音转录 |
| Gemini 3.5 Live | 应对中断和语言切换、实时屏幕处理 | 语音聊天模式 |
| Gemini 3.5 Live Experimental | 实时讲解推理过程 | 复杂任务处理 |
如何使用
这次更新从8月26日起,已面向英语环境下macOS版Gemini应用的全体用户开放。macOS用户无需额外设置,在Gemini应用中使用语音输入或转录功能时会自动调用新模型。
安卓端目前仅在部分国家和语言范围内,应用于Rambler转录功能。开发者可以通过Gemini API、AI Studio或Antigravity,以公开预览的形式提前体验3.5 Transcribe。谷歌表示,Chrome端的支持也将很快跟进。
举个例子,把会议录音上传到3.5 Transcribe后,它会按发言人分类整理内容,并去除口头禅,生成一份干净的会议记录。在医疗、法律等专业术语密集的领域,如果提前录入术语表,就能减少每次手动修改的麻烦。
Gemini 3.5 Pro去哪了
谷歌的Gemini模型家族最近的更新速度明显加快。正如《Gemini 3.7 Flash现身,版本迭代速度加快》一文所述,8月12日至13日期间,Gemini 3.6 Flash测试横幅和3.7 Flash的模型名称先后被发现。然而6月预告的旗舰版3.5 Pro依然没有露面,这次的音频模型发布中也没有透露新的上线日期。
编辑视角
谷歌搁置旗舰模型、先补齐旁支模型的策略,这已经不是第一次了。打磨一款大语言模型,从安全性验证到大规模算力调配都需要时间,而在这期间不断推出语音、图像等专项模型,能维持住"Gemini仍在持续进化"的观感。这和OpenAI在筹备下一代GPT期间先更新语音、图像工具的做法如出一辙。
从实际使用转录模型的经验来看,去除口头禅和区分发言人这两项功能,能明显缩短整理会议记录所花的时间。上一代模型一旦混入背景噪音或说话中途停顿,错字就会明显增多,而这次3.5 Transcribe显然是精准针对这个痛点做的更新。不过自定义词汇录入和发言人区分等功能目前还处于API预览阶段,想要真正投入日常工作流程,恐怕还得再观察几周,等它稳定下来。
国内团队现在最先应该确认的是韩语支持何时到位——毕竟目前只是从英语环境的macOS开始落地。Chrome支持和韩语扩展的时间点,将直接决定实际能不能用上。至于Gemini 3.5 Pro,我倾向于认为很可能在下个月内正式发布——先稳定住音频模型再推出旗舰版本,这个顺序符合谷歌近期的一贯节奏。




评论