METAL LAB

Gemini 3.5 Transcribe 预告专业术语直接注册功能

Google DeepMind 公开了自定义词汇表界面,展示了提高特定术语识别率的方向

음성 인식 데모 화면에 커스텀 단어와 다국어 인식 결과가 표시됨

이미지: @GoogleDeepMind (X) 영상 갈무리

摘要

  • Google DeepMind 在 X 上公开了语音识别模型 Gemini 3.5 Transcribe 的 "Custom vocabulary(自定义词汇表)"功能界面
  • 公开的截图中包含一个输入框,用户可以在其中直接注册 "NeuroWave" 这类陌生术语
  • 该模型自 8 月 26 日起已逐步应用于 macOS Gemini 应用,此次是在此基础上叠加了术语注册功能
原文视频

Google DeepMind 在 X 上公开了语音识别模型 Gemini 3.5 Transcribe 的一张新界面截图。配文只有简短一句话——"Gemini 3.5 Transcribe is our latest speech-to-text model for precise and intelligent transcriptions",但一同发布的截图透露了更多信息。界面标题是 "Custom vocabulary(自定义词汇表)",在 "Add terms..."输入框下方,注册了 "Gemini 3.5 Transcribe"、"NeuroWave" 等术语标签。这看起来是一项让用户直接输入公司名、产品名等模型容易遗漏的专有名词、从而提高识别准确率的功能。不过截图底部标注着 "Sequences shortened and screen images simulated. Compatibility and availability varies",Google 自己也说明了这张截图并非实际应用界面的原样呈现,而是重新构建的示例,功能的实际适用范围也可能因设备和地区而异。

实际产品演示视频

以下六段视频并非转载内容,而是来自 Google 官方发布文 和 Google 产品团队、开发者渠道公开的原始素材。其中四段出自 Google 官方发布文,另外两段分别由 Google AI Developers 和 Google AI Studio 产品负责人在 X 上发布,均为原始版本。

实时多语言转录

在讲话过程中切换语言,Gemini 3.5 Transcribe 也能无缝完成转写,这是 Google 官方演示。

视频:Google

macOS 应用中的屏幕上下文理解与功能调用

macOS 版 Gemini 应用理解屏幕上下文,通过语音完成写邮件、分析文件、生成图片等任务,这是 Google 官方演示。

视频:Google

macOS Gemini 应用语音输入

按住 Fn 键说话,无论在哪个应用中,系统都会去除口头禅和中途修改的内容,将整理后的句子输入到光标位置,这是 Google macOS 官方演示

视频:Google

Gboard Rambler 消息输入

在安卓系统中,Gboard Rambler 能去除口头禅并通过语音修改句子,这是 Google 官方演示。

视频:Google

Antigravity 的代码上下文识别

Google Antigravity 参考当前代码和文件名作为上下文,将语音输入准确转换,这是 Google AI Developers 发布的原始视频

视频:Google AI Developers

基于 Gemini 3.5 Transcribe 的听写应用

Google AI Studio 的 Lead Product + Design 负责人 Ammaar Reshi 用该模型亲自开发的听写应用,这是 官方原始演示

视频:Ammaar Reshi · Google AI Studio
当用户直接输入 "NeuroWave" 这类陌生术语并注册到自定义词汇表中,这份词汇表会以虚线相连的方式,有条件地弥补原本难以识别生僻术语的识别模型的短板。

正如 METAL LAB 在此前的报道中提到的,Gemini 3.5 Transcribe 是 8 月 26 日与 Gemini 3.5 Live、Live Experimental 一同发布的语音转文字模型。当时介绍的特点包括:自动去除讲话中出现的"嗯"、"啊"等填充词,能自动识别 85 种以上语言,在预先录制的音频中最多可区分 3 名说话人,并附带逐词时间戳。语音识别模型长期以来的一个弱点在于:常见词汇识别效果不错,但对训练数据中出现频率较低的品牌名、新造词、行业专业术语,识别错误率往往较高。仅仅增加自动识别的语言数量并不能解决这一问题,因此让用户自行填充术语表,一直是多款语音识别服务采用的补充方案。

这次公开的自定义词汇表界面究竟会在何时、以何种平台正式落地,仅凭这次发布还无法确认。不过考虑到 8 月 26 日的发布是以英语版 macOS Gemini 应用和部分国家的安卓 Rambler 听写功能为起点、逐步推广的方式,此次的术语注册功能很可能也会以类似的分阶段方式跟进推出。对于经常处理涉及特定专有名词或专业术语的会议记录、采访录音等工作的用户来说,这项功能一旦真正上线,是值得关注的一点。

이미지: @GoogleDeepMind (X)

编辑视角

此次公开中最值得关注的,并非语音识别准确率本身,而是通过术语注册和屏幕上下文理解来减少实际输入作业错误的方向,已经具体呈现出来。结合文章开头与下方的演示视频来看,可以确认同一款模型如何被应用到听写、消息撰写、代码工作等不同的输入场景中。

评论