Gemini 3.5 Transcribe
谷歌DeepMind推出的语音转文字AI,在去除填充词、区分说话人功能之后,又预告了可注册专业术语的新功能。
简单来说
Gemini 3.5 Transcribe是谷歌DeepMind开发的一款AI模型,能把人说的话转成文字。可以把它想象成坐在会议室里、一边听录音一边记录的速记员。不过这位速记员会自动删掉“嗯”“啊”之类的口头禅,能自行识别85种以上的语言,如果录音里混有最多三个人的声音,它还会标出谁在什么时候说了话。
最近曝光的一张界面截图预告了一项新功能:提前给这位速记员一份词汇表。再厉害的速记员,遇到第一次听到的公司名或行业术语,也容易听成常见词而记错。因此谷歌正在准备一项自定义词汇表功能,让用户提前把公司名、产品名等生僻词列成清单注册进去,帮助模型优先准确识别这些词。
不过谷歌公布的界面本身就说明是“重新制作的示例,并非实际界面”,所以这项功能具体何时向所有用户开放、哪些设备和地区能率先使用,目前都还没有确定。
在报道中是这样出现的
亲手试一试
在支持该模型的应用中试着转写一段会议或采访录音,可以观察常见的公司名或专业术语最初是如何被听错的。等自定义词汇表功能真正开放后,把这些词加入清单,再重新转写同一段录音,对比识别准确度的变化,就能直观感受到这项功能的效果。
