gemini-live-2.5-flash-native-audio
Google Gemini推出的实时语音对话AI模型,无需先把声音转成文字,而是直接听懂声音、直接用声音回应。
简单来说
gemini-live-2.5-flash-native-audio是Google Gemini开发的AI模型,专为与人进行实时语音对话而设计。
一般的语音对话AI通常先把声音转成文字,理解文字后生成答案,再把答案文字转换成语音说出来。这有点像听外语时,脑子里先浮现字幕,理解后再把答案翻译一遍才说出口。这个模型跳过了这道“翻译”步骤,直接把声音当作声音来听,并直接用声音作答。因此,它能捕捉到语气的颤抖、插话的时机等文字无法传达的信息,并及时作出反应。
名字中的“Live”指实时对话,“Flash”则表示这是更轻量、更快速的版本。与用文字问答的聊天机器人不同,它主要用于打造真正用声音交流的语音助手或客服代理等场景。
在报道中是这样出现的
在文章中,它常作为语音代理系统中的一个组件出现,例如“每个阶段都运行在gemini-live-2.5-flash-native-audio模型上”。容易被忽略的一点是,这意味着模型从一开始就直接处理声音的输入和输出,而不是先生成文字答案、之后再配上声音。
