
이미지: METAL
요약
- 구글이 9월 15일 Gemini 3.8 Live 와 Gemini 3.8 Live Extended Thinking 두 음성 모델을 Gemini API 와 Google AI Studio 에 열었어요.
- Extended Thinking 은 Speech to Speech Quality Index 82.6점 1위, τ-Voice 68.6%, Big Bench Audio 97.7% 를 기록했어요.
- 모델 카드는 두 모델이 Gemini 3 Pro 기반이며 3.7 Flash 대비 의미 있는 새 능력은 없다고 적었어요.
- 발표
- 2026년 9월 15일 · 구글 딥마인드 블로그 · 톰 오우양 수석 엔지니어 · 말리니 자가나탄
- 모델
- Gemini 3.8 Live(규모·비용 효율) · Gemini 3.8 Live Extended Thinking(다단계 추론)
- 벤치마크
- Speech to Speech Quality Index 82.6점 1위 · τ-Voice 68.6% · τ-Voice-banking 35.1% · Big Bench Audio 97.7%
- 3.8 Live
- Speech Agent Arena 2위 · 97개 언어 자동 전환 · 도구 호출을 대화 뒤편에서 실행
- 모델 카드
- Gemini 3 Pro 기반 · 입력 128K 토큰 · 출력 64K 토큰 · 지식 기준일 2025년 1월 · 6쪽
- 개발자 플랫폼
- Agora · Fishjam · LangChain · LiveKit · Pipecat · Vercel · Vision Agents
- 배포
- Gemini API · AI Studio · Search Live(3.8 Live) · Gemini Live · Docs · Gmail · Keep(Extended Thinking)
- 워터마크
- 생성 오디오 전부 SynthID
구글이 9월 15일 음성 대화용 모델 2종을 내놨어요. Gemini 3.8 Live 와 Gemini 3.8 Live Extended Thinking 이고, 톰 오우양 구글 수석 엔지니어와 말리니 자가나탄 구글 기술 스태프는 발표문에서 두 모델을 "우리의 가장 진보한 라이브 대화 모델" 이라고 소개했어요. 하나는 규모와 비용 효율을, 다른 하나는 복잡한 작업의 다단계 추론을 맡는 구성이에요. 두 모델은 같은 날부터 Gemini API 와 Google AI Studio 에서 개발자에게 열렸고, Gemini 3.8 Live 는 구글 앱의 Search Live 에도 곧바로 들어갔어요.
발표문에 따르면 역할 분담은 분명해요. Gemini 3.8 Live 는 대화 지능과 매끄러운 대화 흐름, 시각 정보 이해를 묶어 대량 배포와 비용 효율에 맞췄고, Gemini 3.8 Live Extended Thinking 은 고난도 작업을 겨냥해 지능과 다단계 추론을 끌어올렸어요. 개발자와 기업에는 실제 서비스에 올릴 수 있는 음성 에이전트의 부품이 되고, Gemini 앱과 Google Workspace, 검색에서는 음성으로 복잡한 일을 시키는 창구가 된다는 설명이에요.
수치는 Extended Thinking 쪽에 몰려 있어요. 발표문은 이 모델이 Artificial Analysis 의 Speech to Speech Quality Index 에서 82.6점으로 전체 1위에 올랐고, 에이전트 작업 완수 시험인 τ-Voice 에서 68.6%, Sierra 의 τ-Voice-banking 에서 35.1% 를 기록했다고 밝혔어요. 추론 시험인 Big Bench Audio 점수는 97.7% 예요. Gemini 3.8 Live 는 사용자 선호를 겨루는 Speech Agent Arena 에서 2위에 올랐다고 회사는 적었어요. ServiceNow 의 음성 에이전트 평가 EVA-Bench 에서는 정확도와 대화 품질을 함께 잡아 복잡한 워크플로의 파레토 경계를 밀어냈다는 표현을 썼어요.
엔지니어 눈으로 보면 벤치마크보다 중요한 건 대화 중에 일을 처리하는 방식이에요. Gemini 3.8 Live 는 도구 실행과 API 호출을 대화 뒤편에서 돌리면서 말을 이어 가요. 요청을 알아들었다고 답한 뒤 작업이 끝날 때까지 대화를 멈추지 않는 구조라, 음성 에이전트에서 가장 어색한 침묵 구간을 설계 단계에서 없앤 셈이에요. 시각 입력도 거의 실시간으로 처리해 대화의 맥락으로 쓰고, 지원 언어 97개를 대화 도중 자동으로 감지해 바꿔 타요.
Extended Thinking 은 여기에 생각과 말을 동시에 하는 능력을 얹었어요. 발표문은 이 모델이 추론하면서 동시에 말한다고 설명했고, "확인해 볼게요" 같은 짧은 말로 요청을 먼저 받아 준 뒤 여러 단계로 이어지는 뒤편 작업의 진행 상황을 말로 중계한다고 적었어요. 대기 시간을 없애는 대신 대기 시간을 대화로 채우는 접근이에요. 추론 모델이 답을 만드는 동안 사용자가 빈 화면을 보던 텍스트 채팅의 문제를 음성에서는 다르게 푼 거예요.
모델의 뼈대는 모델 카드에 적혀 있어요. 메탈이 확인한 6쪽짜리 Gemini 3.8 Audio 모델 카드에 따르면 두 모델은 Gemini 3 Pro 를 바탕으로 만들어졌고, 음성과 이미지, 영상, 텍스트를 최대 128K 토큰 문맥으로 받아 음성과 텍스트를 최대 64K 토큰으로 내놓아요. 지식 기준일은 2025년 1월이에요. 회사는 프론티어 안전 평가에서 Gemini 3.7 Flash 를 기준으로 삼았고, 두 새 모델이 3.7 Flash 에 견줘 의미 있는 새 능력이나 성능의 실질적 증가가 없다고 판단해 추적 대상 능력 수준에 이르지 않을 것으로 봤다고 적었어요. 메탈은 Gemini 3.7 Flash 출시를 보도한 바 있어요.
배포 경로는 개발자 쪽이 가장 넓어요. 발표문에 따르면 개발자는 Agora 와 Fishjam, LangChain, LiveKit, Pipecat, Vercel, Vision Agents 같은 플랫폼을 통해 Gemini Live API 를 쓸 수 있고, 이 플랫폼들이 실시간 미디어 스트리밍 인프라를 뒤에서 처리해 개발자는 사용자 경험만 만들면 된다고 회사는 설명했어요. Salesforce 와 Genspark, Lumeris 가 두 모델의 지연 시간과 매끄러움, 도구 호출 능력을 두고 협력 중이라는 대목도 있어요. 기업 고객에게는 Gemini Enterprise 비공개 프리뷰로 먼저 열리고, Gemini Enterprise for Customer Experience 와 Google Workspace 비즈니스 고객에게는 곧 확장돼요.
일반 사용자가 먼저 만나는 자리는 검색이에요. 보도에 따르면 라잔 파텔 구글 검색 엔지니어링 부사장은 "새 Gemini 오디오 모델이 막 나왔어요. 3.8 Live 가 이제 Search Live 의 실시간 대화를 돌리고 있어요" 라고 적었고, 더 깊이 들어갈 웹 링크가 답에 함께 붙고 대화 도중 언어를 바꿀 수 있으며 대화가 더 자연스러워진다고 덧붙였어요. 구글 앱에서 Live 아이콘을 누르고 말로 물으면 음성으로 답이 오고, 대화록 버튼으로 텍스트를 보거나 AI Mode 기록에서 이어 갈 수 있어요. Extended Thinking 은 Gemini Live 와 Google AI Pro·Ultra 구독자의 Docs, 모든 AI 구독자의 Gmail 과 Keep 에 들어가요.
경쟁 구도는 음성 모델의 설계 차이에서 갈려요. 메탈은 오픈AI 가 듣는 동시에 말하는 전이중 음성 모델 GPT-Live-1 을 API 로 냈다고 보도한 바 있어요. 보도에 따르면 Gemini 3.8 Live Extended Thinking 은 Speech to Speech 순위표에서 오픈AI 의 최신 GPT-Live-1 을 앞섰지만, 상대 모델은 듣기와 말하기를 동시에 처리하는 전이중 구조라 대화의 자연스러움에서는 여전히 앞설 수 있고, 시연 기준으로 소리도 더 낫다는 평가가 나와요. 구글이 이번에도 품질보다 가격에 무게를 뒀다는 해석이 그 보도의 결론이었어요.
생성된 소리에는 전부 표식이 붙어요. 회사는 자사 AI 제품이 만드는 모든 오디오에 SynthID 워터마크를 넣는다고 밝혔어요. 사람 귀에는 들리지 않는 표식을 오디오 출력 안에 직접 짜 넣어 AI 가 만든 내용이 탐지 가능하도록 유지한다는 설명이고, 음성 에이전트가 전화와 고객 응대에 들어갈수록 이 표식의 쓰임은 커져요.
음성 에이전트를 만드는 팀이 이번 발표에서 챙길 것은 벤치마크 순위보다 두 가지 설계예요. 도구 호출이 대화를 막지 않는다는 것, 그리고 추론이 침묵이 아니라 말로 드러난다는 것이에요. 이 둘이 실제 서비스에서 어떻게 버티는지는 Gemini API 에 올린 팀들이 먼저 알게 될 거예요. 모델 카드가 3.7 Flash 대비 새 능력이 없다고 적은 만큼, 이번 출시의 값은 지능의 도약이 아니라 대화 중에 일하는 방식의 변화에 있어요.





댓글