Gemini 3.8 Live 는 정말 더 나은가 — 벤치마크 1위와 사람이 고른 1위가 갈렸다
요약. 구글이 9월 15일 실시간 음성 모델 두 종을 냈다. Gemini 3.8 Live 와 Gemini 3.8 Live Extended Thinking 이다. Artificial Analysis 의 Speech to Speech 종합 지수에서 Extended Thinking 이 82.6 으로 1위에 올랐다. 그런데 같은 사이트에서 사람이 직접 두 모델을 비교해 고른 선호도(Arena Elo)를 보면 Extended Thinking 은 990 으로 7위다. 구글 자사의 구형 경량 모델이 1,096 으로 그보다 높다. 지표 하나로 "더 낫다"고 말하기 어려운 상태다. 아래는 어떤 축에서 앞서고 어떤 축에서 뒤지는지, 그리고 실제로 서비스에 붙일 때 걸리는 제약이 무엇인지 정리한 것이다.
1. 무엇이 나왔나
| 항목 | 내용 |
|---|---|
| 공개일 | 2026년 9월 15일 |
| 모델 | Gemini 3.8 Live (기본) / Gemini 3.8 Live Extended Thinking (복잡한 작업용) |
| 성격 | 네이티브 음성-음성 모델. 음성 인식·생성·합성을 따로 잇지 않는다 |
| 제공 | Gemini API, AI Studio, Vertex AI, Search Live. 자체 배포 불가(호스팅 전용) |
| 언어 | 97개 언어. 대화 도중 전환을 감지한다 |
| 기타 | 비동기 함수 호출(도구 실행 중에도 대화 유지), 실시간 영상 입력, 생성 오디오에 SynthID 워터마크 |
Extended Thinking 쪽은 이름 그대로 말하면서 동시에 여러 단계를 추론한다. 도구를 호출해 결과를 받아야 답할 수 있는 상황을 겨냥한 변형이다.
2. 벤치마크 성적 — 종합은 1위가 맞다
Artificial Analysis 의 Speech to Speech Quality Index 기준이다. 이 지수는 네 가지를 각각 25% 씩 더해 만든다.
| 구성 요소 | 무엇을 재나 |
|---|---|
| Speech Reasoning | Big Bench Audio — 음성으로 주어진 추론 문제 |
| Agentic Performance | τ-Voice — 항공·소매·통신 고객 응대 작업의 완수도 |
| Arena Preference | 사람이 두 모델을 각각 써 보고 고른 선호도(Elo) |
| Task Success Rate | 작업 완료용 도구 호출을 제대로 했는지의 비율 |
종합 순위 상위권은 이렇다.
| 모델 | 종합 지수 | 시간당 비용 |
|---|---|---|
| Gemini 3.8 Live Extended Thinking (High) | 82.6 | $3.50 |
| GPT-Live-1 (Astra, medium) | 81.5 | $5.83 |
| Grok Voice Think Fast 2.0 High | 81.3 | $4.80 |
| GPT-Live-1 (Sol, low) | 80.1 | $4.47 |
| Gemini 3.8 Live | 76.0 | $0.84 |
| GPT-Realtime-2.1 High | 73.9 | $10.75 |
| Gemini 3.1 Flash Live High | 71.5 | $1.75 |
| Qwen Audio 3.0 Realtime Plus | 66.8 | $4.42 |
1위는 맞다. 그리고 가격 차이가 크다. 같은 표에서 OpenAI 의 GPT-Realtime-2.1 High 는 시간당 $10.75 인데 Gemini 3.8 Live 기본형은 $0.84 다.
3. 그런데 사람은 다른 모델을 골랐다
같은 사이트의 Arena Preference 는 사람 평가다. 참가자가 같은 시나리오를 숨겨진 두 모델로 각각 수행한 뒤 둘 중 하나를 고르게 하고, 그 투표를 Bradley-Terry 방식으로 Elo 로 환산한다. 시나리오는 35개이고 그중 15개가 도구 사용을 포함한다.
| 모델 | Arena Elo | 종합 지수 |
|---|---|---|
| Gemini 3.1 Flash Live Minimal | 1,096 | 63.9 |
| Gemini 3.8 Live | 1,083 | 76.0 |
| Gemini 3.1 Flash Live High | 1,063 | 71.5 |
| GPT-Live-1 (Sol, low) | 1,053 | 80.1 |
| GPT-Live-1 (Astra, medium) | 1,048 | 81.5 |
| Grok Voice Think Fast 2.0 High | 1,011 | 81.3 |
| Gemini 3.8 Live Extended Thinking | 990 | 82.6 |
종합 지수 1위인 Extended Thinking 이 사람 선호에서는 이 목록의 맨 아래다. 지수 최상위 모델이 사람 평가에서는 자사 구형 경량 모델보다 106점 낮다. 방향이 반대인 두 열을 같은 표에 놓으면 차이가 분명해진다.
4. 왜 갈리나
지수를 구성하는 네 축의 성적을 뜯어 보면 이유가 보인다.
| 축 | 3.8 Live | Extended Thinking |
|---|---|---|
| Big Bench Audio (음성 추론) | 91.7% | 97.7% |
| Full Duplex Bench (대화 흐름) | 96.1% | 91.9% |
| τ-Voice (에이전트 작업) | 30.1% | 68.6% |
| Arena Elo (사람 선호) | 1,083 | 990 |
| 첫 음성까지 걸린 시간 | 1.18초 | 1.35초 |
에이전트 작업 완수율이 30.1% 에서 68.6% 로 두 배 넘게 뛴다. 종합 지수의 절반이 에이전트 성능과 작업 성공률이므로 순위가 올라가는 건 당연하다. 반대로 대화 흐름(Full Duplex)은 96.1% 에서 91.9% 로 떨어지고, 첫 음성이 나오기까지도 0.17초 늘어난다.
추론하는 동안 대화의 리듬이 희생된다. 사람은 그 리듬을 느끼고 다른 모델을 고른 것으로 보인다. 도구를 부르고 결과를 받아 처리해야 하는 업무형 에이전트라면 Extended Thinking 쪽이 유리하고, 그냥 말이 잘 통해야 하는 상담·안내라면 기본형이나 더 가벼운 모델이 나을 수 있다는 뜻이다.
5. 축을 바꾸면 1위도 바뀐다
- 음성 추론 — Big Bench Audio 단독 최상위는 StepAudio 3 Realtime 99.7%, Qwen Audio 3.0 Realtime Plus 99.2% 다. Extended Thinking 의 97.7% 보다 높다. 두 모델은 에이전트·아레나 쪽 데이터가 없어 종합 지수 순위에는 올라오지 않는다
- 대화 흐름 — Full Duplex Bench 에서는 Qwen Audio 3.0 Realtime Plus 가 98.4%, GPT-Live-1(Sol) 이 97.3% 로 Extended Thinking(91.9%)보다 앞선다
- 응답 속도 — 첫 음성까지 걸리는 시간은 Deepslate Opal 이 0.44초로 가장 빠르다. Grok Voice Think Fast 2.0 이 0.70초로 뒤를 잇는다. Gemini 3.8 Live 는 1.18초다
- 가격 — 시간당 비용은 Gemini 3.8 Live 기본형이 $0.84 로 주요 모델 중 가장 낮은 축이다
"더 뛰어난가" 라는 질문에 하나로 답하기 어려운 이유가 여기 있다. 종합 지수는 1위, 음성 추론은 3위권, 대화 흐름은 중위권, 사람 선호는 7위, 가격은 최저 수준이다.
6. 가격 — 공식 단가
| 구분 | 단가 (100만 토큰) | 분당 환산 |
|---|---|---|
| 오디오 입력 | $3.00 | 약 $0.005 |
| 오디오 출력 | $12.00 | 약 $0.018 |
| 텍스트 입력 | $0.75 | — |
| 텍스트 출력 | $4.50 | — |
구글 공식 가격표는 3.8 Live 와 Extended Thinking 을 같은 단가로 묶어 두었다. 무료 티어도 있다. 앞의 표에 나온 시간당 $0.84 와 $3.50 은 Artificial Analysis 가 자체 트래픽 가정으로 환산한 값이라 공식 단가와는 계산 기준이 다르다. 예산을 잡을 때는 공식 토큰 단가를 쓰는 편이 안전하다.
7. 실제로 붙일 때 — 구조부터
구글이 같은 시기에 공개한 ADK 음성 에이전트 구축 영상을 보면 구조가 정리되어 있다. 기존 음성 시스템은 음성 인식 → 텍스트 생성 → 음성 합성을 차례로 잇는 파이프라인이었다. 텍스트 채팅에는 맞지만 대화에서는 2초의 침묵이 흐름을 깬다. 실시간 음성은 무전기가 아니라 전화처럼 동작해야 한다는 것이 출발점이다.
| 구성 | 역할 |
|---|---|
| Agent | 모델 + 성격 + 도구의 조합. 파이썬 함수를 붙이면 그게 능력이 된다 |
| Runner | 에이전트를 실행하고 통화 시작부터 종료까지 생명주기와 이벤트를 관리 |
| Session | 대화 상태 보관. 실시간에서는 메모리에 둬야 지연이 안 생긴다 |
입력과 출력이 동시에 흐르기 때문에 큐를 하나 두고 방향을 둘로 나눈다. 마이크 음성처럼 끊김 없이 이어지는 입력은 send_realtime 으로 보낸다. 침묵 구간도 계속 보내야 모델이 문장이 끝났는지 판단할 수 있다. 텍스트나 사진처럼 끝이 분명한 데이터는 send_content 를 쓴다. 러너는 양방향 통화를 이벤트 스트림으로 바꾸고, 사용자가 말을 자르면 interrupted 이벤트가 나와 재생 중인 음성을 즉시 끊는다.
8. 실제로 붙일 때 — 걸리는 것들
여기부터는 공식 문서에 적힌 제약과, 개발자들이 공개 채널에 올린 문제 보고다.
공식 제약
| 항목 | 값 |
|---|---|
| 세션 최대 길이 (음성 전용) | 15분 |
| 세션 최대 길이 (음성+영상) | 2분 |
| WebSocket 연결 수명 | 약 10분 |
| 세션 재개 토큰 유효기간 | 종료 후 2시간 |
| 오디오 입력 형식 | 16-bit PCM, 16kHz, 리틀엔디언 |
| 오디오 출력 형식 | 16-bit PCM, 24kHz, 리틀엔디언 |
| 영상 입력 | JPEG, 최대 1FPS |
세션은 context window compression 을 켜면 길이 제한을 풀 수 있다. 다만 기본값 그대로 두면 음성만 써도 15분에서 끊긴다. 상담처럼 길어지는 대화라면 재연결과 상태 복구를 처음부터 설계에 넣어야 한다.
브라우저에서 바로 연결할 때도 손이 간다. 브라우저 오디오는 보통 48kHz 인데 API 는 입력 16kHz, 출력 24kHz 로 고정이라 리샘플링을 직접 해야 한다. 대역 제한 필터 없이 변환하면 자음이 뭉개진다.
보고된 문제
- 지연 급증 — 구글 공식 개발자 포럼에 평소 8~10초이던 응답이 20~30초까지 늘었다는 보고가 있다. 코드 변경 없이 발생했고 Vertex AI Studio 에서도 같았다는 내용이다
- 연결 강제 종료 — 10~14분 대화 중 1008(Policy Violation), 1011(Internal Error) 로 끊긴다는 보고
- 도구 호출 중복 — 같은 함수 호출이 두 경로로 전달돼 중복 실행되는 이슈가 깃허브에 올라와 있다. 등록되지 않은 도구 이름을 모델이 부르면 응답 없이 멈추는 사례도 있다
- 동시 세션 한도 — 공식 문서에 수치가 없다. 포럼 답변은 공식 보장이 없으며 분당 토큰 기준으로 운영한다는 취지다. 증설은 별도 신청
- 전화 연동 — SIP 를 직접 지원하지 않아 Twilio 같은 브릿지가 필요하다. OpenAI Realtime 쪽은 네이티브 SIP 엔드포인트를 베타로 제공한다
- 세션별 비용 추적 — 콘솔이 합산만 보여 주고 세션 단위 토큰을 주는 API 가 없어 자체 로깅이 필요하다는 보고
덧붙이면 API 키 관리는 특히 주의할 부분이다. 공개된 저장소 등에서 유출된 구글 클라우드 키로 과금이 발생한 사례가 보도된 적이 있다. 키를 클라이언트에 두지 않는 구조가 기본이다.
9. OpenAI Realtime 과 비교하면
| 항목 | Gemini Live | OpenAI Realtime |
|---|---|---|
| 세션 최대 | 15분 (압축 시 연장) | 60분 |
| 전화(SIP) | 브릿지 필요 | 네이티브 엔드포인트(베타) |
| 말 끊기 처리 | 서버가 판단해 알림 | 클라이언트가 재생량을 지정 |
| 도구 호출 | 비동기 — 대화를 끊지 않음 | 단계가 명시적 |
| 오디오 형식 | 16k/24k 고정 | 비교적 유연 |
비교 글들의 결론은 대체로 갈린다. 장시간 세션과 전화 연동, 규정 준수가 걸린 업무에서는 OpenAI 쪽이 안정적인 출발점이라는 평가가 많고, 비용과 언어 범위, 영상 입력이 필요한 쪽에서는 Gemini 가 앞선다는 평가가 많다.
10. 정리 — 언제 쓰나
- 도구를 많이 부르는 업무형 에이전트 — Extended Thinking. 에이전트 작업 완수율이 기본형의 두 배 이상이다. 대신 첫 음성이 조금 늦고 대화 흐름 점수는 떨어진다
- 말이 잘 통해야 하는 상담·안내 — 기본형 3.8 Live. 사람 선호 점수가 더 높고 비용은 시간당 $0.84 수준이다. 더 가벼운 3.1 Flash Live 계열이 사람 평가에서 더 높다는 점도 참고할 만하다
- 정확한 음성 추론이 핵심 — 종합 순위 밖의 모델도 봐야 한다. Big Bench Audio 단독으로는 StepAudio·Qwen 계열이 더 높다
- 전화 기반 서비스 — SIP 브릿지 비용과 15분 세션 제한을 먼저 계산할 것
지표 하나로 줄 세우면 답이 하나로 나오지만, 지수를 구성하는 네 축은 서로 반대 방향으로 움직이기도 한다. 이번 경우가 그랬다. 어떤 대화를 만들 것인지부터 정하고 그 축의 숫자를 보는 편이 실제 선택에 가깝다.
출처
- Google — Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking
- Artificial Analysis — Speech to Speech Models and Providers
- Artificial Analysis — Speech to Speech 벤치마크 방법론
- Google — Live API 세션 관리 문서
- Google — Live API 개요(오디오 형식·프로토콜)
- Google — Gemini API 가격
- MarkTechPost — Gemini 3.8 Live 출시 정리
- Google 개발자 포럼 — Live API 지연 급증 보고
- Google 개발자 포럼 — 1008·1011 연결 종료와 함수 호출 문제
- Google 개발자 포럼 — 동시 세션 한도 문의에 대한 답변
- GitHub — 도구 호출 중복 전달 이슈
- Hacker News — Gemini Live API 구현 난이도 논의
- Google Cloud Tech — Build a real-time voice AI agent with Google ADK and Gemini Live API