Gemini 3.8 Live 는 정말 더 나은가 — 벤치마크 1위와 사람이 고른 1위가 갈렸다

요약. 구글이 9월 15일 실시간 음성 모델 두 종을 냈다. Gemini 3.8 Live 와 Gemini 3.8 Live Extended Thinking 이다. Artificial Analysis 의 Speech to Speech 종합 지수에서 Extended Thinking 이 82.6 으로 1위에 올랐다. 그런데 같은 사이트에서 사람이 직접 두 모델을 비교해 고른 선호도(Arena Elo)를 보면 Extended Thinking 은 990 으로 7위다. 구글 자사의 구형 경량 모델이 1,096 으로 그보다 높다. 지표 하나로 "더 낫다"고 말하기 어려운 상태다. 아래는 어떤 축에서 앞서고 어떤 축에서 뒤지는지, 그리고 실제로 서비스에 붙일 때 걸리는 제약이 무엇인지 정리한 것이다.

1. 무엇이 나왔나

항목내용
공개일2026년 9월 15일
모델Gemini 3.8 Live (기본) / Gemini 3.8 Live Extended Thinking (복잡한 작업용)
성격네이티브 음성-음성 모델. 음성 인식·생성·합성을 따로 잇지 않는다
제공Gemini API, AI Studio, Vertex AI, Search Live. 자체 배포 불가(호스팅 전용)
언어97개 언어. 대화 도중 전환을 감지한다
기타비동기 함수 호출(도구 실행 중에도 대화 유지), 실시간 영상 입력, 생성 오디오에 SynthID 워터마크

Extended Thinking 쪽은 이름 그대로 말하면서 동시에 여러 단계를 추론한다. 도구를 호출해 결과를 받아야 답할 수 있는 상황을 겨냥한 변형이다.

2. 벤치마크 성적 — 종합은 1위가 맞다

Artificial Analysis 의 Speech to Speech Quality Index 기준이다. 이 지수는 네 가지를 각각 25% 씩 더해 만든다.

구성 요소무엇을 재나
Speech ReasoningBig Bench Audio — 음성으로 주어진 추론 문제
Agentic Performanceτ-Voice — 항공·소매·통신 고객 응대 작업의 완수도
Arena Preference사람이 두 모델을 각각 써 보고 고른 선호도(Elo)
Task Success Rate작업 완료용 도구 호출을 제대로 했는지의 비율

종합 순위 상위권은 이렇다.

모델종합 지수시간당 비용
Gemini 3.8 Live Extended Thinking (High)82.6$3.50
GPT-Live-1 (Astra, medium)81.5$5.83
Grok Voice Think Fast 2.0 High81.3$4.80
GPT-Live-1 (Sol, low)80.1$4.47
Gemini 3.8 Live76.0$0.84
GPT-Realtime-2.1 High73.9$10.75
Gemini 3.1 Flash Live High71.5$1.75
Qwen Audio 3.0 Realtime Plus66.8$4.42

1위는 맞다. 그리고 가격 차이가 크다. 같은 표에서 OpenAI 의 GPT-Realtime-2.1 High 는 시간당 $10.75 인데 Gemini 3.8 Live 기본형은 $0.84 다.

3. 그런데 사람은 다른 모델을 골랐다

같은 사이트의 Arena Preference 는 사람 평가다. 참가자가 같은 시나리오를 숨겨진 두 모델로 각각 수행한 뒤 둘 중 하나를 고르게 하고, 그 투표를 Bradley-Terry 방식으로 Elo 로 환산한다. 시나리오는 35개이고 그중 15개가 도구 사용을 포함한다.

모델Arena Elo종합 지수
Gemini 3.1 Flash Live Minimal1,09663.9
Gemini 3.8 Live1,08376.0
Gemini 3.1 Flash Live High1,06371.5
GPT-Live-1 (Sol, low)1,05380.1
GPT-Live-1 (Astra, medium)1,04881.5
Grok Voice Think Fast 2.0 High1,01181.3
Gemini 3.8 Live Extended Thinking99082.6

종합 지수 1위인 Extended Thinking 이 사람 선호에서는 이 목록의 맨 아래다. 지수 최상위 모델이 사람 평가에서는 자사 구형 경량 모델보다 106점 낮다. 방향이 반대인 두 열을 같은 표에 놓으면 차이가 분명해진다.

4. 왜 갈리나

지수를 구성하는 네 축의 성적을 뜯어 보면 이유가 보인다.

3.8 LiveExtended Thinking
Big Bench Audio (음성 추론)91.7%97.7%
Full Duplex Bench (대화 흐름)96.1%91.9%
τ-Voice (에이전트 작업)30.1%68.6%
Arena Elo (사람 선호)1,083990
첫 음성까지 걸린 시간1.18초1.35초

에이전트 작업 완수율이 30.1% 에서 68.6% 로 두 배 넘게 뛴다. 종합 지수의 절반이 에이전트 성능과 작업 성공률이므로 순위가 올라가는 건 당연하다. 반대로 대화 흐름(Full Duplex)은 96.1% 에서 91.9% 로 떨어지고, 첫 음성이 나오기까지도 0.17초 늘어난다.

추론하는 동안 대화의 리듬이 희생된다. 사람은 그 리듬을 느끼고 다른 모델을 고른 것으로 보인다. 도구를 부르고 결과를 받아 처리해야 하는 업무형 에이전트라면 Extended Thinking 쪽이 유리하고, 그냥 말이 잘 통해야 하는 상담·안내라면 기본형이나 더 가벼운 모델이 나을 수 있다는 뜻이다.

5. 축을 바꾸면 1위도 바뀐다

  • 음성 추론 — Big Bench Audio 단독 최상위는 StepAudio 3 Realtime 99.7%, Qwen Audio 3.0 Realtime Plus 99.2% 다. Extended Thinking 의 97.7% 보다 높다. 두 모델은 에이전트·아레나 쪽 데이터가 없어 종합 지수 순위에는 올라오지 않는다
  • 대화 흐름 — Full Duplex Bench 에서는 Qwen Audio 3.0 Realtime Plus 가 98.4%, GPT-Live-1(Sol) 이 97.3% 로 Extended Thinking(91.9%)보다 앞선다
  • 응답 속도 — 첫 음성까지 걸리는 시간은 Deepslate Opal 이 0.44초로 가장 빠르다. Grok Voice Think Fast 2.0 이 0.70초로 뒤를 잇는다. Gemini 3.8 Live 는 1.18초다
  • 가격 — 시간당 비용은 Gemini 3.8 Live 기본형이 $0.84 로 주요 모델 중 가장 낮은 축이다

"더 뛰어난가" 라는 질문에 하나로 답하기 어려운 이유가 여기 있다. 종합 지수는 1위, 음성 추론은 3위권, 대화 흐름은 중위권, 사람 선호는 7위, 가격은 최저 수준이다.

6. 가격 — 공식 단가

구분단가 (100만 토큰)분당 환산
오디오 입력$3.00약 $0.005
오디오 출력$12.00약 $0.018
텍스트 입력$0.75
텍스트 출력$4.50

구글 공식 가격표는 3.8 Live 와 Extended Thinking 을 같은 단가로 묶어 두었다. 무료 티어도 있다. 앞의 표에 나온 시간당 $0.84 와 $3.50 은 Artificial Analysis 가 자체 트래픽 가정으로 환산한 값이라 공식 단가와는 계산 기준이 다르다. 예산을 잡을 때는 공식 토큰 단가를 쓰는 편이 안전하다.

7. 실제로 붙일 때 — 구조부터

구글이 같은 시기에 공개한 ADK 음성 에이전트 구축 영상을 보면 구조가 정리되어 있다. 기존 음성 시스템은 음성 인식 → 텍스트 생성 → 음성 합성을 차례로 잇는 파이프라인이었다. 텍스트 채팅에는 맞지만 대화에서는 2초의 침묵이 흐름을 깬다. 실시간 음성은 무전기가 아니라 전화처럼 동작해야 한다는 것이 출발점이다.

구성역할
Agent모델 + 성격 + 도구의 조합. 파이썬 함수를 붙이면 그게 능력이 된다
Runner에이전트를 실행하고 통화 시작부터 종료까지 생명주기와 이벤트를 관리
Session대화 상태 보관. 실시간에서는 메모리에 둬야 지연이 안 생긴다

입력과 출력이 동시에 흐르기 때문에 큐를 하나 두고 방향을 둘로 나눈다. 마이크 음성처럼 끊김 없이 이어지는 입력은 send_realtime 으로 보낸다. 침묵 구간도 계속 보내야 모델이 문장이 끝났는지 판단할 수 있다. 텍스트나 사진처럼 끝이 분명한 데이터는 send_content 를 쓴다. 러너는 양방향 통화를 이벤트 스트림으로 바꾸고, 사용자가 말을 자르면 interrupted 이벤트가 나와 재생 중인 음성을 즉시 끊는다.

8. 실제로 붙일 때 — 걸리는 것들

여기부터는 공식 문서에 적힌 제약과, 개발자들이 공개 채널에 올린 문제 보고다.

공식 제약

항목
세션 최대 길이 (음성 전용)15분
세션 최대 길이 (음성+영상)2분
WebSocket 연결 수명약 10분
세션 재개 토큰 유효기간종료 후 2시간
오디오 입력 형식16-bit PCM, 16kHz, 리틀엔디언
오디오 출력 형식16-bit PCM, 24kHz, 리틀엔디언
영상 입력JPEG, 최대 1FPS

세션은 context window compression 을 켜면 길이 제한을 풀 수 있다. 다만 기본값 그대로 두면 음성만 써도 15분에서 끊긴다. 상담처럼 길어지는 대화라면 재연결과 상태 복구를 처음부터 설계에 넣어야 한다.

브라우저에서 바로 연결할 때도 손이 간다. 브라우저 오디오는 보통 48kHz 인데 API 는 입력 16kHz, 출력 24kHz 로 고정이라 리샘플링을 직접 해야 한다. 대역 제한 필터 없이 변환하면 자음이 뭉개진다.

보고된 문제

  • 지연 급증 — 구글 공식 개발자 포럼에 평소 8~10초이던 응답이 20~30초까지 늘었다는 보고가 있다. 코드 변경 없이 발생했고 Vertex AI Studio 에서도 같았다는 내용이다
  • 연결 강제 종료 — 10~14분 대화 중 1008(Policy Violation), 1011(Internal Error) 로 끊긴다는 보고
  • 도구 호출 중복 — 같은 함수 호출이 두 경로로 전달돼 중복 실행되는 이슈가 깃허브에 올라와 있다. 등록되지 않은 도구 이름을 모델이 부르면 응답 없이 멈추는 사례도 있다
  • 동시 세션 한도 — 공식 문서에 수치가 없다. 포럼 답변은 공식 보장이 없으며 분당 토큰 기준으로 운영한다는 취지다. 증설은 별도 신청
  • 전화 연동 — SIP 를 직접 지원하지 않아 Twilio 같은 브릿지가 필요하다. OpenAI Realtime 쪽은 네이티브 SIP 엔드포인트를 베타로 제공한다
  • 세션별 비용 추적 — 콘솔이 합산만 보여 주고 세션 단위 토큰을 주는 API 가 없어 자체 로깅이 필요하다는 보고

덧붙이면 API 키 관리는 특히 주의할 부분이다. 공개된 저장소 등에서 유출된 구글 클라우드 키로 과금이 발생한 사례가 보도된 적이 있다. 키를 클라이언트에 두지 않는 구조가 기본이다.

9. OpenAI Realtime 과 비교하면

항목Gemini LiveOpenAI Realtime
세션 최대15분 (압축 시 연장)60분
전화(SIP)브릿지 필요네이티브 엔드포인트(베타)
말 끊기 처리서버가 판단해 알림클라이언트가 재생량을 지정
도구 호출비동기 — 대화를 끊지 않음단계가 명시적
오디오 형식16k/24k 고정비교적 유연

비교 글들의 결론은 대체로 갈린다. 장시간 세션과 전화 연동, 규정 준수가 걸린 업무에서는 OpenAI 쪽이 안정적인 출발점이라는 평가가 많고, 비용과 언어 범위, 영상 입력이 필요한 쪽에서는 Gemini 가 앞선다는 평가가 많다.

10. 정리 — 언제 쓰나

  • 도구를 많이 부르는 업무형 에이전트 — Extended Thinking. 에이전트 작업 완수율이 기본형의 두 배 이상이다. 대신 첫 음성이 조금 늦고 대화 흐름 점수는 떨어진다
  • 말이 잘 통해야 하는 상담·안내 — 기본형 3.8 Live. 사람 선호 점수가 더 높고 비용은 시간당 $0.84 수준이다. 더 가벼운 3.1 Flash Live 계열이 사람 평가에서 더 높다는 점도 참고할 만하다
  • 정확한 음성 추론이 핵심 — 종합 순위 밖의 모델도 봐야 한다. Big Bench Audio 단독으로는 StepAudio·Qwen 계열이 더 높다
  • 전화 기반 서비스 — SIP 브릿지 비용과 15분 세션 제한을 먼저 계산할 것

지표 하나로 줄 세우면 답이 하나로 나오지만, 지수를 구성하는 네 축은 서로 반대 방향으로 움직이기도 한다. 이번 경우가 그랬다. 어떤 대화를 만들 것인지부터 정하고 그 축의 숫자를 보는 편이 실제 선택에 가깝다.

출처

화이트래빗스토리
yh.kim@wrstory.com
서울시 마포구 망원로3길 38, 3층 305호
사업자 번호 : 848-34-01027
통신판매업신고 : 2022-서울마포-1663
wrstory.com © 2023 All rights reserved