INSIGHT
Deep Insight Into
IT Technology & Trends

통찰력 있는 사람들이 함께하는 젊고 열정적인 IT 기업, 비젠메디컬.

제미나이 3.8 라이브, 음성 에이전트 써보기

제미나이 3.8 라이브, 음성 에이전트 써보기 - 구글이 2026년 9월 15일, Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinki

0
조회수 아이콘 37
#제미나이38라이브 #Gemini38Live #음성AI에이전트 #실시간음성대화 #AI음성자동화 #GeminiLiveAPI #오디오투오디오모델 #음성AI개발 #AI에이전트구축 #실시간AI대화
2026-09-19 06:41

제미나이 3.8 라이브, 음성 에이전트 써보기

# 제미나이 3.8 라이브, 음성 에이전트 써보기

2026년 9월 개발자가 지금 바로 확인해야 할 Gemini 3.8 Live 체크리스트

구글이 2026년 9월 15일, Gemini 3.8 LiveGemini 3.8 Live Extended Thinking을 정식(GA)으로 출시했습니다. 두 모델 모두 실시간 음성 에이전트를 위한 오디오-투-오디오 모델이며, 개발자는 Gemini API와 Google AI Studio에서 즉시 사용할 수 있습니다.

TL;DR

Gemini 3.8 Live는 저지연 실시간 대화, 음성 스트리밍, 비동기 함수 호출, 검색 기반 응답을 지원하며 이미지·오디오·비디오 입력을 처리합니다. 다만 코드 실행, 파일 검색, 구조화된 출력은 지원하지 않습니다.

Extended Thinking 버전은 음성 대화를 스트리밍으로 유지하면서 백그라운드 추론과 비동기 도구 호출을 수행하도록 설계됐습니다. 두 모델 모두 입력 토큰 131,072개, 출력 토큰 65,536개로 한도가 동일하며, 오디오 입력은 분당 0.005달러, 오디오 출력은 분당 0.018달러로 가격이 책정됐습니다.

97개 이상의 언어를 지원한다는 점도 눈에 띄는 대목입니다. 이번 글에서는 두 모델의 차이, 실제로 시험해보는 흐름, 그리고 구현 전에 반드시 확인해야 할 항목을 정리합니다.

구글 제미나이 3.8 라이브 음성 에이전트 모델 소개 이미지

실시간 음성 AI 시장, 오디오 네이티브 모델로 넘어가는 중

음성 AI 에이전트 시장은 텍스트를 거치지 않는 오디오 네이티브 방식으로 빠르게 이동하고 있습니다. 기존에는 음성을 텍스트로 변환(STT)하고, 텍스트로 응답을 생성한 뒤 다시 음성으로 합성(TTS)하는 3단계 파이프라인이 표준이었습니다. 이 구조는 각 단계마다 지연이 누적되고, 억양·감정 같은 비언어적 정보가 텍스트 변환 과정에서 손실되는 한계가 있었습니다.

Gemini 3.8 Live는 이 파이프라인을 오디오-투-오디오 구조로 직접 처리합니다. 텍스트·이미지·오디오·비디오를 입력으로 받아 텍스트와 오디오를 함께 출력하는 방식입니다. 이런 구조 변화는 음성 에이전트가 단순 챗봇을 넘어 실제 업무 자동화 도구로 확장될 수 있는 기반이 됩니다.

구글은 이번 발표에서 시각적 맥락 처리, 다국어 지원, 실시간 비동기 도구 실행을 핵심 기능으로 제시했습니다. 특히 97개 이상의 언어 지원은 단일 모델로 다국어 고객 응대나 다국적 서비스를 구축할 수 있다는 의미를 갖습니다. 별도로 공개된 음성-텍스트 전용 모델 Gemini 3.5 Transcribe는 85개 이상의 언어를 지원하며 스트리밍 평균 단어 오류율(WER) 4.0%를 제시했습니다. 이는 Live 모델과는 별도 트랙이지만, 구글이 음성 처리 전반에 걸쳐 동시에 투자하고 있다는 신호로 읽힙니다.

시장 관점에서 보면, 음성 인터페이스는 더 이상 스마트 스피커나 콜센터 IVR에 머물지 않습니다. 예약 확인, 주문 접수, 상담 접수, 사내 업무 질의응답까지 실시간 음성으로 처리하려는 시도가 늘고 있고, 그 기반 모델이 GA 단계로 넘어왔다는 점이 이번 발표의 핵심입니다.

제미나이 3.8 라이브와 익스텐디드 씽킹 토큰 한도 및 가격 비교 차트

토큰 한도와 오디오 가격, 숫자로 확인하는 두 모델의 스펙

Gemini 3.8 Live와 Extended Thinking은 토큰 한도가 완전히 동일하지만, 권장 용도는 명확히 나뉩니다. 두 모델 모두 입력 토큰 131,072개, 출력 토큰 65,536개를 지원합니다. 스펙상 숫자만 보면 차이가 없어 보이지만, 구글은 기본 Gemini 3.8 Live를 대부분의 저지연 음성 에이전트에 권장하고, Extended Thinking은 높은 수준의 백그라운드 추론이 필요한 실시간 상호작용에 권장한다고 명시했습니다.

이 구분은 단순한 마케팅 문구가 아니라 실제 동작 방식의 차이에서 나옵니다. 기본 Live 모델은 응답 속도를 우선하는 구조이고, Extended Thinking은 음성 대화의 스트리밍 흐름을 유지하면서도 내부적으로 백그라운드 추론과 비동기 도구 호출을 병행하도록 설계됐습니다. 즉, 사용자가 말을 걸고 있는 동안에도 모델이 뒤에서 복잡한 판단이나 외부 도구 호출을 처리할 수 있다는 뜻입니다.

가격 구조도 함께 확인해야 할 항목입니다. 오디오 입력 가격은 분당 0.005달러, 오디오 출력 가격은 분당 0.018달러로 책정됐습니다. 오디오 출력이 입력보다 약 3.6배 비싼 구조이기 때문에, 음성 에이전트를 설계할 때는 모델이 얼마나 길게, 얼마나 자주 말하게 할지가 비용에 직결됩니다. 응답을 간결하게 유지하도록 프롬프트를 설계하는 것이 비용 관리 측면에서 실질적인 변수가 됩니다.

모델 ID도 실무에서 바로 필요한 정보입니다. 안정 버전 기준으로 기본 모델은 `gemini-3.8-live`, Extended Thinking은 `gemini-3.8-live-extended-thinking`으로 지정돼 있습니다. API 호출 시 이 ID를 정확히 지정해야 원하는 모델이 동작합니다.

Gemini API와 AI Studio, 실제로 어디서 어떻게 시험해볼 수 있나

Gemini 3.8 Live를 시험해보는 진입점은 Gemini API와 Google AI Studio, 두 경로로 나뉩니다. 구글은 2026년 9월 15일 발표에서 개발자가 두 환경 모두에서 이 모델들을 사용할 수 있다고 명시했습니다. 실무 관점에서 두 경로는 목적이 다릅니다.

Google AI Studio는 코드 작성 없이 브라우저에서 음성 대화를 즉시 테스트해볼 수 있는 환경입니다. 모델의 응답 톤, 다국어 처리 품질, 기본적인 대화 흐름을 빠르게 확인하고 싶을 때 적합합니다. 실제 서비스에 붙이기 전, 프로토타입 단계에서 모델의 특성을 파악하는 용도로 활용도가 높습니다.

Gemini API는 실제 애플리케이션에 통합하는 단계에서 사용합니다. 이 단계에서는 몇 가지 사전 확인이 필요합니다.

첫째, 입력·출력 형식을 확인해야 합니다.
Gemini 3.8 Live 계열은 텍스트·이미지·오디오·비디오를 입력으로 받고, 텍스트와 오디오만 출력합니다.
구조화된 출력(예: JSON 강제 포맷)을 요구하는 워크플로우라면 이 제약을 미리 감안해야 합니다.

둘째, 비동기 함수 호출 모드를 결정해야 합니다.
Gemini 3.8 Live의 함수 호출은 기본값이 `NON_BLOCKING` 모드입니다.
음성 대화가 함수 실행을 기다리며 멈추지 않고, 대화 흐름을 유지한 채 백그라운드에서 함수가 처리됩니다.
기존 시스템과의 호환성이 필요한 경우에는 `BLOCKING` 모드로 전환해 설정할 수도 있습니다.

셋째, 지원하지 않는 기능을 미리 파악해야 합니다.
코드 실행, 파일 검색, 구조화된 출력은 Gemini 3.8 Live에서 지원하지 않습니다.
이런 기능이 필요한 워크플로우라면 별도의 모델이나 파이프라인 결합을 검토해야 합니다.

넷째, 모델 선택 기준을 정해야 합니다.
단순 응대나 일반적인 고객 질의응답이라면 기본 Gemini 3.8 Live로 충분합니다.
반면 예약 시스템 조회, 재고 확인, 외부 API 연동처럼 대화 중간에 복잡한 판단과 도구 호출이 필요하다면 Extended Thinking을 검토하는 것이 구글의 권장 방향입니다.

이 네 가지를 먼저 점검한 뒤 프로토타입을 만들고, AI Studio에서 대화 품질을 확인한 다음 API로 통합하는 순서가 실무에서 가장 시행착오가 적은 흐름입니다.

오디오 네이티브 처리 구조와 비동기 함수 호출 동작 방식 다이어그램

기본 모델과 Extended Thinking, 무엇이 다르고 누가 써야 하나

기본 Gemini 3.8 Live와 Extended Thinking의 차이는 스펙이 아니라 "생각하는 방식"에 있습니다. 두 모델은 앞서 확인했듯 토큰 한도, 입출력 형식, 지원 언어까지 동일한 조건을 갖고 있습니다. 그럼에도 구글이 별도 모델로 분리해 출시한 이유는 실시간 음성 대화에서 요구되는 처리 방식이 다르기 때문입니다.

기본 모델은 응답 속도를 최우선으로 설계됐습니다. 사용자가 말을 마치면 최대한 빠르게 자연스러운 음성으로 답하는 것이 목표입니다. 간단한 안내, FAQ 응대, 예약 확인처럼 즉답이 중요한 상황에 적합합니다.

Extended Thinking은 대화의 자연스러움을 유지하면서도 뒤에서 더 깊은 처리를 병행하는 구조입니다. 음성 스트리밍을 끊지 않고 백그라운드 추론과 비동기 도구 호출을 동시에 수행하도록 설계됐다는 점이 공식적으로 확인된 특징입니다. 사용자가 "이번 주말 예약 가능한 시간 알려줘"라고 말하면, 모델이 대화를 이어가는 동시에 내부적으로 여러 조건을 조합해 판단하는 상황에 더 적합한 구조입니다.

시장에는 다양한 형태의 음성 AI 도구가 존재합니다. 임대형 음성봇 플랫폼은 특정 업종에 맞춰진 템플릿을 빠르게 붙일 수 있는 장점이 있고, 오픈소스 음성 파이프라인은 커스터마이징 자유도가 높지만 STT·LLM·TTS를 직접 조합해야 하는 부담이 있습니다. Gemini Live API 계열은 오디오 네이티브 구조와 비동기 도구 호출을 기본 제공한다는 점에서, 처음부터 복잡한 파이프라인을 조립하지 않고 API 레벨에서 실시간 음성 로직을 구성하려는 경우에 검토할 만한 선택지입니다.

기본 제미나이 3.8 라이브와 익스텐디드 씽킹 모델 기능 비교표

변화 요인 ① — 오디오 네이티브 처리와 비동기 함수 호출 구조

기술적 변화의 핵심은 음성을 텍스트로 바꾸지 않고 오디오 상태 그대로 처리하는 구조와, 대화를 멈추지 않는 비동기 함수 호출 방식입니다. 이 두 가지가 결합되면서 음성 에이전트가 "대화하면서 동시에 일하는" 형태로 진화했습니다.

기존 방식에서는 함수 호출이 발생하면 대화가 멈추고 결과를 기다려야 하는 경우가 많았습니다. 사용자는 "잠시만요"라는 침묵을 견뎌야 했습니다. Gemini 3.8 Live의 함수 호출은 기본값이 `NON_BLOCKING`으로 설정돼, 함수가 처리되는 동안에도 대화 흐름이 끊기지 않도록 설계됐습니다. 기존 시스템과의 호환이 필요한 경우 `BLOCKING` 모드도 선택할 수 있어, 점진적인 마이그레이션이 가능한 구조입니다.

또한 텍스트·이미지·오디오·비디오를 함께 입력받을 수 있다는 점은, 음성만으로 부족한 맥락을 시각 정보로 보완할 수 있다는 의미입니다. 예를 들어 화면 공유나 사진을 함께 전달하면서 음성으로 질문하는 형태의 상호작용이 API 레벨에서 지원됩니다.

오디오 과금 구조 분당 비용 계산 및 비용 최적화 전략 안내

변화 요인
② — 오디오 과금 구조가 만드는 새로운 비용 설계

음성 에이전트 도입을 검토할 때 가장 먼저 바뀌는 것은 비용을 계산하는 방식 자체입니다. 텍스트 기반 API는 토큰 수로 비용을 추정했지만, 오디오 네이티브 모델은 분(minute) 단위로 과금됩니다. 오디오 입력은 분당 0.005달러, 오디오 출력은 분당 0.018달러로, 출력 쪽 비용이 입력보다 훨다 높은 비대칭 구조입니다.

이 비대칭 구조는 시장에도 영향을 줍니다. 음성 에이전트를 오래 운영할수록 "모델이 얼마나 말을 길게 하는가"가 총비용을 좌우하는 핵심 변수가 됩니다. 짧고 명확한 응답을 유도하도록 시스템 프롬프트를 설계하는 것이 단순한 UX 개선이 아니라 비용 최적화 전략이 되는 셈입니다.

또한 97개 이상의 언어 지원은 다국어 서비스를 별도 모델 없이 하나의 API로 처리할 수 있다는 의미이기도 합니다. 언어별로 다른 엔진을 조합해야 했던 기존 방식 대비, 시장 진입 장벽을 낮추는 요인으로 작동할 가능성이 있습니다.

음성 AI 개발자 커뮤니티 관심사 지연 시간 및 도구 호출 중요성

개발자 커뮤니티가 주목하는 지점, 지연과 도구 호출

개발자 커뮤니티에서 가장 많이 언급되는 지점은 대화 중 지연 없이 도구를 호출할 수 있느냐는 부분입니다. 공식 자료에서 구체적인 응답 속도 수치는 제시되지 않았지만, `NON_BLOCKING` 함수 호출을 기본값으로 설정했다는 사실 자체가 이 문제를 정면으로 겨냥한 설계라는 점은 분명합니다.

한 음성 AI 개발 관련 논의에서는 "실시간 음성 인터페이스의 완성도는 결국 대화가 끊기지 않는 경험에서 결정된다"는 평가가 반복적으로 등장합니다. 이는 특정 모델에 대한 평가라기보다, 음성 에이전트 시장 전체가 공통으로 안고 있는 과제이기도 합니다. 기능이 많아질수록 대화 중 멈춤이 늘어나는 트레이드오프를 어떻게 해소하느냐가 관건이라는 시각입니다.

구글이 기본 Live 모델과 Extended Thinking을 용도별로 나눠 제시한 것도 이런 트레이드오프에 대한 응답으로 해석할 수 있습니다. 모든 상황에서 하나의 모델로 최적화하기보다, 응답 속도가 중요한 경우와 백그라운드 추론이 중요한 경우를 구분해 선택권을 주는 방식입니다.

실시간 음성 에이전트 대화 연속성 유지 기술 특징 설명

향후 6~12개월, 도구 생태계 확장이 관전 포인트

앞으로 6~12개월은 Gemini 3.8 Live 자체의 성능 경쟁보다, 이를 감싸는 도구와 통합 생태계가 얼마나 빠르게 확장되는지가 관전 포인트가 될 가능성이 높습니다. GA 출시는 시작점일 뿐이고, 실제 서비스 품질은 여기에 연결되는 함수 호출 대상, 검색 연동, 다국어 처리 실사용 품질에서 갈릴 것으로 보입니다.

구조화된 출력과 코드 실행이 현재 지원되지 않는다는 점은, 향후 업데이트에서 보완될 가능성이 있는 영역으로 볼 수 있습니다. 다만 이는 아직 발표되지 않은 계획이므로, 현재 시점에서는 "지원하지 않는다"는 사실만 확정적으로 다뤄야 합니다. 개발자 입장에서는 이 제약을 감안해 별도 파이프라인으로 보완하는 임시 설계가 여전히 필요합니다.

또한 Extended Thinking 모델의 실사용 사례가 쌓이면서, 어떤 업무 유형에 백그라운드 추론이 실질적 효과를 내는지에 대한 커뮤니티 벤치마크와 사용 후기가 누적될 것으로 예상됩니다. 이런 실사용 데이터는 모델 선택 기준을 더 구체화하는 데 도움이 될 것입니다.

제미나이 3.8 라이브 향후 도구 생태계 확장 및 발전 방향

향후 3~5년, 음성이 텍스트 인터페이스를 보완하는 방향

중장기적으로는 음성이 텍스트 입력을 완전히 대체하기보다, 상황에 맞는 병렬 인터페이스로 자리 잡을 가능성이 높습니다. 오디오 네이티브 모델이 표준화되면서 음성 응대의 자연스러움은 계속 개선될 것으로 보이지만, 정확한 문서 작업이나 정밀한 데이터 입력처럼 텍스트가 여전히 유리한 영역은 남을 것으로 전망됩니다.

97개 이상의 언어를 단일 모델로 처리할 수 있게 된 흐름은, 다국어 고객 응대나 국경을 넘는 서비스 구축의 진입장벽을 낮추는 방향으로 계속 작용할 가능성이 있습니다. 다만 이는 방향성에 대한 전망이며, 구체적 시장 규모나 성장률에 대한 공식 수치는 아직 제시되지 않았으므로 이 부분은 단정하지 않습니다.

비동기 함수 호출과 백그라운드 추론이 결합된 구조가 표준이 되면, 음성 에이전트는 단순 응대 도구에서 실제 업무를 처리하는 실행 주체로 서서히 확장될 가능성이 있습니다. 이 변화의 속도는 도구 생태계와 개발자 채택 속도에 크게 좌우될 것으로 보입니다.

제미나이 3.8 라이브 도입 전 확인사항 및 실행 체크리스트

지금 확인해야 할 실행 체크리스트

Gemini 3.8 Live를 실제로 써보기 전, 아래 항목을 먼저 점검하는 것이 시행착오를 줄이는 가장 확실한 방법입니다.

첫째, 사용 목적이 즉답 중심인지 백그라운드 추론 중심인지 구분해 기본 모델과 Extended Thinking 중 하나를 선택합니다.

둘째, 필요한 기능이 코드 실행·파일 검색·구조화된 출력에 해당하는지 확인하고, 해당된다면 별도 파이프라인 결합을 미리 설계합니다.

셋째, 함수 호출 모드를 `NON_BLOCKING`으로 둘지 `BLOCKING`으로 전환할지 워크플로우에 맞게 결정합니다.

넷째, 오디오 입출력 분당 가격을 기준으로 예상 사용 시간을 대략 계산해 예산 범위를 설정합니다.

다섯째, AI Studio에서 프로토타입으로 대화 품질을 먼저 검증한 뒤 API 통합 단계로 넘어갑니다.

제미나이 3.8 라이브 사용 관련 자주 묻는 질문 FAQ 정보

자주 묻는 질문 FAQ

Q1. Gemini 3.8 Live와 Extended Thinking 중 어떤 모델부터 시험해봐야 하나요?
단순 응대나 FAQ 성격의 음성 에이전트라면 기본 Gemini 3.8 Live로 먼저 시험해보는 것이 적합합니다. 대화 중 복잡한 조회나 외부 도구 호출이 자주 필요하다면 Extended Thinking을 함께 비교해보는 것을 권장합니다.

Q2. 두 모델의 토큰 한도가 같다면 성능도 같은가요?
토큰 한도(입력 131,072개, 출력 65,536개)는 동일하지만, 처리 방식은 다릅니다. 기본 모델은 응답 속도 중심, Extended Thinking은 백그라운드 추론과 비동기 도구 호출 중심으로 설계됐습니다.

Q3. 구조화된 출력이 필요한데 사용할 수 있나요?
현재 Gemini 3.8 Live 계열은 구조화된 출력을 지원하지 않습니다. JSON 등 정형 포맷이 필요한 로직이라면 별도 후처리 단계나 다른 모델과의 조합을 검토해야 합니다.

Q4. 비용을 예측하려면 무엇을 기준으로 계산해야 하나요?
오디오 입력 분당 0.005달러, 출력 분당 0.018달러를 기준으로 예상 대화 시간과 응답 길이를 곱해 계산하는 것이 기본입니다. 출력 비용이 입력보다 높기 때문에 응답 길이 관리가 비용에 직접 영향을 줍니다.

Q5. 다국어 서비스에 바로 쓸 수 있나요?
97개 이상의 언어를 지원한다고 발표됐습니다. 다만 언어별 실사용 품질은 서비스 도메인에 따라 다를 수 있으므로, AI Studio에서 대상 언어로 먼저 테스트해보는 과정이 필요합니다.

참고 자료


- Google Blog, "Build real-time voice applications with Gemini audio", 2026년 9월 15일 (blog.google)

- Google AI for Developers, Gemini API Changelog (ai.google.dev)

- Google AI for Developers, Gemini 3.8 Live 모델 문서 (ai.google.dev)

🏢 비젠소프트 | AI 챗봇·음성 AI 자동화 솔루션 개발
📧 sales@vizensoft.com | 🌐 www.vizensoft.com | 📞 02-338-4610
상단으로 상단으로

상담요청

전문보기
카카오톡 상담하기
전화 상담 무료 견적 문의 →