Gemini 3.8 Live 영상 아바타 정식 출시

구글 클라우드가 9월 25일 Gemini 3.8 Live with Live Avatar를 Gemini Enterprise에서 정식 출시(GA)한다고 발표했다. 기존 실시간 음성 대화 모델에 말하는 '얼굴'을 추가한 버전으로, 입 모양을 음성에 맞춰 동기화한 영상 아바타를 생성해 고객 상담, 판매 안내, 제품 설명처럼 사람 같은 느낌이 필요한 상황을 겨냥했다. 구글 클라우드 넥스트 2026에서 처음 프리뷰로 공개된 바 있다.

이번 버전이 할 수 있는 것

구글 클라우드 블로그에 따르면 이번 Gemini 3.8 Live는 다섯 가지 기능을 중심으로 한다.

  • 영상 아바타: 입 모양이 음성과 동기화된 대화형 아바타 생성;
  • 음성 대 음성: 네이티브 음성 대화로, 사용자가 대화 중간에 끼어들어도 이전 맥락과 백그라운드에서 실행 중인 작업을 잃지 않고 이어갈 수 있음;
  • 비동기 툴 호출: 대화를 중단하지 않고 백그라운드에서 API를 호출하거나 CRM·ERP를 조회;
  • 다국어 지원: 97개 언어를 듣고 말할 수 있으며 언어를 자동으로 인식;
  • 실시간 시각 인식: 카메라 화면, 화면 공유, 음성을 동시에 처리.

배포 측면에서는 미국과 EU 두 개의 엔드포인트를 제공하고 예약형 처리량(provisioned throughput)을 지원하며, 기업용 컴플라이언스와 데이터 거버넌스를 강조한다.

발표문에는 두 가지 제한 사항도 명시돼 있다. 커스텀 아바타는 현재 화이트리스트에 등록된 고객사만 이용할 수 있어, 자사 모습이나 홍보 모델을 활용하려는 기업은 먼저 구글의 심사를 통과해야 한다. 생성되는 모든 음성·영상 스트림에는 육안으로 보이지 않는 SynthID 워터마크가 삽입된다. 별도로, 긴 추론 과정을 포함하는 Gemini 3.8 Live Extended Thinking은 여전히 비공개 프리뷰 단계이며 이번 정식 출시에는 포함되지 않았다.

고객사는 이걸로 무엇을 하고 있나

발표문에는 4개 고객사 사례가 소개됐다. 콕스 오토모티브(Cox Automotive) 산하 오토트레이더(Autotrader)는 이를 자동차 구매 어시스턴트로 활용해, 아바타가 대화하면서 웹페이지에서 매물을 강조 표시하고 차종을 비교하며 대출 조건을 설명한다. 콕스 오토모티브의 최고제품책임자(CPO) 마리앤 존슨은 다음과 같이 말했다.

"Shoppers increasingly expect to describe what they need in their own words rather than work through filters and menus."

(소비자들은 갈수록 필터나 메뉴를 하나씩 눌러가기보다 자기 언어로 필요한 것을 설명하고 싶어한다는 취지다.)

인도의 Equal AI는 하루 100만 건이 넘는 실시간 전화를 처리하는 개인 비서 서비스를 9개 인도 언어로 운영 중이며, CEO는 새 버전이 끼어들기 대응, 다국어 대화, 툴 호출의 안정성을 개선했다고 밝혔다. 세일즈포스는 이 모델을 Agentforce와 결합하고 있다고 밝혔고, AI 어시스턴트 플랫폼 Specs는 음성 활동 감지(VAD)와 전반적인 지연 시간 개선을 언급했다. 이는 모두 각 기업의 자체 발표로, 공고문에는 밀리초 단위의 지연 시간이나 전환율 같은 비교 가능한 수치는 제시되지 않았다.

중국 본토 개발자도 쓸 수 있나

Gemini Enterprise와 Live API는 구글 클라우드 기반으로 제공되기 때문에 중국 본토 개발자는 직접 이용할 수 없고, 해외 시장을 겨냥하는 팀은 미국이나 EU 엔드포인트를 거쳐야 한다. 97개 지원 언어에는 중국어도 포함돼 있어, 동남아시아나 중동처럼 다국어가 쓰이는 시장의 고객 상담·판매 안내 용도가 가장 직접적인 활용처가 될 것으로 보인다.

중국 내 디지털 휴먼 고객 상담과 라이브 방송용 아바타는 이미 몇 년째 운영되고 있는데, 일반적인 방식은 음성 인식, 대규모 언어 모델, 음성 합성, 입 모양을 구동하는 디지털 휴먼 엔진을 각각 따로 연결하는 것이다. 이 경우 각 단계마다 지연이 발생하고 끼어들기 대응도 약점이 되곤 한다. 구글이 이번에 듣기·말하기·보기·툴 호출·영상 생성을 하나의 실시간 모델에 통합한 것은, 엔드투엔드 방식이 지연 시간과 끼어들기 처리에서 우위를 가진다는 데 건 승부수다. 어느 쪽이 비용 면에서 더 유리한지는 아바타 출력 과금 방식과 실제 동시 접속 비용에 달려 있으며, 현재로선 비교할 만한 공개 수치가 없다.

구글은 이미 음성 합성 모델 Gemini 3.8 Flash TTS와 Flash-Lite TTS를 선보인 바 있으며, 이번 발표에서는 Gemini 3.5 Transcribe와 Gemini 3.5 Live Translate도 기업용 오디오 모델 라인업에 포함시켰다. 실시간 대화, 받아쓰기, 번역, 음성 합성에 영상 아바타까지 더해지면서 구글의 기업용 음성 제품 라인은 사실상 완성 단계에 들어섰다.

아직 밝혀지지 않은 부분

Live Avatar의 가격에 대해 블로그는 요금 페이지 링크만 제공할 뿐, 아바타 영상 출력에 대한 별도 요금은 명시하지 않았다. 화이트리스트 신청 조건과 심사 기간도 공개되지 않았다. SynthID 탐지 도구를 어떤 제3자에게 개방할 것인지도 이번에 언급되지 않았다. 기업이 도입 여부를 판단할 때 이 항목들이 비용과 컴플라이언스 평가에 직접 영향을 미칠 것이다.

참고 출처: 구글 클라우드 공식 블로그, Android Headlines, CocoLoop, Unite.AI; 지원 언어 수, 화이트리스트 및 워터마크 제한, Equal AI의 일일 통화량, 각 고객사 발언은 추가 확인 필요.