
대화형 인공지능이 음성 반응을 넘어 시각적 인격을 갖춘 형태로 진화하고 있다.
구글이 실시간 대화형 AI 모델에 시각적 존재감을 더한 ‘제미나이 3.8 라이브 위드 라이브 아바타(Gemini 3.8 Live with Live Avatar)’를 공식 공개했다. 대화 내용에 맞춰 화면 속 가상 인물이 정밀한 입 모양을 맞추고 표정을 바꾸며 동적으로 응답하는 방식이다.
이번 기능은 구글의 실시간 음성 대화 기술인 제미나이 라이브 엔진에 저지연 스트리밍 영상 생성 레이어를 결합해 구현했다. 단순히 사전에 녹화된 영상을 재생하는 형태가 아니라, 사용자의 질문과 대화 맥락을 실시간으로 계산해 화면 속 가상 아바타의 얼굴 움직임을 만들어낸다. 대화 중 자연스러운 시선 처리나 표정 변화, 자연스러운 발화 순서 전환까지 자연스럽게 구현된다는 게 구글 측 설명이다.
눈에 띄는 대목은 비동기식 도구 호출(Asynchronous Tool Calling) 기능이다. 기존 음성 에이전트는 백엔드 데이터베이스를 조회하거나 외부 시스템을 호출할 때 대화가 끊기거나 응답이 일시 정지되는 현상이 잦았다. 반면 이번에 공개된 아바타 서비스는 외부 데이터를 가져오거나 시스템 연동 작업을 처리하는 동안에도 대화 흐름을 중단하지 않는다. 호텔 예약을 조회하거나 데이터베이스 처리 작업을 수행하면서도 사용자와 시선을 맞추고 대화를 이어갈 수 있다.
언어 장벽도 크게 낮췄다. 총 97개 언어 간 다국어 음성 동기화를 지원하며, 한 대화 안에서 언어가 바뀌어도 영상 품질 저하나 시각적 오차 없이 아바타의 입 모양과 표현을 즉시 전환한다.
기업 고객을 위한 맞춤형 환경도 배치했다. 구글이 제공하는 기본 아바타 라이브러리를 활용하는 것은 물론, 단 한 장의 고품질 참조 이미지만으로 브랜드 고유의 스타일과 정체성을 담은 애니메이션 아바타를 생성할 수 있다. 딥페이크나 악용 우려를 방지하기 위해 맞춤형 아바타 제작 기능은 사전 승인을 받은 기업 고객에게만 제한적으로 허용된다.
생성된 모든 음성과 영상 출력물에는 구글 딥마인드의 비가시성 워터마크 기술인 ‘신스ID(SynthID)’가 적용된다. 육안이나 귀로는 판별하기 어렵지만 별도 소프트웨어를 통해 AI 생성물임을 식별할 수 있도록 해 딥페이크 악용이나 출처 오인 문제를 사전에 방지하겠다는 취지다.
글로벌 테크 업계에서는 AI 에이전트의 형태가 단순한 텍스트나 음성 출력을 넘어 시각적 얼굴을 가진 인터페이스로 빠르게 이동하고 있다는 평가가 나온다. 고객 응대 서비스나 복잡한 금융·비행 예약 처리, 교육용 실시간 가이드 등 대면 느낌이 중요한 산업군을 중심으로 도입 타당성 검토가 활발히 진행될 것으로 보인다.
제미나이 3.8 라이브 위드 라이브 아바타는 발표 당일부터 구글의 기업용 AI 플랫폼인 ‘제미나이 엔터프라이즈(Gemini Enterprise)’를 통해 즉시 사용할 수 있으며, 멀티모달 라이브 API 개발자 문서를 통해 연동 작업에 착수할 수 있다.






