Google внедряет Gemini 3.8 Live с функцией Live Avatar в корпоративный сегмент, выводя голосовой ИИ в пространство визуального интерактивного взаимодействия практически без задержек. По заявлению Google, система объединяет синтез речи с генерацией видео практически в реальном времени, создавая динамичный визуальный образ, способный одновременно обрабатывать аудио и визуальный контент.

Доступный теперь в Gemini Enterprise интерфейс ориентирован на интерактивные рабочие процессы — от обслуживания клиентов до автоматизированной презентации продуктов, опираясь на точную синхронизацию движения губ и плавную смену реплик.

Live Avatar может вызывать инструменты и получать данные в фоновом режиме во время активного диалога, выполняя сложные задачи и обеспечивая непрерывность разговора.

Эта модель фонового выполнения гарантирует, что задержки при извлечении данных с бэкенда не заморозят визуальное присутствие и не прервут диалог во время таких операционных задач, как регистрация в отеле. Вы получаете аватар, который моргает и кивает в ожидании ответа на запрос к базе данных, вместо того чтобы безжизненно смотреть в цифровой пустоту.

Multilingual Lip-Sync and Enterprise Controls

Глобальные операции зависят от того, насколько плавно мультимодальные системы справляются с языковыми переходами без визуальных искажений. Архитектура поддерживает встроенную многоязычную синхронизацию речи (speech-to-speech), динамически адаптируя выражения лица и движения губ на 97 языках без визуального рассинхрона или ухудшения качества видео.

Для развертывания корпоративных брендов инженерные команды могут создавать анимированные персонажи на основе всего одного высококачественного эталонного изображения. Тем не менее, создание пользовательских аватаров остается ограниченным корпоративными белыми списками, удерживая технологию в безопасности за корпоративным платным доступом, пока экономика генерации видео в реальном времени для корпоративных клиентов стабилизируется.

Главная новость здесь заключается вовсе не в преодолении эффекта зловещей долины, а в замещении линейного штата сотрудников. Когда одна мультимодальная модель ведет разговор, оформляет бронирование и улыбается на 97 языках без перерыва на кофе, P&L (отчет о прибылях и убытках) службы поддержки начинает выглядеть на редкость привлекательно.

Искусственный интеллектГенеративный ИИАвтоматизацияGoogle DeepMind