Google официально представила две модели преобразования текста в речь — Gemini 3.8 Flash TTS и Flash-Lite TTS, поддерживающие более 100 языков. Согласно релизной документации, Gemini 3.8 Flash TTS нацелена непосредственно на творческое производство — подкасты, аудиокниги и разработку игр, позволяя операторам создавать совершенно уникальные голосовые профили прямо из текстовых запросов. Пользователи по-прежнему могут выбирать из каталога, насчитывающего более 2 000 предустановленных голосов с региональными акцентами, такими как мексиканский испанский, квебекский французский и шотландский английский, но генерация на основе запросов открывает принципиально новые возможности.
Помимо чистой генерации, платформа включает в себя инструмент клонирования голоса, который создает рабочий профиль на основе короткого 30-секундного аудиофрагмента. Google также представила функцию ремикширования голоса для настройки тембра, высоты тона, темпа и акцента в существующих библиотечных материалах. Чтобы службы контроля контента оставались довольны, каждый созданный этими системами фрагмент содержит неслышимый водяной знак SynthID.
Управление сценариями и механика диалогов
Обе модели обрабатывают детальные инструкции к сценариям, позволяя инженерам внедрять невербальные звуковые сигналы, такие как вздохи, смех и разговорные паузы вроде мгм, прямо в текстовый поток. Базовая архитектура изначально поддерживает сценарии с двумя голосами в рамках одного прогона генерации, предотвращая нежелательное смешение персонажей, которое обычно разрушает генерацию длинных аудиозаписей.
Flash TTS ориентирована на творческие задачи, такие как подкасты, аудиокниги и игровые персонажи, в то время как Flash-Lite TTS разработана для недорогой генерации речи в больших масштабах для дубляжа, аудиоконтента и голосовых агентов.
Такой подход дает автоматизированным контакт-центрам и конвейерам дубляжа возможность производить массовый разговорный аудиоконтент без ущерба для бюджета на привлечение профессиональных актеров. В частности, модель Flash-Lite TTS явно оптимизирована для развертывания с высокой пропускспособностью и низкими задержками, где ключевую роль в экономике играют затраты на каждую минуту работы.
Экономика генерации и доступность платформы
Google делает обе модели доступными через Gemini API и Google AI Studio. Для бизнеса, который запускает крупномасштабные сценарии клиентского сервиса или конвейеры локализации, этот релиз устанавливает жесткий ценовой предел на то, сколько актеры озвучки могут запрашивать за чтение стандартных текстов.