Google DeepMind представила Gemini 3.5 Transcribe — специализированную модель распознавания речи, созданную для прямого преобразования необработанного аудио в структурированный текст, готовый для работы ИИ-агентов, без необходимости выстраивать сложные промежуточные цепочки обработки. В отличие от традиционных STT-систем вроде Whisper, которые механически транскрибируют каждую запинку, новая модель фильтрует фоновый шум, убирает слова-паразиты и на лету обрабатывает самоисправления говорящего прямо посреди фразы.
Согласно бенчмаркам Artificial Analysis, уровень ошибок (WER) у Gemini 3.5 Transcribe составляет 4,0% в потоковом режиме и 2,6% при пакетной обработке. Модель превосходит Chirp 3 и надежно распознает буквенно-цифровые сущности — например, номера заказов — более чем на 85 языках.
Google запускает решение через платформы Google AI Studio и Gemini Enterprise Agent Platform с двумя точками доступа: `gemini-3.5-transcribe-live` для двустороннего потокового вещания с задержкой менее секунды и `gemini-3.5-transcribe` для асинхронной пакетной обработки с диаризацией до трех спикеров. Модель также интегрирована в нативные клиенты, включая приложение Gemini для macOS, для прямой передачи форматированного голосового ввода во внешние инструменты и вызовы функций.
Объединение акустического распознавания, шумоподавления и очистки речи от дефектов в единый проход инференса избавляет бизнес от задержек и лишних вычислительных затрат на многослойную инфраструктуру голосового ИИ. Классические STT-провайдеры оказываются в невыгодном положении: им предстоит конкурировать с фундаментальными моделями, которые распознают смысл и намерения пользователя, а не просто фиксируют звуковой шум.