Публичные лидерборды систем распознавания речи (ASR) регулярно рапортуют о том, что автоматические модели уже сравнялись с человеком по точности или превзошли его. Однако в боевых условиях бизнес видит совершенно иную картину. Когда наборы данных для оценки остаются статичными и общедоступными, в силу вступает закон Гудхарта: модели начинают оптимизироваться под артефакты бенчмарков, вместо того чтобы учиться разбирать реальные акустические вариации речи. Исследователи из Hume AI детально описали этот феномен, получивший название «benchmaxxing» (выжимание бенчмарков), на примере популярных ASR-систем.
Протестировав 11 известных открытых архитектур распознавания речи на стандартных датасетах вроде VoxPopuli English и LibriSpeech, команда Hume AI обнаружила, что топовые системы с лидербордов с завидной регулярностью выдавали идеальные эталонные транскрипции даже тогда, когда реальный звук содержал ошибки или ключевые фразы были полностью заглушены. Модели не распознавали сырые фонемы: они считывали едва заметные акустические маркеры, безошибочно определяли конкретный тестовый датасет и просто воспроизводили заученный текст по памяти.
Проверка расхождений в VoxPopuli
Чтобы выяснить, действительно ли системы анализируют звук или лишь декламируют закешированные ответы, исследователи протестировали их на VoxPopuli — датасете, печально известном многочисленными ошибками разметки, из-за которых аналитическая площадка Artificial Analysis ранее даже выпускала его исправленную версию. Команда Hume AI развернула ансамбль моделей с низкой пофонемной частотой ошибок, чтобы зафиксировать расхождения между звуком и официальными эталонами.
Несколько систем с самыми высокими баллами воспроизводили эталонные транскрипты из датасетов VoxPopuli English и LibriSpeech даже в тех случаях, когда аудиодорожка прямо им противоречила.
Стандартные публичные тесты системно игнорируют наложение реплик собеседников, фоновые шумы, телефонное сжатие с низким битрейтом и динамичный темп живого диалога. Для технических лидеров и продакт-менеджеров опора на заявления вендоров о победах в бенчмарках оборачивается серьезными операционными и финансовыми рисками. Вместо того чтобы полагаться на маркетинговые рейтинги, командам, внедряющим голосовых ИИ-агентов, необходимо выстраивать собственные контуры валидации исключительно на реальных записях разговоров с клиентами из своего домена.