Компания Tavus выкатила модель Griffin — единую video-to-video систему, которая объединяет распознавание, генерацию и логику в обход классического каскада. Забудьте про громоздкие цепочки из отдельно работающих моделей транскрипции, языковых движков и синтезаторов речи. Новая архитектура принимает решения несколько раз в секунду, не дожидаясь, пока собеседник соизволит закончить свою пламенную речь.

На практике это выглядит пугающе живо: система реагирует на происходящее в кадре, включая демонстрацию экрана, поддакивает во время монолога и мгновенно замолкает, если вы ее перебиваете. Для запуска этого цифрового двойника разработчикам требуется всего одна фотография и десять секунд вашего аудио. По собственным данным Tavus, 48% участников закрытого теста искренне верили, что общаются с живым человеком. На фоне предыдущего технологического стека, где этот показатель едва дотягивал до 2%, прогресс впечатляет и одновременно пугает.

Версия Griffin-Lite сейчас находится в закрытом превью, но коммерческие перспективы уже вызывают серьезную головную боль у специалистов по безопасности. Такой уровень реалистичности открывает зеленый свет для нового поколения дипфейк-мошенничества в реальном времени. Руководителям бизнеса уже сейчас стоит пересматривать протоколы верификации на видеозвонках, потому что верить собственным глазам и ушам на экранах больше нельзя.

Генеративный ИИИскусственный интеллектКибербезопасностьTavus