Обработка длинных видео с помощью мультимодальных языковых моделей долгое время ставила перед инженерами неприятную дилемму: сжигать контекстное окно грубым скармливанием всех кадров подряд либо жертвовать визуальной точностью. Стандартный пайплайн Gemini опирался на статическую выборку со скоростью один кадр в секунду параллельно с транскрибацией аудио. В рабочих нагрузках такой подход быстро переполнял лимиты контекста на длинных записях и при этом пропускал быстрые склейки и доли секунды, в которые менялось состояние сцены.

Динамический анализ видео

Google полностью пересматривает этот процесс: модели Gemini Flash получили агентную архитектуру, которая динамически ищет нужные фрагменты в видео, а не загружает кадры сплошным потоком. Вместо равномерной индексации каждого таймкода такие модели, как Gemini 2.0 Flash, автономно определяют, какие сегменты требуют детального изучения. Это позволяет фиксировать резкую смену планов и мгновенные изменения, которые терялись при фиксированной частоте кадров.

Агентная система выявляет аномалии, повторно запрашивая подозрительные временные отрезки с повышенной частотой кадров.

Этот рабочий процесс расширяет возможности агентного компьютерного зрения, представленного Google ранее, где модели запускают код на Python для итеративного масштабирования, кадрирования и анализа изображений. Связывая нативные инструменты инспекции видео напрямую с цепочками рассуждений модели, Gemini обращается только к тем модальностям и временным интервалам, которые строго необходимы для ответа на запрос.

Экономическая эффективность и качество тестов

По данным внутренних бенчмарков Google, динамическая агентная выборка кадров сокращает расход токенов до 88% и снижает прямые затраты на инференс на 66%, одновременно повышая точность поиска информации в сценариях типа «иголка в стоге сена».

Функция уже развертывается для поиска по сценам и ответов на вопросы по видео через Gemini API. На следующих этапах интеграция появится в потребительском приложении Gemini и на YouTube.

Для корпоративных систем, обрабатывающих записи с камер наблюдения, видеоконференции или архивы, тестирование текущих пайплайнов в Google AI Studio на новом агентном режиме дает возможность оценить баланс между задержкой ответа и реальной экономией на инференсе.

Google DeepMindИИ-агентыКомпьютерное зрениеСнижение затратБольшие языковые модели