Годами мультимодальные ИИ-модели анализировали длинные видео методом грубой силы. Корпоративные системы обработки стабильно считывали непрерывные медиапотоки с фиксированной частотой кадров — обычно один кадр в секунду. Это вынуждало команды инженеров искать компромисс между заоблачными счетами за токены и риском упустить критически важные детали. Теперь у этого ограничения появилась прямая архитектурная альтернатива.

Google внедрил агентный подход к пониманию видео в линейку моделей Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Вместо того чтобы без разбора поглощать каждый кадр, модели объединяют логический анализ со встроенными инструментами работы с видео: они динамически сканируют, ищут и точечно анализируют нужные визуальные кадры, аудиодорожки и текстовые расшифровки.

Экономика динамического анализа

Классические пайплайны превращают непрерывное видео в фиксированные последовательности визуальных токенов. Это мгновенно заполняет контекстное окно модели и раздувает расходы на инференс. Агентный подход, напротив, использует внутренний цикл вызова инструментов и просматривает исключительно необходимые отрезки.

Агентный анализ видео сокращает потребление токенов почти на 88% и повышает точность Gemini 3.7 Flash на 7%.

По данным Google, на стандартных бенчмарках видеоаналитики этот механизм снижает общие затраты на анализ до 66% и сокращает расход токенов до 88%, одновременно повышая точность на величину до 7%. Компания подчеркивает, что Gemini 3.7 Flash с агентным анализом демонстрирует лучшее общее качество и выходит на оптимум Парето по соотношению точности и стоимости среди протестированных решений.

Простыми словами: модели больше не нужно монотонно отсматривать многочасовую запись целиком ради ответа на базовый вопрос. Она действует как исследователь с пультом управления: сначала сканирует субтитры или звук, сразу переходит к нужной временной метке и увеличивает кадры только при реальной необходимости.

Корпоративные сценарии и переключение модальностей

Новая архитектура открывает возможности, которые раньше терялись при покадровом анализе со скоростью 1 кадр в секунду. Модель способна по запросу перезапрашивать нужные фрагменты с повышенной частотой кадров. Это открывает путь к поиску моментов с точностью до доли секунды для автосборки видео, подсчету физических действий и объектов в динамике, поиску аномалий и обнаружению мельчайших деталей в многочасовых корпоративных записях.

Функционал уже доступен для загружаемых видеофайлов и ссылок на YouTube через API Gemini в Google AI Studio, а также на платформе Gemini Enterprise Agent Platform. При этом открытым инженерным вопросом остается latency: смогут ли продакшн-системы перейти на динамический вызов инструментов в реальном времени, например в охранном видеонаблюдении, без критических задержек.

Google DeepMindИИ-агентыСнижение затратКомпьютерное зрениеБольшие языковые модели