Робототехника слишком долго платила «налог на раздумья» — те самые неловкие паузы, когда машина замирает, чтобы переварить следующий шаг. Релиз Gemini Robotics ER 2 (Embodied Reasoning) объявляет войну этому когнитивному ступору. Архитектурный сдвиг здесь фундаментален: Google окончательно признал, что заставлять одну модель одновременно ворочать сложной логикой и управлять моторами на миллисекундном уровне — тупиковый путь. Теперь Gemini ER 2 работает как высокоуровневый диспетчер, отдавая приказы на физическое исполнение специализированным VLA-моделям (Vision-Language-Action) или навигационным API. Для бизнеса это означает конец эпохи жесткого кодирования каждого жеста. Вместо того чтобы прописывать скрипты, индустрия переходит к управлению через контекст, где машина понимает физический мир и планирует многоступенчатые задачи на лету.
Темпоральный интеллект и видео вместо скриптов
Главная боль промышленной автоматизации не в том, чтобы начать задачу, а в том, чтобы понять, когда она действительно закончена. В Gemini ER 2 видеоаналитика перешла из режима «взгляд на стоп-кадр» в непрерывный поток. Модель отслеживает прогресс в реальном времени, что позволяет роботу корректировать свои действия, если что-то пошло не так, а не тупо биться в стену согласно сценарию. Если этап провален, система инициирует повтор конкретного шага без перезапуска всего рабочего цикла. В условиях складов и сервисных зон, где динамика зашкаливает, такая ситуативная осведомленность — единственный способ избежать хаоса.
Интеграция с внешним миром и оркестрация флота
Масштабирование автоматизации больше не упирается в локальную базу данных. Gemini ER 2 нативно обращается к внешним инструментам, включая Google Search, чтобы найти решение для ситуаций, которые не были описаны при обучении. На тестах с роботом Spot от Boston Dynamics это выглядело как полноценная интерактивная связка: модель сама вызывала API навигации и манипуляторов, адаптируясь к вводным. Но настоящий потенциал раскрывается в мультиагентной оркестрации. Система позволяет группам роботов делить общие пространства и распределять куски сложного конвейера между собой.
За счет интеграции в Gemini Live API с двусторонней потоковой передачей данных разработчикам удалось снизить задержки до уровня, когда рассуждения и действия происходят почти синхронно. В сравнении с версией ER 1.6, новая итерация показывает заметно лучший результат как в симуляциях, так и в управлении реальными механизмами. Для владельцев логистических цепочек это сигнал: пора переходить от жесткого программирования к агентской схеме. Разработчикам достаточно объявить интерфейсы управления как инструменты и транслировать видеопоток прямо в «мозг» модели. Мы видим превращение роботов из запрограммированных инструментов в полноценных физических агентов. Делегирование роли вместо автоматизации задачи — это и есть тот самый масштаб, которого не хватало индустрии.