Спустя почти год после релиза версии 1.5, Google DeepMind прервали затянувшееся по меркам индустрии молчание. Пока конкуренты штамповали анонсы, в Маунтин-Вью пытались решить задачу со звездочкой: как заставить тяжеловесную VLA-модель управлять не просто манипулятором на столе, а полноценным телом с 22 степенями свободы. В Gemini Robotics 2 (GR2) разработчики замахнулись на создание цифровой центральной нервной системы, которая берет под контроль всё — от сенсоров до кончиков пальцев гуманоида.
Двухуровневый разум
Главный интерес здесь представляет не само железо, а архитектурная иерархия. В DeepMind здраво рассудили, что одна нейросеть не может одновременно размышлять о смысле бытия и следить за углом поворота сервопривода. Систему разделили. На верхнем уровне находится Gemini Robotics ER 2 — визуально-языковой оркестратор. Он видит мир, понимает команды на естественном языке и дробит сложные задачи на простые операции. Ниже стоит исполнительный слой — VLA-модель, которая транслирует абстрактные идеи оркестратора в конкретные моторные команды.
ER может вмешиваться в действия VLA на любом этапе выполнения задачи, что критично для self-correction.
Эта способность к самоисправлению — единственный шанс на реальную автономность в цеху. Если робот промахнулся мимо паллеты, он не впадает в ступор, а осознает ошибку на уровне когнитивного слоя и пробует снова. Более того, ER 2 теперь претендует на роль прораба, координируя группу разношерстных роботов. На бумаге это выглядит как готовая система управления складом, где манипуляторы и тележки наконец-то начинают работать синхронно.
Бутылочное горлышко моторики
Впрочем, пора спуститься с небес в зону разгрузки. Когнитивные способности моделей сейчас катастрофически опережают возможности железа. Google честно признает: на задачах, требующих тонкой моторики, успех (success rate) болтается в районе 30–40%. Для реального бизнеса это звучит как приговор. Робот, который роняет каждую вторую коробку, — это не инновация, а прямой путь к убыткам и хаосу на производстве. Проблема не в глупости ИИ, а в том, что обуздать инерцию и трение через 22 степени свободы в реальном мире сложнее, чем в любой симуляции.
Тем не менее Google делает ставку на универсальность. В отличие от Tesla или Figure, которые годами вылизывают конкретное тело, DeepMind создает универсальную операционку. Облегченная модель On-Device 2 обещает адаптацию к любому новому устройству за пару сотен демонстраций. Чтобы подсластить пилюлю низкой точности, компания выкатила бенчмарк ASIMOV-Agentic для оценки безопасности, где, разумеется, назначила себя лидером. Для бизнеса это сигнал: ждать чудес ловкости в ближайший год не стоит, но пора готовить пилотные зоны там, где автономность важнее прецизионной точности. Ищите процессы, где промах на пару сантиметров не приведет к катастрофе — именно там Gemini Robotics 2 начнет отрабатывать свои инвестиции.