Google наконец признал очевидное: попытка запихнуть высокоуровневое планирование и моторные рефлексы в одну нейросетевую коробку обречена на провал. Новая архитектура Gemini Robotics ER 2 — это осознанный отказ от монолитов в пользу иерархии. Пока старые модели впадали в ступор при малейшем изменении условий, ER 2 работает как эффективный менеджер: она берет на себя «мозг» (рассуждения и планирование), делегируя «грязную работу» по управлению приводами низкоуровневым VLA-моделям (Vision-Language-Action). Такой подход решает главную проблему робототехники — унизительные паузы «на подумать», которые превращали любое движение в дерганое слайд-шоу.
Интеграция через Gemini Live API с двунаправленным стримингом позволяет роботу обрабатывать видеопоток без задержек. По сути, Google обеспечил агентам ту самую плавность, которой не хватало для безопасной работы в одном пространстве с людьми. Теперь это не просто реактивная машина, а физический агент, способный предугадывать следующий шаг, не прекращая текущего действия.
Решение проблемы задержек через иерахический интеллект
Ключевое отличие ER 2 от предшественника версии 1.6 — в способности «думать на ходу». В тестах с робособакой Boston Dynamics Spot система продемонстрировала разделение когнитивных процессов: пока ноги отрабатывают навигацию, ER 2 уже планирует использование манипулятора. Это снимает вычислительный барьер, когда робот был вынужден замирать для пересчета траектории.
Gemini Robotics ER 2 позволяет роботу планировать следующий шаг прямо в процессе выполнения текущей задачи.
Для разработчиков это означает доступ к инструментарию через Google AI Studio и Gemini Enterprise Agent Platform. Теперь низкоуровневые интерфейсы управления рассматриваются как обычные инструменты (Tool Use). Модель может не просто двигать «железом», но и обращаться к внешним API, например, заглядывать в Google Search, чтобы уточнить контекст задачи или найти инструкцию к незнакомому предмету прямо во время выполнения миссии.
Темпоральный интеллект и кооперация машин
Еще одна головная боль — темпоральная осознанность. Роботы часто не понимают, завершено ли действие или в какой именно момент произошел сбой. ER 2 вводит точную классификацию прогресса: система в реальном времени верифицирует статус задачи и может самостоятельно инициировать повторную попытку, если что-то пошло не так, не перезагружая весь цикл.
ER 2 стабильно превосходит версию 1.6 в оркестрации инструментов во всех режимах: реальном VLA, симуляции и телеуправлении.
Такая эффективность открывает прямой путь к мультиробототехнике. Вместо того чтобы программировать жесткие петли для каждого устройства, инженеры получают среду, где роботы могут делить пространство и задачи динамически. Для бизнеса это означает радикальное снижение TCO: вместо армии узкоспециализированных машин на склад или производство можно выпускать универсальных агентов, способных адаптироваться к хаосу реального мира.
Google превращает роботов из программируемых калькуляторов в проактивных агентов. Декуплинг планирования и исполнения убирает вычислительные затыки, которые раньше делали внедрение AI-железа в энтерпрайз экономически бессмысленным. С возможностью использовать цифровые инструменты и работать в команде, роботы наконец начинают двигаться со скоростью человеческой среды, а не со скоростью медленного инференса.