Робототехнический стартап Generalist AI представил модель GEN-1.5, призванную устранить главное узкое место в разработке физического ИИ — необходимость сотен часов ручного дистанционного управления (телеоперации). Вместо длительного предварительного обучения под конкретную задачу система принимает в контекстное окно короткий видеоролик длительностью от 3 до 12 секунд в качестве физического промпта. Работая как динамическая кратковременная память, этот визуальный контекст направляет манипуляции робота в режиме zero-shot, обеспечивая среднюю успешность выполнения в 59% на десяти тестовых задачах, включая открытие банок и извлечение купюр из кошелька.
Ключевой экономический сдвиг заключается в скорости дообучения. По данным Generalist, добавление всего пяти минут демонстрационных данных конкретной задачи в рамках десяти шагов градиентного спуска повышает показатель успешности до 83%. Архитектура также демонстрирует эмерджентные свойства, сформировавшиеся за восемь месяцев предварительного обучения на взаимодействии со средой: объединение нескольких промптов в непрерывные цепочки действий, прямое считывание симуляционных демонстраций и частичный перенос движений человеческих рук на роботизированные захваты без явного программирования.
Хотя узкоспециализированное контекстное обучение ранее встречалось в академических лабораториях, Generalist позиционирует GEN-1.5 как первый универсальный подход для разнообразных манипуляций. Однако показательное открытие банки в демонстрационном ролике далеко от реалий непредсказуемой фабричной среды, а заявленные разработчиками метрики еще требуют независимой валидации. Если модель справится с нештатными сценариями на практике, замена сложных пайплайнов телеоперации на быстрые видеопромпты сократит сроки внедрения роботов с месяцев до считаных минут.