Обучение роботов-манипуляторов новым физическим задачам в динамичной среде долгое время упиралось в серьезный тупик: классическое обучение через подражание требует сотен демонстраций с телеуправлением или затратных циклов тонкой настройки. Более того, постоянное изменение весов нейросети для адаптации к новым операциям неизбежно вызывает катастрофическое забывание, из-за чего система теряет ранее освоенные навыки.
Каскад визуального прогнозирования
Чтобы полностью устранить необходимость в переобучении, исследователи Гуанъянь Чэнь, Мэйлин Ван и их коллеги из Пекинского технологического института, компании X SQUARE ROBOT и Университета Цинхуа представили архитектуру HOST (Human-to-robot One-Shot Skill AcquisiTion). В препринте на arXiv авторы показывают, как система извлекает готовые стратегии манипуляции напрямую из единственного видеоролика с человеком всего за 29 секунд — без единого обновления параметров модели на этапе вывода.
Вместо дообучения HOST преодолевает кинематический разрыв между человеком и роботом в три последовательных этапа. Система отслеживает прогресс выполнения задачи на общем визуальном многообразии, проецирует будущие движения человека в предполагаемый вид с камеры робота и напрямую преобразует эти визуальные прогнозы в низкоуровневые движения манипулятора. Поскольку веса нейросети во время работы остаются строго неизменными, смещение параметров и катастрофическое забывание исключены на уровне архитектуры.
Такая гибкость на этапе вывода опирается на масштабные предварительные вычисления: базовое обучение проводилось на 193 462 траекториях роботов для 229 задач, дополненных 5 847 парными демонстрациями формата человек-робот.
Что это значит
Архитектура HOST доказывает, что быструю адаптацию к новому физическому телу можно свести к прямому инференсу через прогнозирование визуальных траекторий, полностью отказавшись от дорогостоящего сбора данных. Однако путь от препринта до производственных цехов потребует проверки: предстоит выяснить, способна ли визуальная проекция учитывать тактильную обратную связь, справляться с высокими скоростями и преодолевать непредвиденные физические препятствия без участия оператора.