Стартап Generalist представил робототехническую модель GEN-1.5, которая осваивает новые физические операции в режиме one-shot — буквально за одну демонстрацию оператора. До сих пор любая смена производственной задачи требовала переобучения, файнтюнинга и долгого пересчета весов нейросети. Теперь видеозапись нужного действия подается напрямую в контекстное окно модели, работая как обычный визуальный промпт.
Архитектура системы воспринимает показ как начало последовательности и мгновенно воспроизводит траекторию. В Generalist подчеркивают, что инженеры не закладывали способность к in-context learning специально: навык проявился как эмерджентное свойство после масштабного обучения базовой модели на терабайтах сырых физических данных со складов, производственных линий и жилых пространств. По сути, прикладная робототехника подошла к собственному моменту GPT-3, когда увеличение объема мультимодальных данных открыло возможность управлять железом без дорогостоящего вмешательства в саму модель.
Для операционного бизнеса это меняет базовую экономику роботизации. Вместо недель инженерного труда и привлечения дефицитных ML-специалистов для перенастройки манипулятора на новую SKU или операцию компаниям достаточно однократного показа от линейного оператора цеха. По оценке Generalist, подача одного примера в контекст нередко демонстрирует более высокую точность исполнения, чем серия итераций прямого дообучения на локальном датасете, радикально сокращая время простоя оборудования и стоимость интеграции.