Генеративный ИИ годами совершенствовал плоские визуальные иллюзии, однако классические диффузионные системы стабильно пасуют перед физической геометрией, стоящей за пикселями. Поскольку традиционные архитектуры сводят визуальные данные к одномерным или двумерным последовательностям токенов, они теряют целостность сцены при динамичных траекториях камеры и не справляются с физическим взаимодействием объектов. Стартап World Labs, основанный Фэй-Фэй Ли, намерен устранить это фундаментальное ограничение с помощью Atlas — омни-модели, создающей основу для пространственного интеллекта.

Пространственный контекст вместо плоских последовательностей

В отличие от составных решений, сшивающих разнородные диффузионные модели, Atlas обучена с нуля на мультимодальных данных: тексте, изображениях, видео и нативной 3D-геометрии. Вместо того чтобы вычислять пространство задним числом, архитектура привязывает каждый токен к явным трехмерным координатам, формируя устойчивый пространственный контекст. Как отметила Фэй-Фэй Ли в исследовании ноября 2025 года, попытки заставить модели воссоздавать 3D-структуру из плоских визуальных цепочек делают базовые физические рассуждения крайне ненадежными.

Чтобы уйти от непредсказуемости чисто текстовых промптов при создании видео, Atlas принимает явные траектории движения камеры как геометрические параметры, генерируя стабильные видеоролики длительностью до одной минуты в разрешении 1440p.

«дёрганье за рычаг игрового автомата»

Вместо лотереи с неконтролируемой диффузией, которую в World Labs метко сравнили с дёрганьем за рычаг игрового автомата, разработчики получают детерминированное управление камерой и точные пространственные макеты для интерактивных сред.

Нативная 3D-реконструкция и сценарии для робототехники

В корпоративных пайплайнах 3D-моделирования Atlas воссоздает функциональные трехмерные пространства по нескольким обычным фотографиям или даже по одному кадру без использования сложного фотограмметрического оборудования. В бенчмарках OpenWorldLib существующие базовые модели, такие как VGGT и InfiniteVGGT, демонстрировали сильный геометрический дрейф и деградацию текстур при масштабных пролетах камеры. Atlas сохраняет физическую и топологическую связность, последовательно восстанавливая сложные локации — например, Главный двор Стэнфорда — по наземным снимкам и создавая корректные виды с воздуха.

Благодаря одновременной обработке данных о глубине и цвете (RGB), Atlas экспортирует результаты напрямую в нативные 3D-форматы, а не в виде статических пиксельных массивов. Для команд, разрабатывающих роботов и автономные системы, это кардинально меняет экономику симуляций: инженеры могут генерировать физически обоснованные цифровые двойники и синтетические обучающие среды по запросу. Это избавляет бизнес от многомиллионных затрат на ручной 3D-дизайн и закладывает пространственную базу для воплощенного ИИ.

Генеративный ИИКомпьютерное зрениеРоботизацияСнижение затратWorld Labs