Создание сквозной (end-to-end) системы автопилота, способной совмещать высокоуровневые рассуждения с расчетом физической траектории за доли секунды, остается сложнейшей инженерной задачей. Исследовательское подразделение Alibaba представило архитектуру Qwen-Drive 1.0, которая объединяет трехмерное пространственное восприятие, ведение диалога и планирование маршрута в едином мультимодальном фреймворке без потери базовых возможностей языковой модели. Разработка на базе Qwen3.5-4B призвана проверить, способны ли генеративные vision-language модели (VLM) надежно управлять автомобилем в сложных дорожных условиях.
Пространственная привязка и архитектура
Стандартные мультимодальные модели регулярно ошибаются при переводе визуальных описаний сцены в физические координаты: понимать контекст изображения — не значит оценивать геометрическую глубину. Чтобы устранить этот разрыв, в Qwen-Drive 1.0 интегрировали два специализированных модуля: блок генерации 3D-представлений с высоты птичьего полета (определяет границы объектов, разметку полос и сетку занятости пространства) и модуль планирования траектории.
Исследователи Alibaba выяснили, что заморозка весов базовой VLM-модели с обучением исключительно блока планирования приводит к слабой пространственной точности. Для генерации корректных траекторий потребовалось сквозное совместное обучение базовой модели на 24 агрегированных датасетах дорожного движения. Это позволило системе сохранить способность к логическим рассуждениям и одновременно рассчитывать пространственные путевые точки.
«Запланированный маневр далеко не всегда совпадает с логическим обоснованием, которое модель выдала за мгновение до этого».
Разрыв между физической траекторией и объяснениями
Тесты в симуляторах выявили как практические преимущества, так и критические уязвимости архитектуры. Дообучение с подкреплением снизило долю выездов за пределы трассы с 24% до 12%. Это заметный прогресс для бенчмарков, однако подобный процент ошибок абсолютно неприемлем для реальной эксплуатации без жестких детерминированных систем безопасности.
Куда более серьезная проблема — архитектурный рассинхрон между текстовыми объяснениями модели и реальной траекторией движения. Текстовая аргументация, генерируемая параллельно или постфактум, нередко прямо противоречит физическим векторам модуля планирования. Такая псевдоинтерпретируемость создает колоссальные риски: оператор или телеметрия получают логичное обоснование на естественном языке, пока автомобиль выполняет диаметрально противоположный маневр. Массовое внедрение генеративных мультимодальных систем в критически важную робототехнику останется на паузе до тех пор, пока рассуждения ИИ и физические векторы действий не будут аппаратно и архитектурно синхронизированы.