Модели класса зрение-язык-действие (Vision-Language-Action, VLA) способны обеспечить сквозное логическое мышление и планирование траекторий для автономного транспорта, однако чрезмерные задержки при вычислениях до сих пор запирали их в рамках симуляций. Исследовательская группа из Калифорнийского университета в Сан-Диего и Принстона под руководством Цзэкая Ли, Ихао Ляна, Хунфэя Чжана, Цзяня Чэня, Ешэна Ляна и Чжицзяня Лю намерена изменить ситуацию с помощью фреймворка FlashDrive. Как отмечается в их препринте, работа VLA в реальном времени упирается в четыре ключевых узких места: избыточное визуальное кодирование последовательных видеокадров, повторное заполнение контекста языковой модели на каждом шаге, медленная авторегрессионная генерация токенов и сплошное шумоподавление траекторий без учета неравномерности скоростных полей.

FlashDrive устраняет эти задержки за счет комплексной оптимизации алгоритмов и системного стека. На инфраструктурном уровне архитектура объединяет слияние вычислительных ядер (kernel fusion) и компиляцию графов CUDA Graph. На алгоритмическом уровне система нейтрализует все четыре проблемы: внедряет потоковое повторное использование KV-кэша между временными окнами, использует неавторегрессионный диффузионный генератор черновиков для спекулятивного декодирования (используя предсказуемо низкую энтропию логики вождения) и применяет адаптивное кэширование шагов, чтобы концентрировать шумоподавление строго на участках со сменой градиентов скорости.

В ходе тестирования на 10-миллиардной модели Alpamayo 1.5 с квантованием W4A8 на одной видеокарте NVIDIA RTX PRO 6000 фреймворк FlashDrive сократил общую задержку с 717 мс до 151 мс. Это ускорение в 4,7 раза повысило частоту управляющего контура с неприменимых 1,4 Гц до практичных 6,6 Гц без ущерба для безопасности: погрешность minADE6@6.4s изменилась незначительно (всего на ~0,08 м), а показатели столкновений и съездов с дороги в симуляции даже снизились. Избавляясь от избыточных накладных расходов при инференсе вместо наращивания аппаратных мощностей, авторы доказали: тяжелые мультимодальные модели вполне реально интегрировать в бортовые вычислители современных автомобилей.

Искусственный интеллектКомпьютерное зрениеИИ-агентыПроизводительностьNVIDIA