Современные архитектуры Mixture-of-Experts (MoE) ставят перед инженерами парадоксальную задачу: обладая колоссальной емкостью, они требуют минимальных вычислительных затрат на токен, однако их веса физически не помещаются в память большинства потребительских GPU. Чтобы запускать такие модели на доступном оборудовании, используется механизм выгрузки (offloading) — перенос неактивных экспертов в оперативную память или на диск. Это неизбежно вызывает задержки: классический роутер определяет нужных экспертов только после вычисления скрытых состояний, из-за чего система простаивает в ожидании передачи данных. Такая последовательная обработка делает генерацию прерывистой, а пропускную способность — низкой.

Разделение передачи данных и вычислений

Исследователи из StepOs и Университета ШанхайТех представили SpecPrefetch — метод, разрывающий эту зависимость. Суть инновации заключается в отделении времени передачи данных от логики маршрутизации. Вместо ожидания вердикта основного роутера, SpecPrefetch задействует легковесный адаптер для предсказания экспертов, которые понадобятся на следующем слое. Процесс запускается заранее, позволяя совместить подгрузку весов с текущими операциями. При этом финальное решение всегда остается за основной моделью: ошибка адаптера может снизить скорость загрузки, но никогда не ухудшит качество ответов (perplexity).

SpecPrefetch сокращает видимую задержку загрузки экспертов, не меняя семантику предобученного роутера, поэтому ошибки предсказания влияют только на эффективность передачи, а не на выводы модели.

Благодаря подходу, где префетчер выступает «спекулятивным гидом», а не принимающим решения органом, система сохраняет целостность базы. Планировщик учитывает доступную пропускную способность и состояние кэша: если предсказание верно, данные передаются немедленно; если роутер выбирает другого кандидата, происходит стандартный откат к загрузке по требованию. Это позволяет моделям класса Qwen3-VL-30B-A3B работать на пределе возможностей железа, исключая простой вычислительных ядер.

Тестирование эффективности и пропускной способности

С точки зрения архитектуры SpecPrefetch минимизирует число обучаемых параметров по сравнению с аналогами. В тестах на DeepSeek-VL2-Tiny и Qwen3-VL-30B фреймворк продемонстрировал лучший показатель полноты (recall) выбора экспертов в 9 из 10 сценариев. На практике использование чипа Snapdragon 8 Elite обеспечило прирост пропускной способности декодирования до 20% относительно оптимизированных систем выгрузки. Весь выигрыш достигнут за счет «маскировки» латентности при переносе данных из хост-памяти в ускоритель.

Для бизнеса это важный сигнал: запуск DeepSeek-V3 или Mixtral на пользовательских видеокартах и мобильных платформах перестает быть испытанием на терпение. Фокус в оптимизации MoE смещается с наращивания сырой мощности на интеллектуальную оркестрацию данных. Эффективность системы теперь напрямую зависит от точности адаптера — если он перестает распознавать паттерны задач, магия ускорения исчезает, хотя точность модели остается неизменной.

ПроизводительностьБольшие языковые моделиЛокальный ИИAI-чипыDeepSeek