Развертывание больших языковых моделей остается дорогим удовольствием с точки зрения закупки оборудования, заставляя исследователей неустанно трудиться над трюками для сжатия. Хотя структурная прунинг срезает лишнее без необходимости использования нестандартных сред выполнения, отсечение параметров насовсем безвозвратно повреждает емкость модели. Если вы хотите вернуть утраченную точность, традиционное дообучение требует колоссального бюджета на вычисления, превращая сжатие моделей в дорогую инженерную головную боль.

Унификация создания экспертов и маршрутизации

Чтобы обойти это падение производительности, новый метод под названием ToMoE преобразует плотные языковые модели в архитектуры Mixture-of-Experts без прикосновения к исходным весам. Разреженные модели вроде DeepseekMoE соответствуют производительности плотных при лишь малой доле активных параметров, но достижение этого обычно требует обучения с нуля.

"MoE неотъемлемо существует внутри плотных моделей и может быть обнаружена без обновления весов модели."

Вместо того чтобы заставлять команды выбирать между перманентным уничтожением параметров и дорогим дообучением, ToMoE демонстрирует, что экспертные подсети уже скрыты внутри плотных слоев. Метод использует динамическую структурную прунинг, чтобы объединить создание экспертов и обучение маршрутизатора в один шаг, удерживая расходы на конвертацию на минимальном уровне.

Специфичная для слоев динамическая маршрутизация

Процесс конвертации нацелен на слои внимания и полносвязные слои через специализированные механизмы. Для слоев многоголового самовнимания фреймворк применяет маршрутизацию top-K и статическую прунинг для сжатия. Для MLP-слоев он превращает их в MoE-слои, используя экспертную маршрутизацию top-1.

Эмпирические оценки на моделях Phi-2, LLaMA-2, LLaMA-3 и Qwen-2.5 показывают, что ToMoE превосходит стандартную прунинг и существующие техники MoE, и все это без единого обновления весов. Код уже выложен в открытый доступ на GitHub для инженерных команд, достаточно смелых, чтобы протестировать его.

Доказав, что механизмы разреженной маршрутизации можно извлекать напрямую через динамическую прунинг, ToMoE устраняет фазу дорогостоящего дообучения, которая обычно губит проекты с разреженной архитектурой. Для бизнеса это позволяет миновать привычные циклы обновления инфраструктуры и резко сократить серверные мощности, необходимые для инференса. Тем не менее, остаются открытые вопросы о том, как эти необученные экспертные конфигурации выдерживают экстремальную производственную конкуренцию.

Большие языковые моделиМашинное обучениеСнижение затратОпенсорс ИИ