Исследователи из Национального университета Сингапура — Юйцзе Чжан, Бинь Гао и Тулика Митра — решили одну из самых острых проблем современного инференса: запуск масштабных рассуждающих моделей на архитектуре Mixture-of-Experts (MoE) без раздувания бюджетов на серверное оборудование. Разработанная ими среда исполнения SAEM (Stage-Aware Expert Management) обеспечивает прирост пропускной способности в среднем в 1,33 раза по сравнению со стандартными механизмами кэширования и выгрузки данных, достигая ускорения в 1,54 раза при совпадении профилей калибровки с реальной нагрузкой.
Длинные цепочки рассуждений (chain-of-thought) регулярно сжигают тысячи токенов на один запрос, масштабируясь вплоть до лимитов в 32 768 токенов. Хотя разреженная архитектура MoE сохраняет требования к вычислениям на приемлемом уровне, общий объем параметров легко переполняет доступную видеопамять (VRAM). Традиционные среды исполнения воспринимают генерацию токенов как однородный поток, полагаясь на базовое кэширование на уровне отдельных токенов или наивную предварительную выборку. Результатом становится постоянное и ресурсоемкое перемещение весов между GPU и CPU при каждом изменении маршрутизации экспертов.
SAEM использует очевидную архитектурную закономерность: логическое мышление не является хаотичным. Модели демонстрируют предсказуемые кластеры активации экспертов на конкретных этапах решения задачи — будь то выдвижение первоначальных гипотез, выполнение шагов проверки или самокоррекция. Вместо реакции на смену экспертов при каждом токене SAEM определяет границы этапов рассуждения и на их основе выстраивает размещение весов. Система объединяет фазовое кэширование, переупаковку токенов под конкретных экспертов и вычисления in-situ на стороне CPU, устраняя накладные расходы на запуск ядер и фрагментацию памяти.
Для руководителей AI-инфраструктуры этот результат имеет прямое практическое значение. Масштабирование производительности reasoning-моделей не требует постоянных инвестиций в расширение дорогостоящей памяти VRAM, если среда исполнения использует предсказуемую структуру самого процесса рассуждений. SAEM наглядно доказывает: синхронизация управления памятью с фазами логического вывода обеспечивает немедленный прирост пропускной способности на уже имеющемся стандартном оборудовании.