Подразделение Qualcomm AI Research представило MoNe (Modular Neural Memory) — легковесный модуль, который подключается к замороженным предобученным трансформерам. Он позволяет обойти жесткие экономические ограничения при инференсе длинного контекста без необходимости переобучать базовую модель. Вместо перегрузки оборудования гигантскими KV-кэшами MoNe устраняет квадратичную сложность стандартного in-context обучения, полностью разделяя этапы загрузки контекста и генерации токенов.
Архитектура работает в две фазы на базе нейросетевой памяти с быстрыми весами (fast weights), которые обновляются с помощью локализованных по слоям градиентов. MoNe обрабатывает контекст последовательно фиксированными блоками со строго линейной сложностью O(N) FLOPs. Генерация при этом сводится к константной сложности запроса O(1): модель формирует ключи и значения напрямую из токенов запроса, полностью игнорируя исходный промпт. На контекстном окне в 128K токенов такая схема снижает общий объем вычислений и пиковое потребление видеопамяти GPU примерно на 80% по сравнению со стандартными in-context подходами, требуя лишь 6,4% дополнительных параметров.
Эмпирические тесты, опубликованные исследователями Qualcomm Вонгуком Чо и Сонраком Юном, подтверждают, что архитектура стабильно масштабируется за пределы исходного контекстного окна. MoNe превосходит стандартные in-context модели в бенчмарке RULER (тесты «игла в стоге сена» и извлечение слов), сохраняя высокую точность поиска в тех условиях, где классическое внимание трансформеров деградирует. Главное преимущество: объем памяти для быстрых весов остается фиксированным независимо от длины последовательности. Это позволяет кэшировать состояние для многоэтапных диалогов или инкрементально добавлять новые токены без раздувания footprint в VRAM.
Для команд корпоративной инфраструктуры разделение кодирования контекста и активной генерации устраняет главную статью расходов при обработке больших документов — чрезмерное выделение ресурсов под KV-кэш на GPU-кластерах. Обслуживание 128K токенов больше не требует линейного роста VRAM или дорогостоящего полнопараметрического файнтюнинга. MoNe превращает громоздкие многостраничные промпты в компактный опрашиваемый модуль состояния, готовый к быстрому внедрению в enterprise-инфраструктуру.