Эра неповоротливых облачных монолитов сталкивается с прагматичным вызовом: специализированные локальные архитектуры наконец-то научились считать деньги. Компания Poolside выложила веса Laguna S 2.1 в формате FP8 — модели класса Mixture-of-Experts (MoE) на 117,6 млрд параметров. Это не просто минорный апдейт, а полноценный инструмент для автономных кодинг-агентов, способный переваривать тяжелые задачи на собственном железе компании, а не на серверах Microsoft или Google.
Эффективность MoE и гибридное внимание
Секрет эффективности Laguna S 2.1 в том, что при общем объеме в 117,6 млрд параметров на каждый токен активируется всего 8,5 млрд. Архитектура использует 256 экспертов, работу которых координирует оптимизатор Muon. Главная инженерная удача здесь — гибридный механизм внимания. Из 48 слоев только 12 используют глобальное внимание, а остальные 36 (соотношение 3:1) работают через Sliding Window Attention (SWA) с окном в 512 токенов. Для технического директора это означает прямую экономию: такая конфигурация в связке с квантованием KV-кэша до FP8 радикально снижает требования к видеопамяти при работе с огромными кодовыми базами.
Laguna S 2.1 использует softplus-гейтинг с ротационным масштабированием по слоям, что позволяет сочетать уровни SWA и глобального внимания в пропорции 3:1 в рамках 48 слоев.
Проблема длинного горизонта в кодинге обычно упирается в экспоненциальный рост затрат на контекст. Laguna S 2.1 предлагает нативное окно в 1 млн токенов. Благодаря сегментированному вниманию модель удерживает логическую связность проекта без необходимости закупать стойки H100. Это превращает локальный инференс из дорогого хобби в рабочую стратегию снижения совокупной стоимости владения (TCO).
Бенчмарки и встроенная логика рассуждений
На тестах SWE-bench Laguna S 2.1 (118B) показывает результат 78,5%, оставляя позади тяжеловесов вроде Nemotron 3 Ultra (550B) с его 67,7% и даже DeepSeek-V4-Pro Max (1,6T), который буксует на 76,2%. Еще показательнее бенчмарк SWE Atlas для ответов на вопросы по коду: 46,2% против 27,2% у того же DeepSeek. Модель изначально заточена под агентские сценарии: «нативное рассуждение» (thinking) здесь интегрировано в цикл вызова инструментов. Вы можете принудительно включать или выключать фазу размышлений для каждого запроса, что критично для сложных многошаговых автоматизаций.
Поддержка нативного логического вывода позволяет чередовать фазы размышлений между вызовами инструментов с возможностью активации или деактивации функции для каждого запроса.
Пока конкуренты вроде Kimi K3 наращивают массу до 2,8 трлн параметров, Poolside доказывает, что специализация бьет масштаб. Лицензия OpenMDW-1.1 позволяет бизнесу модифицировать эти веса под проприетарные нужды. Интеграция в llama.cpp закрывает последний вопрос — доступность. Теперь запуск SOTA-помощника для R&D на локальной инфраструктуре — это не вопрос безопасности или задержек API, а вопрос здравого смысла и операционной эффективности. Универсальные LLM проигрывают там, где требуется глубокое понимание архитектуры кода и предсказуемая стоимость владения.
Итог
Архитектура MoE на 118 млрд параметров активирует лишь 8,5 млрд на токен, обеспечивая высокую скорость. Гибридное внимание 3:1 между скользящим окном и глобальными слоями снижает нагрузку на видеопамять. Результат 78,5% в SWE-bench опережает модели, которые в 10 раз больше по объему параметров. Нативная поддержка логических рассуждений позволяет гибко настраивать работу ИИ-агентов. Поддержка квантования FP8 и llama.cpp делает модель доступной для локального корпоративного развертывания.