Стартап Liquid AI представил драфт-чекпоинты DSpark для линейки моделей LFM2.5 — в частности, для LFM2.5-1.2B-Instruct, LFM2.5-2.6B и LFM2.5-8B-A1B. Механизм спекулятивного декодирования обеспечивает прирост пропускной способности до 3,18 раза на серверных графических процессорах и ускорение до 2,87 раза на локальных edge-устройствах. Поскольку архитектура верифицирует токены-кандидаты на целевой модели в режиме строгого жадного декодирования, команды инженеров получают этот прирост производительности без деградации качества генерации или просадки в бенчмарках.

Для разработчиков, проектирующих локальные циклы автоматизации, практическая выгода очевидна: решение сокращает задержку при вызове функций (function calling) на модели LFM2.5-2.6B в среднем на 57%. Архитектурный оверхед при этом остается минимальным: драфт-модели добавляют всего около 300 млн параметров — 295,7 млн для версии на 1,2 млрд и 327,7 млн для моделей на 2,6 млрд и 8 млрд параметров (8B-A1B). С точки зрения производственной эксплуатации размен скромного объема видеопамяти на двукратный рост скорости генерации выглядит максимально оправданным.

Что принципиально важно, мгновенная поддержка из коробки в llama.cpp и SGLang переводит не-трансформерную архитектуру Liquid AI из категории любопытных исследовательских прототипов в ранг готовых к продакшену инструментов для оптимизации инфраструктурных затрат. Устраняя штраф по задержке в интенсивных сценариях вызова функций, компании могут запускать отзывчивые агентные циклы прямо на локальном оборудовании, не переплачивая за централизованные и высоколатентные облачные кластеры.

Большие языковые моделиЛокальный ИИПроизводительностьИИ-агентыСнижение затрат