Инфраструктурные бюджеты на большие языковые модели упираются в потолок, но свежее обновление llama.cpp предлагает изящный выход для тех, кто не готов бесконечно кормить облачных провайдеров. Слияние PR #25707 обеспечило полноценную поддержку CUDA для сверхнизкого квантования Q2_0 (группа 64). После того как технологию обкатали на CPU и Metal, очередь дошла до «зеленого» железа: теперь видеокарты NVIDIA могут эффективно переваривать модели Ternary-Bonsai объемом от 1.7B до 27B параметров.
Вместо того чтобы гоняться за дефицитными H100, бизнес может упаковывать веса в тернарный формат (фактически 2 бита), радикально снижая требования к видеопамяти. Цифры из llama-bench подтверждают: на NVIDIA L40S модель Ternary-Bonsai 27B выдает бодрые 72 токена в секунду, отъедая всего 7 ГБ VRAM. Для сравнения, версия на 1.7B разгоняется до 530 токенов в секунду. Это не просто экономия, а возможность запускать серьезные нейронки на оборудовании, которое раньше считалось пригодным разве что для вывода изображения на монитор.
Технические детали и производительность
Модель Ternary-Bonsai 27B: 72 токена/сек при потреблении 7 ГБ VRAM. Модель Ternary-Bonsai 1.7B: рекордные 530 токенов/сек. Формат квантования: Q2_0 с группировкой 64 (требуются новые сборки GGUF). Совместимость: полная поддержка бэкенда CUDA для видеокарт NVIDIA.
Техническая чистота эксперимента подтверждается замерами KL-дивергенции логзитов: разница между «родным» форматом F16 и квантованным Q2_0 стремится к нулю. Вы получаете ту же логику ответов при кратно меньших затратах.
Главное для ИТ-архитекторов
Однако стоит учитывать нюанс с форматами: официальный бэкенд CUDA капризен и требует новых сборок GGUF с префиксом _g64. Старые файлы из ранних форков с группировкой 128 здесь не пройдут — придется обновить локальные репозитории.
Пока рынок захлебывается в маркетинговых лозунгах о необходимости тотального апгрейда серверных мощностей, реальная оптимизация происходит в тишине GitHub-репозиториев. Этот патч доказывает, что для специфических корпоративных задач — от внутренних ассистентов до Edge AI — выгоднее не арендовать кластеры, а выжимать максимум из того, что уже стоит в стойках. На наш взгляд, это лучший пример того, как грамотный инжиниринг побеждает «железный» дефицит.