Релиз Koboldcpp 1.118 — это не просто дежурное обновление, а признание того, что зоопарк форков пора приводить к единому знаменателю. Разработчики решились на болезненный, но необходимый шаг: внедрение ломающих изменений в RPC-протокол. Цель прагматична — восстановить полную взаимозаменяемость серверов и клиентов с основной веткой llama.cpp. Для системных архитекторов это означает конец эпохи костылей при поддержке распределенных вычислений на гетерогенном железе. Теперь можно масштабировать локальные LLM-фермы, не раздувая технический долг и не тратя время на поддержку специфических сетевых стеков под каждый отдельный бэкенд.
Главное
Внедрена полная совместимость RPC-протокола с апстримом llama.cpp. Удалены устаревшие методы Row Split и поддержка Rocwmma в пользу Tensor Split. Исправлены критические ошибки в работе flash prompt для моделей DeepSeek v4. Оптимизирована работа с мультимодальными моделями и инференс в формате int8.
В погоне за синхронизацией с апстримом проект безжалостно избавляется от балласта. Из кода полностью выпилен метод Row Split — теперь для разделения весов между несколькими картами по умолчанию используется Tensor Split. Туда же отправилась и поддержка Rocwmma. Такой отказ от уникальных путей оптимизации в пользу индустриальных стандартов позволяет Koboldcpp мгновенно впитывать улучшения из ядра llama.cpp. На наш взгляд, это единственно верная стратегия: чем меньше самодеятельности в методах партиционирования, тем быстрее новые SOTA-модели добираются из препринтов до реального продакшена на вашем локальном железе.
Стратегический контекст
Отказ от специфических надстроек в пользу совместимости с llama.cpp превращает Koboldcpp из инструмента для энтузиастов в надежное звено корпоративной ИТ-инфраструктуры.
Работа с актуальными моделями тоже получила долгожданную чистку. Исправлены критические баги в механизме flash prompt для DeepSeek v4, что напрямую влияет на скорость обработки длинных контекстов в многоэтапных диалогах. Мультимодальный сегмент перестал быть экспериментальным на коленке: устранены регрессии качества в Qwen Image, добавлена поддержка инференса int8-моделей и оптимизирована загрузка SeFI. Даже такие мелочи, как возможность прервать генерацию изображения простым разрывом соединения, говорят о том, что софт наконец-то перерастает стадию игрушки для энтузиастов и превращается в предсказуемый инструмент для инженеров.
Итог
Индустрия локального инференса планомерно дрейфует в сторону унификации. Эпоха, когда каждый форк считал своим долгом изобрести велосипед в области распределения нагрузки, подходит к концу. Команда Koboldcpp сделала ставку на совместимость, превращая свой продукт в прозрачный компонент распределенной вычислительной стратегии. Это правильный сигнал для бизнеса: локальный AI становится модульным, предсказуемым и, что важнее всего, совместимым.