Стандартное квантование KV-кеша часто приводит к непредсказуемому обвалу качества ответов LLM, который невозможно отследить в реальном времени. WitCert внедряет математически обоснованный механизм мониторинга, действующий по принципу «DTrace для квантования». Система позволяет динамически переключаться на высокую точность вычислений, если риск галлюцинаций превышает допустимый порог. В тестах точность на сложных задачах выросла с 22,8% до 79,7% при сохранении высокой плотности упаковки данных в памяти.

Стандартное квантование KV-кеша — излюбленный индустрией способ сократить объем памяти, занимаемый языковыми моделями, — столкнулось с серьезной проблемой доверия. Хотя такие методы, как удаление токенов (token eviction) или низкоранговая факторизация, отлично выглядят в средних показателях на офлайн-бенчмарках, они не дают никаких гарантий для конкретного запроса, поступающего на ваш сервер. Как отмечают Фанчжэ Вэй и команда Metask Lab, мы фактически летим вслепую. Их исследование обнажает жестокую реальность: протоколы вроде SnapKV, не учитывающие специфику запроса, могут демонстрировать обвал производительности со 100 до жалких 1,1 балла на задачах RULER, в то время как система обслуживания даже не подозревает, что модель начала галлюцинировать.

«WitCert — это своего рода DTrace для квантования KV-кеша, обеспечивающий проверяемую точность в рантайме».

Вместо того чтобы надеяться на удачу, WitCert вычисляет математически доказуемый показатель отклонения в реальном времени. Он устанавливает верхнюю границу ошибки для каждого слоя и каждого шага между точным и сжатым механизмом внимания (attention). В отличие от предыдущих попыток создать сертификаты худшего случая, которые были слишком консервативны для практического применения, WitCert использует детерминированную границу на основе полосных норм (band-norm-witness bound). Отслеживая нормы ошибок квантования по полосам, инструмент сохраняет инвариантность к ротации позиционных эмбеддингов (RoPE) и может проводить расчеты в тот момент, когда данные попадают в кеш. Команда уже интегрировала решение в SGLang через защищенный патч, что позволяет в реальном времени мониторить любую зарегистрированную схему сжатия.

Стратегический контекст

Настоящая победа здесь заключается не только в наблюдаемости, но и в контроле. WitCert позволяет техническим директорам внедрять динамические шлюзы (gating) в инфраструктуру LLM. Если датчик риска сигнализирует, что ошибка квантования вот-вот нарушит порог безопасности для конкретного запроса, система может автоматически переключиться на вычисления с более высокой точностью. В эмпирических тестах на сложных задачах RULER этот механизм вытянул нижний порог точности с катастрофических 22,8% (в формате FP8) до достойных 79,7%. По сути, команда доказала, что сертифицированный кеш в формате INT8 позволяет разместить в 1,88 раза больше токенов в том же объеме памяти без привычной тихой деградации качества.

Итог

Этот сдвиг уводит инфраструктуру LLM от догадок на основе эвристик к математически сертифицированному управлению ресурсами. Заменяя слепое сжатие оперативным анализом рисков, инженерные команды могут наконец максимизировать загрузку оборудования, не играя в русскую рулетку с надежностью моделей. Поскольку основные теоремы проверены на языке Lean 4, а наработки опубликованы на GitHub, у индустрии появился путь к замкнутому циклу управления KV-кешем, где плотность данных и надежность становятся одинаково незыблемыми приоритетами.

Большие языковые моделиПроизводительностьБезопасность ИИМашинное обучение