Индустрия привыкла решать любые проблемы ИИ экстенсивно: если модели не хватает мозгов — бери веса побольше, если тормозит — закупай еще пачку ускорителей. Этот бесконечный цикл расширения превратил масштабирование в производную от бюджета. Ситсе Схелпе из Corbenic AI в своем свежем отчете утверждает, что такие расходы — это уже не издержки, а ограничитель развития. Решение, которое он предлагает, звучит как дерзкий взлом системы: Byte-Exact KV-State Grafting. Этот метод не трогает веса модели и не требует расширения парка GPU, при этом заставляя замороженную 12B-модель работать точнее и дешевле одновременно.
The Engineering of Knowledge Grafting
Техническая суть этого маневра в том, что внутреннее состояние модели — KV-кэш — является детерминированной функцией входных данных и весов. Если зафиксировать это состояние и восстановить его позже без повторных вычислений, верифицированные знания можно «депонировать» в виде байт-точного артефакта, а затем буквально вживлять в новый контекст инференса. Как отмечает Схелпе, такой перенос не меняет веса, а восстановление остается бит-в-бит идентичным исходному. При проверке на пятидесяти образцах логит-вектор «привитой» модели продемонстрировал нулевую дивергенцию Кульбака-Лейблера по сравнению с чистым вычислением. Проще говоря, модель получает идеальное решение, не тратя ресурсы на повторение логической цепочки.
Знания, на вычисление которых были потрачены ресурсы, можно однажды сохранить как байт-точный артефакт KV-состояния и позже восстановить методом «прививки» в новый контекст.
Хотя перенос блока данных на другой офсет вносит небольшую погрешность из-за чувствительности плавающей запятой к позиционированию, восстановление в ту же позицию остается единственной точкой абсолютной точности. Отчет подтверждает работоспособность метода на моделях 12B и 31B, причем как на потребительском железе, так и на серверных архитектурах Blackwell и Hopper.
Redefining Model Performance and TCO
Экономический эффект и рост возможностей нагляднее всего видны на бенчмарке AIME 2025. Базовая 12B-модель в своей лучшей конфигурации с проверкой выдавала 80,0%. После того как в нее «вживили» библиотеку верифицированных решений, результат подскочил до 93,3%. Это выше паспортных данных самой модели (77,5%) и даже превосходит показатели старшей версии на 31B параметров (89,2%). Но настоящий повод для скепсиса в адрес любителей сжигать GPU — это стоимость. Там, где базовой модели не хватало даже лимита в 401 026 токенов на семплирование, система с «прививкой» выдала верный ответ всего за 61 токен декодирования.
В повторяющихся сценариях стоимость решения падает в разы: количество токенов сокращается в 6 574 раза, а энергопотребление — в 3 000–8 700 раз.
Помимо точности, хранилище байт-точных слепков расширяет полезное окно контекста с 32 768 до внушительных 2 854 766 токенов — рост в 87 раз. Ирония в том, что этот апгрейд не требует дополнительной памяти ускорителя, а стоимость доступа к данным не растет по мере углубления в контекст. В отдельном тесте на H100 замороженная модель на 31B достигла в этой «маховичной» системе рейтинга 97,3%, фактически закрыв вопрос о необходимости гигантских облачных моделей для специфических задач. Перед нами эффективный способ превратить локальные системы в экспертные базы, которые не забывают ничего, что было верифицировано хотя бы раз.