Подразделение Google DeepMind опубликовало технический отчет о проекте DiffusionGemma, наглядно доказав, что для создания мощных систем не обязательно сжигать миллионы долларов на новые циклы обучения. Вместо этого исследователи продемонстрировали метод вторичной переработки весов существующих больших языковых моделей (LLM) — в частности, Gemma-4-26B-A4B — в системы на базе диффузии. Модернизировав архитектуру, команда перешла от изнурительной посимвольной генерации к параллельной обработке блоков по 256 токенов. Это не просто косметическая правка, а фундаментальный сдвиг: текст теперь очищается от шума подобно тому, как проявляется изображение в диффузионных моделях. На ускорителе Nvidia H100 такая конфигурация достигает пропускной способности в 1500 токенов в секунду, что является колоссальным скачком для систем с жесткими требованиями к задержке.
Стратегический контекст
Математическое обоснование этой конверсии — вот что действительно важно для технических директоров. DeepMind реализовала проект, затратив менее 10% от исходного бюджета токенов, использованных при обучении базовой модели. Рецепт включал двухэтапную стратегию: сначала модель учили реконструировать зашумленный текст, затем применяли комбинацию обучения с подкреплением и дистилляции семплеров, названную SD·RL. Этот процесс не просто сохранил текущие показатели — он поднял результаты в тестах на логическое мышление в среднем на десять пунктов и почти в четыре раза увеличил количество токенов, обрабатываемых за один вычислительный шаг. Что критически важно, двунаправленное мышление модели позволяет ей возвращаться назад и исправлять ошибки до завершения вывода. Благодаря этой способности нейросеть решила 85% головоломок Судоку — логический тест, в котором базовая авторегрессионная модель потерпела полный крах.
Мы наблюдаем разворот от грубой силы и непомерных трат на создание новых моделей к хирургической точности адаптации существующих активов для специализированного параллельного вывода.
Итог
Эксперимент подтверждает жизнеспособность стратегии перепрофилирования ИИ-активов в высокопроизводительные узкоспециализированные инструменты вместо того, чтобы списывать их как устаревший код. Хотя абсолютная производительность все еще уступает авторегрессионной базе из-за экспериментального характера доработки, преимущества в генерации структурированных данных (таких как JSON) и исправлении кода неоспоримы. Для любого предприятия, обладающего массивом проприетарных весов моделей, это готовая инструкция по подарению им второй жизни.