Обучение reasoning-модели на базе online RL заняло у команды Сбера более девяти месяцев. Итогом стал релиз GigaChat 3.5 Reasoning — первой отечественной модели с полноценным механизмом цепочки рассуждений (chain-of-thought). Веса и код инференса разработчики открыто опубликовали на Hugging Face, сделав доступной локальную альтернативу зарубежным reasoning-системам вроде OpenAI o1 или DeepSeek-R1.

Архитектура шести экспертов

Классический этап SFT (Supervised Fine-Tuning) приучает сеть воспроизводить форму правильного ответа, но оставляет фатальные слепые зоны в строгой логике доказательств. Чтобы уйти от простого заучивания шаблонов, модель после SFT целиком пропустили через контур online RL. Инженеры вырастили из базового чекпоинта шесть независимых доменных экспертов — каждый тренировался под собственную функцию награды (reward function), после чего их объединили обратно в единый монолит.

«после SFT модель целиком прошла через online RL. Не один домен и не одна финальная стадия, а шесть отдельных экспертов (математика, код, агенты, и другие), каждый со своей наградой, которые потом собрали обратно в одну модель.»

Сборку экспертов обратно выполнили методом on-policy distillation. Обучение каждого направления шло по алгоритму CISPO из работы MiniMax-M1 — близкому аналогу GRPO. Ключевое отличие: CISPO сохраняет токены сомнения и самопроверки (проверим, «стоп, здесь ошибка»), не отсекая их при выходе за границы распределения, а плавно снижая штраф за отклонение градиента.

Динамика сложности и метрики

Обучение reasoning-моделей опирается на фильтрацию сложности: задачи, которые текущий чекпоинт решает с вероятностью от 75%, сразу исключаются из пайплайна из-за околонулевого градиента для дообучения.

Переход к пошаговым рассуждениям кратно снизил галлюцинации в коде, строгой математике и агентских пайплайнах. В сравнении с базовой GigaChat 3.5 Instant бенчмарк GPQA-Diamond вырос с 61,11 до 82,32 пункта, на AIME-2026 (метрика mean@32) результат поднялся с 67 до 92, а в тесте на строгое следование инструкциям IFBench Loose Prompt — с 43,66 до 77,00.

Для корпоративного сектора открытые веса GigaChat 3.5 Reasoning меняют экономику внедрения: enterprise-сегмент получает рассуждающую модель под автономные B2B-агенты, которую можно развернуть в изолированном on-premise контуре без отправки чувствительных данных во внешние зарубежные облачные API.

Большие языковые моделиОпенсорс ИИЛокальный ИИДообучение моделейСбер