Современные языковые модели традиционно обучают на хаотичных массивах данных из интернета. Из-за этого инженеры не могут точно определить, где модель действительно демонстрирует логическое мышление, а где лишь выполняет трюки стохастического попугая в многомерном пространстве. Проект LittleLearner устраняет эту неопределенность: исследователи с нуля обучили семейство моделей размером 0,6 млрд, 1,3 млрд и 5 млрд параметров на датасете LittleCurriculum. Этот массив на 88 млрд токенов был выделен из FineWeb-Edu с помощью строгой пятиэтапной фильтрации, точно привязанной к стандартам начальной школы США (K–5).

Прямое архитектурное сравнение с контрольными моделями на нефильтрованных данных при абсолютно одинаковом бюджете токенов и параметрах обучения позволило ученым вывести математическую границу между структурной логикой и простым механическим запоминанием. Результаты экспериментов вскрыли неудобный для сторонников бесконечного масштабирования факт: пост-тренинг через обучение с учителем (SFT) и GRPO, масштабирование параметров до 5 млрд и контекстный промптинг лишь усиливают те навыки, которые уже заложены в исходном распределении данных предобучения. Ни один из этих методов доработки не позволил моделям уверенно выйти за рамки программы пятого класса, доказав, что состав предобучающего датасета формирует жесткий потолок возможностей нейросети.

Для основателей EdTech-стартапов, корпоративных CTO и специалистов по комплаенсу в регулируемых отраслях это открытие дает готовую стратегию. Вместо многомиллионных затрат на попытки обуздать гигантские модели ненадежными промпт-фильтрами кураторский отбор данных для предобучения создает строгие границы знаний на фундаментальном уровне. Такой подход устраняет галлюцинации и утечки недопустимых данных по умолчанию, одновременно радикально снижая расходы на инференс за счет компактного размера моделей.

Искусственный интеллектМашинное обучениеБольшие языковые моделиДообучение моделейБезопасность ИИ