Стандартный рецепт обучения больших языковых моделей рассуждению сегодня напоминает дарвиновский отбор: разработчики генерируют цепочки мыслей (CoT), оставляют те, что привели к верному результату, и скармливают их модели. Когда же ИИ буксует и не может сам нащупать путь к истине, в ход идет опасный костыль — моделям показывают правильный ответ и просят «обосновать» решение. Исследование специалистов из Университета Корё (Korea University) и Zoom Communications доказывает: этот метод «подглядывания» незаметно разъедает интеллект системы. Внешне цепочки рассуждений выглядят безупречно, но за этим фасадом скрывается полная деградация способности мыслить.

Эксперимент на один бит

Фундаментальная проблема в том, что правильная цепочка мыслей — это мусор, если она была написана с оглядкой на финишную черту. Чжунсоб Ли, Сынъюн Ли и их коллеги провели контролируемый эксперимент, чтобы изолировать этот эффект. Они зафиксировали генератор и набор задач, меняя лишь одно условие: видела ли модель ответ при создании обучающих данных (answer-conditioned) или нет (answer-blind). Результаты оказались разгромными: обучение на данных с «подсказками» резко снижает точность верифицируемого рассуждения. Причем этот разрыв не просто заметен — он растет экспоненциально вместе со сложностью задач.

Обучение на цепочках, подогнанных под ответ, дает результат на 27 пунктов хуже, чем честная генерация «вслепую» на самых сложных олимпиадных задачах.

Эта пропасть в производительности доказывает, что проблема кроется в самих данных, а не в архитектуре. Исследователи проанализировали восемь моделей из четырех разных семейств и обнаружили, что «порча» видна невооруженным глазом. Как только модель узнает ответ, она перестает выводить решение и начинает подгонять факты. Это создает «грязный» датасет, который приучает систему к имитации логики вместо реального поиска решения.

Рационализация против дедукции

Механика деградации цинична и проста: модели, знающие ответ, склонны озвучивать его в самом начале цепочки мыслей. Эта утечка данных означает, что ИИ больше не учится пошаговому процессу открытия. Вместо этого он тренируется оправдывать уже известный вывод. Абыляция промптов показала, что вред наносит именно установка на рационализацию конкретной цели, а не просто видимость ответа. Когда модели приказывают «прийти к результату», она срезает углы и избегает интеллектуальной нагрузки. В процессе тонкой настройки (fine-tuning) это создает опасную иллюзию прогресса: метрики растут, но ровно до момента, пока модель не сталкивается с задачей из реального мира, где правильного ответа в условии нет.

Практический вывод для техлидов: генерируйте данные только вслепую, потому что ни один фильтр корректности не способен выявить этот внутренний изъян.

Для владельцев AI-бизнеса и технических директоров это исследование — холодный душ на фоне увлечения методами self-taught reasoner. Попытки ускорить дистилляцию рассуждений через подсказки создают структурную гниль в логике. Даже простые фильтры, удаляющие цепочки с ранним упоминанием ответа, лечат лишь симптомы, но не болезнь. Способность к истинному рассуждению взращивается в темноте неизвестности; как только вы показываете модели финишную черту, вы перестаете учить её бежать дистанцию.

Зависимость от синтетических данных при обучении таких моделей, как DeepSeek, требует жесткого протокола answer-blind. Использование «золотых ответов» для исправления неудачных прогонов может стабилизировать графики обучения, но на выходе вы получите функционально бесполезный продукт. Если ваш датасет обусловлен результатом, вы тренируете не мыслителя, а мастера по подгонке ответов. Будущее разработки должно ставить во главу угла чистоту процесса вывода, а не простое совпадение с цифрой в конце учебника, иначе ловушка обратного проектирования станет потолком для всего сектора.

Большие языковые моделиМашинное обучениеДообучение моделейИскусственный интеллектDeepSeek