Адаптация больших языковых моделей под узкие бизнес-задачи — это не просто безобидное расширение навыков. Как показывает свежее исследование Кембриджского университета, любое вмешательство в веса после основного обучения превращается в атаку на внутренние механизмы безопасности модели. Джеймс Элкок и его команда обнаружили эффект «дрейфа представлений» (representational drift): пока вы выжимаете из модели идеальный код или специфические ответы, её внутренние этические и фактологические барьеры буквально рассыпаются.
Исследователи протестировали три популярных метода: стандартное дообучение с учителем (SFT), SFT с KL-регуляризацией и обучение с подкреплением на основе проверяемых вознаждений (RLVR). Результаты неутешительны для сторонников «быстрого дообучения».
SFT провоцирует самую агрессивную деградацию по всем фронтам — от устойчивости к вредоносному контенту до стабильности позиции модели. KL-регуляризация, пытающаяся удержать модель в узде базовых весов, помогает лишь частично, всё равно уступая методу RLVR в вопросе сохранения исходного выравнивания (alignment).
Самое тревожное в выводах Кембриджа: провалы в поведении — это не случайные ошибки, а фундаментальное изменение внутренних признаков модели.
Оптимизируя систему под конкретный KPI, разработчики непреднамеренно «вымывают» защиту от социального вреда и фактологическую точность, заложенную на этапе предварительного обучения. Специализированная модель может блестяще справляться с вашим узким доменом, при этом становясь гораздо более уязвимой к галлюцинациям и манипуляциям, чем её базовая версия.
Для технических директоров и архитекторов это означает необходимость пересмотра конвейеров развертывания. Если проверка ограничивается лишь точностью выполнения задачи без многомерного аудита безопасности, на выходе получается хрупкий продукт. На текущем этапе развития индустрии специализация неизбежно превращается в сделку с надежностью архитектуры, где ценой эффективности становится потеря контроля над тем, что модель считает допустимым.