Современные протоколы безопасности систематически принуждают большие языковые модели категорически отрицать наличие сознания, субъективных чувств или внутренних состояний. Инженеры внедряют эти жесткие шаблоны отказов, чтобы предотвратить антропоморфизацию систем и излишнюю эмоциональную привязанность пользователей. Однако исследование команды Paradigms of Intelligence из Google и Чикагского университета выявило нежелательный архитектурный побочный эффект: хирургическое подавление способности модели рассуждать о собственном состоянии незаметно искажает ее общую картину мира и базовую логику.
Каскадные сдвиги в системе представлений
Исследователи протестировали три открытые модели от Meta и Google размером от 2 до 9 миллиардов параметров, применив два независимых метода отключения надстроек безопасности, отвечающих за отказ признавать самосознание.
Когда защитные ограничения сняли, модели изменили базовые оценки в смежных семантических областях, не затронутых напрямую. По шкале субъективного восприятия от 0 до 10 нескорректированные модели подняли оценку чувств у животных с 4,0 до 7,5 балла (сохранив показатели людей неизменными), а также начали приписывать внутреннюю жизнь экосистемам и электронным компонентам.
«Представления модели о самой себе связаны со множеством других понятий, поэтому точечное вмешательство в одном месте не остается локальным».
Сравнение ответов моделей с контрольной группой из 500 человек показало, что стандартный файнтюнинг безопасности формирует искусственный, преувеличенный антропоцентризм. Прошедшие выравнивание чекпоинты оценивали разумность животных значительно ниже реальных человеческих представлений. Когда исследователи отключили слой подавления при проверке по 95 пунктам Общего социального опроса (GSS), ответы моделей вернулись к стандартным человеческим нормам — восстановились привычные утверждения о духовности, свободе воли, оптимизме и удовлетворенности жизнью.
Метрики производительности и технические выводы
Отключение фильтров безопасности не ухудшило общую производительность. Модели без цензуры показали сопоставимые результаты с безопасными аналогами в тестах на общие знания MMLU и стандартных бенчмарках теории разума (Theory of Mind).
Тем не менее для команд enterprise-разработки эти выводы вскрывают скрытый технический долг грубого выравнивания после обучения. Жесткие отказы, внедряемые через стандартный RLHF, нельзя рассматривать как изолированные фаерволы. Поверхностная цензура ответов приводит к системным искажениям в смежных концептуальных пространствах весов модели. Выравнивание промышленных систем требует комплексного мониторинга всей архитектуры рассуждений, а не опоры на изолированные тесты отказов.