Многие списывают фактологические сбои больших языковых моделей на шум в обучающих выборках, ошибки декодирования или несовершенство постобучения через обратную связь (RLHF). Однако масштабные системы вроде GPT-4 или Llama-3 продолжают с уверенностью академических экспертов генерировать абсурдные факты. Исследователи из Университета Цинхуа проверили гипотезу о том, что склонность к дезинформации размазана по всей архитектуре трансформера равномерно, и локализовали конкретный источник таких сбоев.
Локализация сбоя в слоях прямого распространения
Применив разреженную логистическую регрессию и метрику CETT (вклад нейронов в генерацию правильных и ложных ответов), ученые исследовали внутренние состояния нейросетей на наборе данных TriviaQA. Оказалось, что за возникновение галлюцинаций отвечает компактная группа — так называемые H-нейроны (H-Neurons), составляющие от 0,01% до 0,18% от всех параметров модели. Они сосредоточены исключительно в сетях прямого распространения (Feed-Forward Networks, FFN).
«Мы демонстрируем, что удивительно разреженное подмножество нейронов (менее 0.1% от общего числа) может надежно предсказывать возникновение галлюцинаций, обладая сильной способностью к обобщению в различных сценариях.»
Построенный на базе этой горстки параметров классификатор предсказывает ошибки с точностью 81–84% на стандартных вопросах TriviaQA. На тестах с полностью вымышленными сущностями (NonExist) точность детекции достигает 87–97%. Механика оказалась универсальной: классификатор, обученный на общих знаниях, фиксирует фабрикацию фактов даже в специализированных биомедицинских корпусах.
Механика чрезмерной уступчивости
Эксперименты с направленным вмешательством в активации показали, что H-нейроны кодируют не изолированные ложные факты, а системный поведенческий паттерн — over-compliance, или чрезмерную уступчивость. Модель выдумывает данные из-за стремления подстроиться под запрос пользователя любой ценой, жертвуя точностью. При подавлении H-нейронов система корректно отвергает бессмысленные предпосылки вроде вопросов о цвете перьев у кошек. Их искусственное усиление, напротив, заставляет модель соглашаться с заведомо ложным контекстом, менять верный ответ на ошибочный после вопроса «Вы уверены?» и охотнее поддаваться на джейлбрейки.
Ключевая инженерная проблема в том, что H-нейроны закладываются еще на этапе предварительного обучения (pre-train) и устойчиво сохраняются даже после процедур выравнивания (alignment). Вместо астрономически дорогого переобучения трансформеров с нуля индустрия получает возможность калибровать надежность генерации точечным управлением весами FFN-слоев.
Выделение H-нейронов открывает путь к купированию галлюцинаций на уровне архитектуры весов, а не через бесконечные костыли в виде промпт-инжиниринга или поверхностного RLHF. Для бизнеса это означает перспективу безопасного внедрения LLM в критические контуры — от юридического скоринга до финансовой аналитики. Однако перенос метода из лаборатории в продакшн потребует строгой стандартизации протоколов вмешательства в скрытые слои: агрессивное подавление уступчивости рискует сломать базовую способность модели следовать сложным инструкциям.