Когда большие языковые модели генерируют пошаговые рассуждения, их видимые текстовые токены не обязательно отражают всю механику вычислений. Исследователи из южнокорейского института KAIST и Naver AI Lab решили проверить, соответствуют ли эти этапы рассуждений различимым внутренним паттернам числовых состояний, а не просто отражают выбор слов на поверхностном уровне.

Отслеживание логики в скрытых слоях Для измерения этих представлений команда KAIST и Naver AI Lab выделила восемь повторяющихся операций рассуждения, включая извлечение, декомпозицию, извлечение формул, дедукцию и вычисления. Они поручили моделям Qwen2.5-7B, Qwen-8B и Gemma-31B решение математических задач, разбив полученные пути решения на отдельные сегменты.

Результаты подтвердили, что внутренние представления надежно отражают активную операцию, причем разделение достигает пика в средних слоях моделей. Классификатор, анализирующий внутренние числовые представления, превзошел классификатор, оценивающий только использованные токены, что доказывает: скрытые состояния кодируют функциональную логику за пределами словарного запаса.

Одно и то же слово получает разное внутреннее представление в зависимости от того, к какому этапу рассуждений оно принадлежит.

Даже стандартные служебные слова вроде «a», «is» или «the» в более глубоких слоях разделяются на четкие числовые представления в зависимости от того, выполняет ли модель дедукцию или производит расчеты. Когда исследователи заблокировали внимание к предыдущим 30 токенам с помощью целенаправленного вмешательства, операционный сигнал ослаб, показав, что этапы рассуждений строятся непосредственно на основе окружающего их контекста.

Распознаваемые этапы и недостоверные результаты Внутренние функциональные сигнатуры сохранялись даже на ошибочных путях рассуждений. Когда модели пропускали правильное решение, конкретная операция оставалась различимой: дефектный шаг вычислений продолжал демонстрировать внутренние характеристики расчета, несмотря на возвращение неверного числового результата. Разделимость операций была дополнительно воспроизведена в Llama-3-8B, в то время как классификаторы, обученные на Qwen-8B, успешно перенеслись на бенчмарки GPQA-Diamond и MATH-500.

Для корпоративной инженерии это меняет парадигму: ИИ перестает быть непостижимым черным ящиком, поскольку появляется возможность мониторинга промежуточных шагов генерации. Проверяя вычислительную валидность скрытых активаций, а не полагаясь на поверхностный текст, технические руководители получают конкретный механизм для аудита достоверности рассуждений. Тем не менее, текущие эмпирические доказательства ограничены математическими задачами на узком наборе архитектур, а вопрос о том, могут ли классификаторы внутренних состояний активно перехватывать ошибки генерации в реальном времени, остается открытым для исследований.

Большие языковые моделиНейросетиМашинное обучение