Текстовая цепочка рассуждений, которую выдает модель, в лучшем случае представляет собой отредактированное постфактум оправдание ее реальных внутренних вычислений. Чтобы заглянуть за кулисы процесса, исследователи Кан Чэнь, Сыхань Чжао, Исинь Цао и Юйган Цзян из Фуданьского университета и Шанхайского института инноваций представили двухуровневый фреймворк внутреннего считывания, который декодирует скрытую динамику рассуждений напрямую из архитектур со смесью экспертов (MoE).
Вместо разбора сгенерированных токенов команда сжала словарное пространство J-space в J64 — компактный 64-осевой семантический каркас, извлекаемый напрямую из скрытых состояний. J64 изолирует латентные когнитивные сдвиги, которые никогда не проявляются в итоговом ответе, четко разделяя обычную многословность прямого прохода и подлинное вычислительное напряжение при решении сложной задачи. На бенчмарках фреймворк показал прирост AUC на 0,096–0,135 по сравнению с базовыми методами, отслеживающими только занятость токенов.
Что принципиально важно, такая прозрачность не требует колоссальных вычислительных затрат. Исследователи реконструировали семантический каркас напрямую из встроенной статистики маршрутизации экспертов в виде легковесного прокси-модуля R64. На трех моделях и двух семействах архитектур R64 сохранил медианную повидовую корреляцию от 0,69 до 0,86 с J64, обеспечив от 95% до 100% его предсказательного прироста на gpt-oss-20b.
На практике считывание необработанной телеметрии маршрутизации позволяет инженерам определять, сходится ли траектория вывода к решению или просто зацикливается в деградации рассуждений задолго до появления финальных токенов. Динамические политики выбора во время инференса на основе этих непрерывных считываний повысили точность на величину до 5,9 процентного пункта, превратив низкоуровневые сигналы маршрутизации MoE в систему управления сложными вычислительными нагрузками в реальном времени.