Нынешняя одержимость масштабированием вычислений на этапе вывода (test-time scaling) — архитектурная основа таких моделей, как OpenAI o1, — зиждется на заманчивом, но зачастую ошибочном допущении: будто бесконечное накопление токенов в цепочке рассуждений (Chain-of-Thought) является прямым путем к интеллекту. В действительности мы наблюдаем парадокс «передумывания», когда модели сжигают вычислительные ресурсы, просто ходя по кругу. По мнению Чэн Яня и его исследовательской группы, стандартные отраслевые метрики эффективности не работают. Полагаться на простую энтропию — бессмысленная затея; она часто маскирует галлюцинации под уверенность, не оставляя архитекторам возможности в реальном времени понять, решает ли модель задачу или просто выдает галлюцинации в высоком разрешении.
PUMA: Математический детектор лжи для нейросетей
Чтобы сорвать этот фасад, исследователи представили PUMA (Phase-Momentum Alignment) — фреймворк, не требующий дополнительного обучения, который действует как математический детектор лжи для путей рассуждения. Ключевая идея заключается в том, что подлинный логический прогресс обладает специфической «латентной скоростью». Отслеживая синхронизацию между геометрическим моментом и разрешением неопределенности, PUMA способна отличить активный поиск решения от пассивной стагнации. В то время как типичные мониторы анализируют лишь следующий токен, PUMA отслеживает «извилистость» — по сути, измеряя, движется ли логика модели вперед или буксует в пустоте высокой энтропии.
«Если модель теряет фазово-импульсное выравнивание, вы платите не за "глубокое мышление", а за цифровой холостой ход и избыточную генерацию токенов, которые не добавляют ценности итоговому результату».
Прагматика для бизнеса: экономия облачного бюджета
Для технических директоров (CTO) и AI-архитекторов, управляющих моделями объемом от 1,5 до 32 миллиардов параметров, это не просто академическое упражнение по геометрии, а руководство по выживанию для облачного бюджета. Эксперименты на QwQ-32B показывают, что PUMA работает как хирургический фильтр, позволяя адаптивно отсекать непродуктивные пути рассуждений. Это доказывает: слепое масштабирование — кратчайший путь к финансовому истощению.
Модели часто имитируют процесс размышления, генерируя бессмысленные циклы. Традиционные метрики не отличают уверенную галлюцинацию от верного ответа. Метод PUMA позволяет обрывать вычисления, как только логика «зацикливается». Эффективный мониторинг снижает затраты на инференс без потери качества.
Математика неумолима: рост вычислительных мощностей приносит более умные результаты только в том случае, если эти вычисления дисциплинированы. PUMA обеспечивает необходимый «ручной тормоз», позволяющий пресечь стагнацию рассуждений до того, как она сожжет вашу маржу. В эпоху, когда у каждого токена есть ценник, внедрение мониторинга на основе импульса — единственный способ перестать поощрять модели за их способность имитировать мысль, не двигаясь при этом с места. Пора прекратить субсидировать циклы галлюцинаций и начать требовать измеримого когнитивного прогресса.