Пошаговые рассуждения преподносились как окончательное решение проблемы надежности больших языковых моделей. Разработчики обещали аналитическую точность там, где стандартная генерация выдавала лишь правдоподобный текст. Однако анализ промежуточных цепочек рассуждений вскрыл знакомый изъян. Исследование, опубликованное в журнале Nature Machine Intelligence, показывает: архитектуры рассуждений обрабатывают стереотипную информацию иначе, чем контрстереотипные вводные данные. Это создает прямую вычислительную связь между внутренними затратами на инференс и итоговыми поведенческими искажениями модели.
Вычислительная задержка и ассоциативные тесты
Исследователи Месси Х. Дж. Ли и Кэлвин К. Лай представили тест скрытых ассоциаций для рассуждающих моделей (RM-IAT), позволяющий количественно оценить, как такие системы справляются с предвзятыми ассоциациями. Адаптировав классический тест имплицитных ассоциаций человека — фиксирующий задержку реакции при категоризации понятий, — RM-IAT измеряет количество токенов рассуждения как показатель вычислительного трения. Оценив четыре архитектуры (o3-mini, DeepSeek-R1, gpt-oss-20b и Qwen3-8B), авторы выявили устойчивую закономерность: задачи, несовместимые со стереотипными ассоциациями, требовали значительно больших вычислительных затрат.
«На примере четырех моделей (o3-mini, DeepSeek-R1, gpt-oss-20b и Qwen3-8B) мы обнаружили убедительные доказательства того, что задачи, несовместимые с ассоциациями, требуют больших вычислительных усилий, чем задачи, совместимые с ними».
Подобная разница в объеме токенов показывает: цепочки рассуждений (chain-of-thought) не нейтрализуют базовые априорные установки, заложенные при обучении, а лишь рационализируют их. Сталкиваясь с данными, которые противоречат стандартным статистическим стереотипам, модели сжигают дополнительные вычислительные циклы на согласование противоречий вместо выполнения непредвзятого логического вывода.
Расхождения в логике и последствия для результатов
Исследование также выявило резкие архитектурные различия. Если o3-mini и DeepSeek-R1 тратили больше токенов на контрстереотипные ассоциации, то Claude 3.7 Sonnet продемонстрировала обратную динамику. Тематический анализ показал, что это различие связано с внутренним анализом социальных стереотипов самой моделью на промежуточных этапах. Вместо автоматического следования стандартным ассоциативным путям вычислительные мощности целенаправленно перенаправлялись в циклы мониторинга предвзятости.
Критически важно то, что авторы подтвердили конвергентную валидность между внутренним потреблением токенов и итоговыми ответами. Трение, зафиксированное RM-IAT, напрямую предопределяло искажения в тестах на словесные ассоциации и бенчмарках автоматизированного принятия решений. Нестыковки в скрытых цепочках рассуждений неизменно трансформируются в измеримую предвзятость конечного результата.
Что это значит для бизнеса
Пошаговое мышление не гарантирует архитектурной защиты от когнитивных искажений. Для корпоративных команд, внедряющих рассуждающие модели в критически важные процессы — такие как скоринг, юридический комплаенс и автоматизированный скрининг резюме, — простой проверки финального текста уже недостаточно. Если промежуточные токены служат лишь для апостериорного оправдания перекосов обучающей выборки, аудит соответствия должен анализировать динамику распределения внутренних вычислений, а не только итоговый результат.