Флагманские модели ИИ совершили резкий скачок: если в конце 2024 года они решали лишь 18% головоломок New York Times Connections, то к началу 2025 года вышли на почти идеальные результаты, согласно исследованию Колумбийского университета. Однако этот прорыв в тестах — во многом иллюзия. Он демонстрирует агрессивное переобучение под шаблоны популярных публичных игр, а не подлинную способность к логическому мышлению и обобщению.
Игровые бенчмарки завышают оценки машинного интеллекта еще с 1959 года, когда Артур Сэмюэл представил программу для игры в шашки на IBM. Современные передовые модели неизбежно повторяют эту историю: они в рекордные сроки достигают максимума в синтетических тестах, но пасуют при малейших изменениях условий. Исследование Google 2024 года показало, что системы спотыкаются, как только незначительно сдвигаются классические рамки задач. Это вскрывает их зависимость от заученных обучающих выборок вместо реальной дедукции. Если же добавить пространственные задачи — например, мысленное вращение фигур, — топовые модели терпят полный провал.
Для руководства компаний вывод очевиден: безупречные результаты в синтетических логических тестах нельзя переносить на автономные бизнес-процессы. В неструктурированной корпоративной среде, где контекст меняется непрерывно, простое сопоставление паттернов заходит в тупик. Это создает для бизнеса прямую угрозу незаметных, но катастрофических логических сбоев.