Эпоха генеративного «бреда» и бесконечных галлюцинаций упирается в жесткий потолок. На смену вероятностному угадыванию приходит диктатура детерминированной логики. Долгие годы идеальный результат на Международной математической олимпиаде (IMO) оставался заповедником для единиц — высшим мерилом человеческого разума, недоступным кремнию. В этом месяце в Шанхае барьер пал. Китайские технологические гиганты Huawei и Xiaohongshu (известная на Западе как RedNote) объявили, что их модели выбили 100% на задачах текущего года. Из 666 лучших человеческих умов планеты лишь семеро достигли идеального балла. Теперь в этот закрытый клуб вошли машины, и это официально закрывает дискуссию о том, способен ли ИИ к сложному рассуждению.

Крах барьера сложности

Этот скачок — не просто очередной обновление, а структурный сдвиг в архитектуре мышления. Еще год назад система от Google DeepMind претендовала лишь на «серебро», тратя двое суток на решение четырех задач из шести. Темпы ускорения ошеломляют: система Celia от Huawei продемонстрировала универсальность во всех разделах математики, а модель dots-note-3.0 от Xiaohongshu взяла абсолютный результат в своем дебютном выступлении. Как подчеркнули в Xiaohongshu, ранее ни одна большая языковая модель не получала высший балл при официальном судействе IMO.

«До этого момента ни одна LLM не проходила через официальное сито проверки IMO с идеальным результатом», — констатировали в Xiaohongshu.

Процесс перестал быть «черным ящиком». Переход к проверяемым цепочкам рассуждений (Chain-of-Thought) становится индустриальным стандартом. Важно, что условия задач передавались разработчикам только после того, как живые участники сдавали работы, а любое вмешательство человека в процесс генерации решения исключалось.

Глобальное доминирование и экономика точности

Для бизнеса этот прорыв означает нечто большее, чем победа в школьной олимпиаде. Это фундамент для автоматизации критического инжиниринга. Логика, необходимая для решения геометрии уровня IMO — это та же база, которая исключает критические ошибки в софте или дефекты в архитектуре микрочипов. И хотя китайские лаборатории — включая Moonshot AI с их моделью Kimi K3 — сейчас задают темп, западные игроки дышат в затылок. Диди Дас из Menlo Ventures подтвердил, что новейшие модели OpenAI, Anthropic и стартапа Axiom Math также вплотную приблизились к максимуму в 42 балла. Математический Reasoning превращается из экзотики в базовую гигиеническую характеристику топового ИИ.

Для руководителей R&D-департаментов правила игры меняются. Продукты уровня «почти правильно» больше не являются передовыми. Когда ИИ догоняет топ-1% математиков мира, фокус смещается с креативной помощи на промышленную верификацию. Мы входим в фазу, где нейросети будут не просто «подсказывать» код, а математически доказывать его корректность. Разрыв между лабораторным черновиком и промышленным стандартом закрыт. Конкурентное преимущество теперь не у того, чей ИИ больше, а у того, чей ИИ точнее. Впереди — тотальная ставка на надежность автономных систем, где право на ошибку просто не предусмотрено архитектурой.

Искусственный интеллектБольшие языковые моделиИИ в бизнесеHuawei