Современные рассуждающие модели (LRMs) столкнулись с эффектом убывающей отдачи, известным как «overthinking» или избыточное мышление. Хотя глубокая проработка шагов позволяет ИИ эффективно решать сложные математические задачи и писать код, она же провоцирует порочный круг бесконечных самопроверок. Эти пустые циклы раздувают длину ответа, не повышая его точности. Исследования Юго-Восточного университета и Noah’s Ark Lab подтверждают: вычислительные ресурсы тратятся на неэффективные блоки, которые просто дублируют уже пройденный путь. Для бизнеса это не просто технический нюанс, а прямая финансовая дыра: предприятия фактически оплачивают лишние слова в счетах за инференс.

Провал бинарных переключателей

Попытки индустрии решить проблему избыточного мышления обычно сводятся к примитивному переключателю между «быстрым» и «медленным» режимами. Согласно этой логике, модель должна заранее угадать, является ли задача простой для прямого ответа или требует пошагового разбора. Как отмечают исследователи Синьбан Дай, Чжэюй Синь и Хуйкан Ху, такой подход уязвим к ошибкам классификации. Если модель примет сложную задачу за простую, она проигнорирует логику и выдаст галлюцинацию. Другие методы пытаются сжимать траекторию рассуждений уже постфактум, действуя как тупой нож: вместе с «мусором» они часто вырезают ключевые логические звенья.

Эволюция через самообрезку

Фреймворк EvoThink меняет парадигму: вместо того чтобы избегать размышлений, он рафинирует их с помощью механизмов Self-Pruning Training (SPT) и Aha-Moment Preference Optimization (AMPO). SPT — это метод обучения без учителя, который выявляет избыточные шаги внутри мыслительного процесса модели. Он итеративно отсекает дублирующие проверки и переобучает систему на лаконичных и чистых траекториях. Модель не гадает, сложна ли задача, а учится думать ровно столько, сколько необходимо для конкретного запроса.

«Существующие подходы не способны провести тонкую грань между полезными и избыточными шагами в процессе рассуждения LRM».

Чтобы сделать логику еще острее, исследователи внедрили AMPO, вдохновленный генетическими алгоритмами. Метод фокусируется на моментах инсайта (aha-moments) — случаях, когда модель сначала ошибалась, но затем сама скорректировала путь и пришла к верному решению. Оптимизируя предпочтения в пользу таких моментов, EvoThink стимулирует поиск новых путей вместо кругового повторения старых. В итоге ИИ не просто меньше говорит, а думает эффективнее, усваивая паттерн перехода от неверного предположения к верному решению.

Экономика лаконичной логики

Для руководителей и техдиректоров это редкий случай взаимной выгоды: рост производительности при одновременном снижении затрат. Тесты на математических бенчмарках и генерации кода подтверждают, что EvoThink существенно сокращает потребление токенов при инференсе, повышая при этом качество ответов. Устраняя накопление информационного шума, который обычно деградирует производительность длинных цепочек, метод снижает совокупную стоимость владения (TCO) продвинутыми агентами. Рассуждения из дорогой венчурной ставки превращаются в точный хирургический инструмент.

Результаты Юго-Восточного университета и Noah’s Ark Lab знаменуют отказ от «ковровых бомбардировок» токенами в пользу высокой плотности мысли. Пока метод доказал эффективность в точных науках, но главным вызовом остается субъективная бизнес-логика, где грань между избыточностью и необходимым контекстом размыта. Тем не менее, путь к эффективному ИИ намечен: моделям пора научиться вовремя останавливаться.

Большие языковые моделиСнижение затратПроизводительностьДообучение моделей