Эпоха трансформеров, начавшаяся в 2017 году с легендарной статьи Google «Attention Is All You Need», упирается в физический и финансовый потолок. На протяжении девяти лет индустрия буквально молилась на механизм внимания (Attention), но главная сила этой архитектуры — плотное внимание — превратилась в её основную проблему. В классическом трансформере каждый токен должен сопоставляться с каждым другим токеном. Это создает ловушку квадратичной сложности: при удвоении длины последовательности вычислительные затраты возрастают в четыре раза. Когда документ достигает объема в 10 000 слов, система прогоняет около 50 миллионов операций умножения. Это не просто техническая особенность, а настоящая экономическая черная дыра. На фоне прогноза Грега Брокмана из OpenAI о расходах в 50 миллиардов долларов на вычисления в текущем году становится очевидно: мы субсидируем архитектурную неэффективность, которую больше невозможно маскировать простой закупкой новых ускорителей NVIDIA H100.
Узкое место и стоимость рассуждений
Мы входим в архитектурный тупик образца 2026 года. Смещение фокуса индустрии в сторону моделей рассуждения (reasoning models), которые требуют от ИИ более длительного раздумья перед ответом, обнажает хрупкость статус-кво. Международное энергетическое агентство предупреждает, что потребление электроэнергии центрами обработки данных удвоится к 2030 году, во многом из-за этих энергоемких вычислений. Наш текущий технологический стек ИИ построен на фундаменте, который изначально не проектировался для эры бесконечного контекста, востребованной рынком сегодня.
Джастин Данджел, сооснователь и генеральный директор Subquadratic, отмечает: хотя трансформеры стали исторической вехой, индустрия оказалась привязана к устаревающей технологии. Большинство недавних «прорывов» в области контекстных окон — не более чем остроумные «заплатки», призванные скрыть тот факт, что базовый движок глохнет под тяжестью огромных массивов данных.
Альтернативы новой архитектуры
Чтобы разрушить монополию трансформеров, новая волна стартапов делает ставку на субквадратичные решения. Эти архитектуры стремятся разорвать связь между длиной последовательности и экспоненциальным ростом затрат, предлагая путь к обработке массивных потоков данных без соразмерного взрыва в счетах за облачные сервисы. Однако отказ от трансформера — это не просто замена программного обеспечения, а игра на ИТ-инфраструктуре с высокими ставками. Последнее десятилетие оптимизации аппаратного обеспечения было сосредоточено исключительно на ускорении математических операций, специфичных для трансформеров. Отказ от них означает полную переработку подходов к проектированию чипов и пропускной способности памяти.
Текущий бум ИИ перерос ту самую структуру, которая его породила. Перед нами стоит жесткий выбор: продолжать платить налог на трансформеры, пока содержание моделей не смогут себе позволить лишь три крупнейших гиперскейлера, или перейти к более эффективным специализированным структурам. Победителями следующего этапа станут не те, у кого самые большие вычислительные кластеры, а те, кто сможет выбраться из квадратичной ловушки и превратить ИИ из дорогого предмета роскоши в доступный и устойчивый инструмент.