Спустя четыре года после старта гонки, начатой ChatGPT, передовые модели от OpenAI, Anthropic и DeepSeek демонстрируют поразительную беглость речи. Однако за этим скрывается серьезное инженерное ограничение: нейросетям требуется примерно в 100 000 раз больше лингвистических данных, чем ребенку для освоения родного языка. В то время как ребенок усваивает синтаксис и контекст из редких, привязанных к физическому миру взаимодействий, современные системы ИИ поглощают практически весь оцифрованный массив текстов человечества просто для того, чтобы имитировать базовые рассуждения.
Архитектура трансформеров, требующая колоссальных объемов данных, вплотную столкнулась с физическими ограничениями. Открытая модель Llama 3.1 от Meta поглотила 15 триллионов токенов в процессе предварительного обучения, а текущие передовые запуски требуют еще больше, отмечает когнитивист из Джорджтаунского университета Итан Готлиб Уилкокс. Исследователи предупреждают, что качественные веб-данные закончатся уже в текущем десятилетии. При этом экстенсивное наращивание вычислительных мощностей дает все меньше отдачи с точки зрения эффективности выборки, превращая многомиллиардные инвестиции в GPU-кластеры во все менее рентабельные вложения.
Коммерческое преимущество в следующем технологическом цикле получат не те игроки, которые способны лишь финансировать все более крупные вычислительные кластеры. Реальное конкурентное преимущество сформируют разработчики архитектур с высокой эффективностью выборки, способных формировать глубокие модели мира на основе минимального объема разрозненных входных данных.