Cerebras представила стоечную платформу CS-4, удвоив вычислительную производительность по сравнению с предыдущей CS-3 без перехода на более тонкий техпроцесс TSMC. Вместо ожидания следующего поколения литографии для гигантского чипа WSE-3 размером с кремниевую пластину, генеральный директор Эндрю Фельдман сделал ставку на повышение тактовых частот за счет радикальной модернизации системы питания и жидкостного охлаждения. Благодаря инженерным оптимизациям в одной стандартной серверной стойке теперь помещаются три цельные пластины вместо двух.

Архитектура системы нацелена на устранение узких мест при генерации с минимальной задержкой. Компания заявляет о скорости инференса для одного пользователя до 4400 токенов в секунду — показатель, который, по утверждению Cerebras, превосходит традиционные GPU-кластеры Nvidia почти в 30 раз. Однако этот прирост сопряжен со знакомыми компромиссами: объем встроенной памяти SRAM по-прежнему ограничен 44 ГБ на пластину, что сохраняет жесткую ориентацию архитектуры на экстремальную скорость вычислений, а не на хранение гигантских объемов параметров внутри одного чипа.

Для упрощения интеграции Cerebras представила модульный форм-фактор Backpack и продвигает дезагрегированные конфигурации инференса в связке с аппаратными решениями вроде AWS Trainium и платформами AMD. Аналитики SemiAnalysis отмечают, что рост пропускной способности межчиповых соединений остался умеренным. Тем не менее новая стоечная компоновка ставит перед корпоративным IT-сектором важный вопрос: сможет ли экономика специализированных пластин поколебать доминирование Nvidia в стоимости генеративного инференса?

AI-чипыГенеративный ИИNVIDIAПроизводительностьCerebras