Современные цифровые платформы зарабатывают львиную долю выручки на рекомендательных системах глубокого обучения, которые ранжируют персонализированные ленты и таргетируют рекламу. Однако по мере масштабирования этих моделей инженерное бутылочное горлышко смещается от сырой вычислительной мощности к пропускной способности межсоединений между серверными стойками. Вместо бесконечной переплаты за универсальные графические процессоры Nvidia, корпорация Meta раскрыла стратегию создания собственного кремния и представила MTIA 300. Это первый чип в линейке Meta Training and Inference Accelerator, спроектированный специально для обучения рекомендательных моделей и радикального сокращения совокупной стоимости владения (TCO) инфраструктурой.

Собственные межсоединения и разгрузка архитектуры

В отличие от больших языковых моделей, которым требуются плотные матричные вычисления, рекомендательные алгоритмы создают асимметричную нагрузку: таблицы эмбеддингов часто содержат более 99% всех параметров. Подобная архитектура вынуждает использовать гибридный параллелизм, что порождает непрерывный поток сетевых коллективных операций (AllReduce, AllToAll и AllGather) в распределенных кластерах. На стандартных GPU эти задачи коммуникации напрямую конкурируют с вычислительными ядрами за циклы процессора.

Согласно техническим данным, представленным на конференции ISCA, чип MTIA 300 устраняет эту конкуренцию благодаря переносу сетевого интерфейса непосредственно на корпус процессора.

«Совместная разработка чипа и собственной коммуникационной библиотеки HCCL позволила нам принципиально изменить подход к архитектуре кремния и сделать передачу данных приоритетной задачей первого уровня».

Кремниевая упаковка включает два сетевых чиплета с двенадцатью специализированными сетевыми контроллерами RDMA (NIC) на 800 Гбит/с. Это обеспечивает совокупную пропускную способность ввода-вывода 1,2 ТБ/с без использования шины PCIe. Прямая интеграция устраняет узкое место на уровне хост-процессора, ограничивающее производительность стандартных систем на ускорителях. Двенадцать Ethernet-контроллеров динамически распределяют до 1 ТБ/с для масштабирования внутри стойки (до 16 узлов) и 200 ГБ/с — между стойками. Это позволяет инженерам менять топологию программно, без физической перекоммутации кабелей. А аппаратные триггеры ускоренной передачи (express doorbells) преобразуют запросы на обработку сразу в исполнение, исключая циклические чтения из памяти и экономя около 800 наносекунд на каждой коллективной операции.

Для руководителей корпоративной ИТ-инфраструктуры расчет предельно ясен. Универсальные GPU остаются неоправданно дорогими для задач, ограниченных скоростью памяти и сетевыми задержками. Создавая специализированные чипы под конкретные нагрузки и собственные коммуникационные библиотеки, гиперскейлеры страхуют ключевые генераторы выручки от дефицита оборудования у сторонних поставщиков и добиваются колоссальной экономии капитальных затрат.

AI-чипыMeta AINVIDIAСнижение затратИнвестиции в ИИ