Стандартная инфраструктура, оптимизированная под большие языковые модели (LLM), в корне не подходит для тяжелых вычислительных задач, которые стоят перед современными рекомендательными движками. Детальный разбор новой рекомендательной модели Meta GEM (Generative Ads Recommendation Model) обнажил суровую реальность: универсальные конфигурации оставляют огромную часть вычислительной мощности неиспользованной. Отказавшись от готовых решений, Meta вдвое повысила сквозную эффективность обучения, достигнув показателя Model Flops Utilization (MFU) в 20–25%. Это не просто незначительный прирост, а тактика выживания, учитывая, что объем вычислений (FLOPs) для их обучения за последний год вырос в четыре раза.

Основное трение возникает в гибридной архитектуре GEM. В отличие от однородной плотности LLM, GEM оперирует триллионами разреженных параметров вложений (embeddings) наряду с миллиардами плотных параметров. Применение стандартных методов низкой точности или базового параллелизма к такому миксу приводит к простою оборудования и деградации точности. Ответом Meta стала не покупка дополнительных H100, а переписывание правил их использования.

Устранение вычислительного разрыва через совместное проектирование

Чтобы выжать максимум из кремния, Meta отошла от стандартных библиотек в пользу агрессивного совместного проектирования (co-design) софта и железа. Они разработали набор кастомных ядер, включая Jagged Flash Attention (JFA), Generalized Dot-Product Attention (GDPA) и BlockAttention. Это не просто технические изыски, а необходимость для обработки асимметричных последовательностей, где длинные запросы встречаются с короткими парами ключ-значение — сценарий, на котором обычно захлебываются стандартные конвейерные ядра, заставляя вычислительные блоки GPU голодать.

Инфраструктура ИИ, оптимизированная для обучения LLM, не переносится напрямую; она требует значительных инноваций и совместного проектирования аппаратного и программного обеспечения.

Помимо ядер, команда внедрила сверхнизкую точность вычислений через формат MXFP8 для механизмов внимания и многослойных перцептронов (MLP). В мире оптимизации рекламы с высокими ставками даже незначительные численные сдвиги могут обрушить выручку. Инженерный подвиг Meta заключался не просто во внедрении низкой точности, а в ее специфической настройке под рекомендательные нагрузки, чтобы стабильность обучения не рассыпалась под весом квантования.

Жесткая экономика 5D-параллелизма

Масштабирование GEM на тысячи GPU потребовало стратегии 5D-параллелизма с учетом топологии сети. В инфраструктуре элитного уровня простое добавление карт — бессмысленная затея, если накладные расходы на связь поглощают прирост производительности. Meta развернула сложную комбинацию: 2D FSDP и экспертный параллелизм для плотных параметров в сочетании с полностью шардированным 2D-параллелизмом моделей для разреженных вложений. Это проектировалось в связке с многоуровневой иерархией сети, что позволило реализовать коллективные операции без участия SM-ядер, скрывая передачу данных за активными циклами вычислений.

Сложность GEM обусловлена раздвоенным набором признаков: последовательные данные (история активности) и непоследовательные (геопозиция, креативы). Каждая группа требует независимых механизмов внимания, что создает уникальную нагрузку на память и пропускную способность сети. Переход Meta к глубокой оптимизации программного стека стал единственным способом управлять триллионами параметров, избегая ловушки постоянных перевычислений из-за дефицита памяти.

Отчет Meta служит предупреждением для индустрии: стандартный программный стек для ИИ уже устарел для игроков высшей лиги. Удвоив эффективность, компания доказала, что настоящий ров — это не просто владение GPU, а инженерная глубина, позволяющая подчинять софт архитектуре железа. Для конкурентов, полагающихся на базовые библиотеки, разрыв в точности таргетинга и стоимости клика будет только увеличиваться.

ПроизводительностьAI-чипыMeta AIМашинное обучениеИИ в маркетинге