Meta планомерно перестраивает рекомендательный движок своего рекламного бизнеса, перенося принципы масштабирования больших языковых моделей на ранжирование объявлений. Более десяти лет индустрия AdTech полагалась на ручную разработку разреженных признаков и хрупкие гибридные модели, чтобы ранжировать миллионы кандидатов в секунду. Этот устаревший подход уперся в архитектурный тупик: передача знаний между компонентами стала ненадежной, инженерные затраты выросли, а между алгоритмами ранжирования в реальном времени и слоями обучения на последовательностях возникли системные конфликты.
Чтобы обойти эти ограничения, инженерная команда Meta перешла на сквозное обучение на последовательностях (end-to-end sequence learning), напрямую моделируя хронологию и тайминг действий пользователя в различных сервисах, лентах и рекламных форматах. Вместо агрегирования пользовательского поведения в статичные снимки система представляет историю взаимодействий как непрерывный временной ряд. Новая архитектура, интегрированная в модель Generative Ads Recommendation Model (GEM), нацелена на достижение предсказуемых законов масштабирования, при которых рост вычислительных мощностей напрямую конвертируется в увеличение целевых действий.
Разделение офлайн-моделирования и онлайн-ранжирования
Главная инженерная дилемма коммерческого ранжирования рекламы — задержка вывода (inference latency). Промышленные системы обязаны отбирать и сортировать тысячи объявлений за считанные миллисекунды под колоссальной нагрузкой. Прямой запуск глубоких трансформеров для анализа тысяч токенов пользовательской истории прямо в момент выдачи нарушает лимиты по времени отклика и резко раздувает расходы на инфраструктуру. Meta решает эту проблему разделением процесса на два этапа: тяжелая асинхронная генерация последовательностей на верхнем уровне отделена от легковесного ранжирования на нижнем.
Верхний уровень работает офлайн, используя глубокие многослойные трансформеры для обработки цепочек из тысяч действий пользователя. Строго изолируя профиль пользователя от характеристик конкретных рекламных объявлений, этот офлайн-конвейер заранее рассчитывает и кэширует многомерные представления пользователей в промышленных масштабах.
Разделение модели последовательностей на два взаимодополняющих этапа — офлайн-моделирование пользователей и онлайн-ранжирование — позволяет наращивать емкость модели так, чтобы качество стабильно росло без пропорционального раздувания серверных мощностей.
Нижний уровень функционирует в режиме онлайн и оптимизирован исключительно под минимальную задержку. Он объединяет кэшированные векторные представления пользователя с текущими сигналами намерений и данными объявлений-кандидатов, формируя финальный список в рамках жестких временных рамок. Перенос тяжелых операций трансформера в асинхронные пайплайны позволяет команде наращивать глубину модели и длину контекста по законам LLM без перегрузки боевой инфраструктуры выдачи.
Плотная токенизация и внимание с учетом цели
Помимо разделения архитектуры, Meta заменила ручную подготовку признаков автоматизированными механизмами репрезентации данных. Инженеры внедрили плотную токенизацию (dense tokenization), объединив разреженные сущности и непрерывные поведенческие потоки в единый словарь. Встроенные механизмы внимания самостоятельно определяют сложные взаимосвязи признаков, избавляя разработчиков от необходимости настраивать их вручную.
Чтобы расчет скоринга кандидатов оставался вычислительно эффективным при выдаче, плотную токенизацию объединили с вниманием с учетом цели (target-aware attention). Этот слой сопоставляет токены долгосрочного поведения с конкретными рекламными целями на финальной стадии ранжирования. Производственные тесты Meta подтвердили коммерческую отдачу изменений: конверсии в Instagram выросли на 6%, в Facebook — на 3%, а кликабельность рекламы (CTR) в Facebook увеличилась на 3,5%.
Разделив ресурсоемкое моделирование последовательностей и доставку контента в реальном времени, Meta создала рабочий шаблон для масштабирования высоконагруженных рекомендательных платформ. Эпоха ручного отбора признаков уходит в прошлое — ее сменяют архитектуры, ориентированные на последовательности и способные напрямую превращать сырые вычислительные мощности в измеримый бизнес-результат.