Яндекс выложил в открытый доступ базовую претрейн-модель Alice AI-T5-35B-A0.6B, которая отвечает за генерацию быстрых ответов в Поиске. Как рассказал технический директор Alice AI Search Артур Петросян на конференции Practical ML Conf, ставка была сделана на решение сугубо прикладных задач с жесткими требованиями к миллисекундным задержкам.
Ставка на забытую архитектуру
В основе новой системы лежит комбинация архитектур Encoder-Decoder и Mixture of Experts (MoE). Подобные гибридные схемы почти не появлялись на рынке с периода 2021–2023 годов, поэтому выбор такого подхода выглядел рискованным инженерным решением. Логика здесь прагматичная: энкодер за один проход считывает тяжелый контекст документов, а компактный декодер оперативно выдает короткий текст. Смесь экспертов при этом дает общее качество и объем знаний уровня 35 млрд параметров, удерживая реальные затраты на вычисления в рамках модели на 600 млн активных параметров.
Разработка не обошлась без технических проблем: во время предварительного обучения сколлапсировал роутинг в энкодере, из-за чего инженерам пришлось полностью сменить схему балансировки экспертов.
Смесь экспертов обеспечивает Alice AI-T5 знания уровня 35 млрд параметров при вычислительной нагрузке как у модели на 600 млн параметров, решая задачу обработки длинных документов с минимальной задержкой.
Чтобы сократить нагрузку на декодер и не прогонять через языковую модель избыточные массивы текстов, команда дополнительно создала легкую модель сжатия контекста. Для этого с нуля обучили маленькую BERT-подобную сетку на 80 млн параметров, которая определяет релевантность каждого токена запросу пользователя. Метод Cross-Entropy RL превращает её в экстрактор, оставляющий лишь недостающие факты.
Продуктовые метрики
На этапах тонкой донастройки SFT и обучения с подкреплением RLHF разработчики полностью отказались от эталонных ответов, написанных редакторами. Система отбирала лучшие варианты автоматически из пула генераций различных моделей по внутренним сигналам качества, а в рамках RL модель дообучали на реальном поведении пользователей сервиса.
Такой пайплайн дал измеримый бизнес-результат: внедрение системы добавило +0.34% к продуктовой метрике Sessions Per User. Кроме того, в слепых попарных сравнениях Alice AI-T5 в 56.7% случаев побеждает Google AI Overview.
Повторить эту экономику инференса на чужих открытых весах без аналогичного пайплайна сжатия контекста и пользовательских сигналов другим игрокам будет крайне затруднительно.