Пользователь в поисковой выдаче рассчитывает получить емкую выжимку за считаные миллисекунды даже в моменты пиковых нагрузок. Чтобы генеративный блок не ложился под наплывом запросов, инженерам приходится радикально перекраивать весь вычислительный пайплайн. В июньском релизе команда Alice AI Search раскрыла внутреннее устройство своей поисковой модели и выложила базовые веса в открытый доступ.
Быстрый ответ строится на той же инфраструктуре, что и диалог с Алисой. Сначала система агрегирует данные через стандартные каналы поиска, после чего массив документов отправляется на первичную фильтрацию. Задача этого промежуточного слоя — безжалостно отсечь лишний шум и собрать компактный инфоконтекст, который затем передается генеративной сети.
Оптимизация инфоконтекста
Каждый лишний токен в контексте напрямую раздувает аппаратные расходы и увеличивает задержку ответа. Чтобы решить проблему избыточных вычислений, полгода назад в Яндексе запустили направление Agentic Search с прицелом на поисковые технологии для семейства Alice AI.
Фильтрацию текстов поручили отдельной BERT-подобной модели на 80 млн параметров, обученной с нуля на 4 трлн токенов из поискового корпуса. Чтобы научить ее оценивать полезность каждого токена, разметку собрали с помощью открытых LLM. Это дало базовый cold-start-экстрактор, но для реального продакшена требовался минимально возможный объем текста, нужный именно генеративной сети.
«Для поиска оптимального содержания инфоконтекста для нашей модели мы собрали алгоритм на основе Cross‑Entropy RL»
Модель-экстрактор оценивает вероятность релевантности токенов, формируя предельно сжатый контекст, а генеративная сеть выдает ответ и получает вознаграждение. В результате на вход генератору попадают только критически важные фрагменты, что радикально сокращает задержку без деградации качества.
Открытые веса и закрытый инференс
Яндекс опубликовал обученную с нуля модель Alice AI-T5-35B-A0.6B Base, объединившую классический Encoder-Decoder и разреженную архитектуру MoE: из 35 млрд параметров здесь активно всего 600 млн. Однако оптимизированная среда исполнения осталась внутри компании — внешним инженерам запускать модель предлагается через стандартный Hugging Face Transformers.
Для B2B и ML-команд публикация открытых весов — это готовый фундамент под ультрабыстрые корпоративные поисковые системы и RAG-контуры на русском языке. Но чуда из коробки не произойдет: чтобы получить сравнимую с поисковиком латентность и не разориться на GPU-кластерах, оптимизацию среды исполнения и тонкую настройку пайплайна фильтрации контекста придется собирать собственными силами.