Попытка переложить весь поток поисковых запросов на тяжелые нейросети быстро разбивается о базовую экономику инфраструктуры и SLA по задержкам. В реальном продакшене поиск остается фундаментом клиентского пути: лишние полсекунды ожидания ответа гарантированно срезают конверсию. Как объяснил лид отдела семантики сервиса Профи.ру Дмитрий, их поисковая система решает три прикладные задачи: определяет нужную услугу, ищет профиль конкретного мастера либо отсекает запросы на работы, которые платформа не выполняет.
Архитектурный каркас для таких объемов неизменно строят вокруг классических лексических движков. В Профи.ру основным источником данных выступает Elasticsearch, а поисковый индекс контент-менеджеры обновляют раз в сутки через внутреннюю панель управления. Надежная фильтрация и точные совпадения остаются на стороне проверенной базы.
Жесткие рамки задержек и мониторинг
Требования к качеству выдачи напрямую диктуют архитектурные ограничения. Команда сервиса держит жесткую планку: свыше 90% выборов клиентов должны приходиться строго на первые пять позиций выдачи.
«В пике он обрабатывает около 150 тысяч запросов в час, то есть чуть более 60 запросов в секунду».
Поведение аудитории и экономия ресурсов
Прогонять каждый типовой и высокочастотный запрос через большую языковую модель — верный способ бессмысленно сжечь вычислительные бюджеты на инференс. Семантический разбор на базе LLM оправдан только на сложных, редких и неструктурированных запросах длинного хвоста.
Прагматичный урок для CTO и продактов прост: языковая модель в зрелом энтерпрайзе работает исключительно как надстройка над лексическим поисковиком, а не его замена. Когда в пиковый час система принимает 150 тысяч запросов, предсказуемая задержка и стабильный SLA оказываются важнее любых генеративных трюков.