Попытка автоматизировать найм обычным векторным поиском регулярно разбивается о суровую реальность: модель с радостью предлагает сильного senior-разработчика на роль enterprise-архитектора только потому, что их резюме напичканы одинаковыми ключевыми словами. Эмбеддинги отлично улавливают абстрактное сходство текстов, но напрочь слепы к реальному сеньорити, масштабу проектов и роли кандидата. В benchmark-тесте платформы подбора ИТ-специалистов на датасете из 476 пар «резюме — вакансия» чистый векторный поиск показал удручающую точность в топ-10 — всего 43,7%.
Решение проблемы — переход на двухэтапный пайплайн с привлечением LLM в роли беспристрастного судьи. Инженеры перестроили ранжирование: первичный векторный фильтр отсекает явный нерелевант, а за переранжирование отвечает языковая модель с жестким структурированным чек-листом. Судья оценивает кандидата по фактической роли, зоне ответственности и стеку, возвращая строгий JSON. Главный предохранитель от галлюцинаций — требование валидации: модель обязана подтверждать каждый пункт требований дословной цитатой из резюме длиной до 200 символов. Нет прямой цитаты — статус соответствия немедленно снижается.
Результат двухэтапной схемы — рост строгой точности топ-10 до 66,3%. Что особенно важно для юнит-экономики, тесты на четырех моделях показали: компактная gpt-4.1-mini выдает качество на уровне флагманской gpt-4o, обходясь бизнесу в пять раз дешевле. Дорогостоящий инференс тяжелых рассуждающих сеток здесь попросту не нужен: качественный B2B-скоринг строится на архитектуре жестких ограничений и верификации фактов, а не на сжигании бюджета в гигантских контекстных окнах.