В крупную компанию ежедневно приходят десятки тысяч документов: счета, акты, накладные, договоры и проектная документация. Чтобы автоматически распределять их по отделам, входящий поток векторизуют и определяют тему по расстоянию до центров классов. Попытка выбрать архитектуру по таблицам лидеров быстро разбивается о суровую реальность: в тесте 13 вариантов векторизации для маршрутизации корпоративной почты эталоном выступила ручная разметка 4695 документов по 11 темам, выполненная экспертами компании. На базовом синтетическом тесте giga_480m и qwen3e_4b ожидаемо разделили верхнюю строчку с результатом 76,8%. Но на этом магия бенчмарков закончилась.

Ловушка повторяющихся шаблонов

Первая же проверка на устойчивость вскрыла банальную проблему: из-за однотипных счетов и типовых бланков из 4695 документов независимыми оригиналами оказались всего 1162 — жалкие 25% выборки. Стандартный алгоритм тестирования честно исключал проверяемый документ, но оставлял в базе его полные копии. В итоге нейросеть не извлекала семантический смысл, а тривиально находила визуального близнеца.

«Группировка документов по тексту (без участия эмбеддингов, чтобы не подыгрывать никому) показала: из 4695 документов независимых лишь 1162 — 25 %».

Зачистка дубликатов мгновенно обвалила точность всех участников на 6–16 процентных пунктов, опустив реальный диапазон качества до 45–70%. Хваленый лидер qwen3e_4b рухнул сразу на четвертое место — модель просто паразитировала на повторах. Классический символьный TF-IDF на выборке с дублями выдавал 67,8%, а на очищенных текстах просел до 50,7%, потеряв 17 пунктов.

Правило классификации меняет лидера

Второй этап вскрыл несостоятельность примитивной геометрии: исходные 11 тем на практике дробились на 95 внутренних подгрупп, из-за чего единый усредненный центр темы терял всякий физический смысл. Инженеры заменили расчет евклидова расстояния простой обучаемой надстройкой поверх тех же векторов, не дообучая сами трансформеры. Это элементарное решение добавило участникам от 7 до 34 процентных пунктов точности. Прежний флагман giga_480m позорно съехал на седьмое место, а верхушку таблицы захватили легкие символьные методы, не требующие закупки дорогостоящих GPU-кластеров.

Финальный аудит похоронил популярный индекс кластеризации ARI. Разброс значений метрики для одной и той же модели из-за случайной инициализации алгоритма оказался сопоставим с разницей между всеми участниками теста. Полагаться на него при выборе архитектуры в проде попросту нельзя. Без ручной человеческой разметки и жесткого стресс-тестирования на специфичных данных бизнес рискует спустить бюджет на тяжелые нейросети там, где эффективнее сработает базовая математика.

Машинное обучениеRAG и векторный поискПроизводительностьИИ в бизнесе