Классический RAG регулярно спотыкается там, где ответ распределен по разным источникам и требует многозвенной логики (multi-hop reasoning). Типичный кейс из корпоративной практики: определить, кто имеет право согласовать возврат клиенту на 800 фунтов в марте. Данные для корректного решения разбросаны между инструкциями, штатным расписанием и рабочей перепиской.

Прямой семантический поиск по эмбеддингам здесь неизбежно проваливается: он находит похожие по суммам регламенты командировочных расходов, но теряет логическую цепочку. Модели требуется сначала установить должностные полномочия по регламенту, затем проверить рабочий график сотрудника в переписке и через кадровую базу определить временно исполняющего обязанности. Векторный поиск эти связи игнорирует, поскольку прямых текстовых совпадений между несвязанными фрагментами нет.

Структура графа вместо слепого поиска

Инженерный выход — перенести логику связей на этап подготовки данных. В техническом эксперименте связывание сущностей через графовую структуру позволило сформировать детерминированный запрос на 400 токенов, отрабатывающий строго до обращения к нейросети.

«код этот является детерминированным запросом на 400 токенов, который выполняется ДО того, как осуществляется вызов модели.»

Когда граф отдает в контекст готовые связи между сущностями, скромный объем параметров компактных открытых сетей перестает быть ограничением. Модели больше не нужно вслепую блуждать по десяткам слабосвязанных документов и собирать ложные совпадения.

Тестирование на локальном оборудовании

Проверку гипотезы провели на потребительском железе без обращения к проприетарным облачным API. В бенчмарке участвовали четыре модели: GPT-OSS-20b в квантизации mxfp4, gemma-4-e2b на 8 бит, llama-3.1-8b на 4 бит и xLAM-2-8b на 8 бит. На рабочей станции с видеокартой Nvidia RTX 4070 Ti Super 16Gb модель GPT-OSS-20b показала скорость генерации около 200 токенов в секунду. При стандартном векторном поиске без подготовленного графа архитектуры теряли контекст: xLAM-2-8b от Salesforce и вовсе сгаллюцинировала несуществующее имя файла.

Результаты и метрики выборки

Без предварительно построенного графа знаний ни одна из протестированных моделей не смогла дать корректный ответ из-за обилия документов-ловушек. С графовой структурой выборки все участники теста, включая компактную Gemma-4 на 2 млрд параметров, решили задачу без ошибок.

Для бизнеса этот компромисс прозрачен: разовые вычислительные затраты на построение и поддержку корпоративного графа знаний окупаются за счет отказа от постоянных дорогостоящих вызовов флагманских облачных LLM. Локальные 2B-модели на собственном контуре берут на себя сложную регламентную аналитику, закрывая вопросы как операционных издержек, так и конфиденциальности данных.

Большие языковые моделиRAG и векторный поискЛокальный ИИСнижение затратАвтоматизация