Технология генерации с дополненной выборкой (RAG) стала стандартом для привязки больших языковых моделей к корпоративным базам знаний. Тем не менее нейросети продолжают регулярно выдавать грамматически выверенные ответы, которые прямо противоречат исходным документам. Традиционные контуры валидации борются с этой проблемой с помощью генерации нескольких вариантов ответа или запуска тяжелых моделей-оценщиков (LLM-as-a-judge), что приводит к неприемлемым задержкам и раздувает расходы на вычислительные мощности.

Исследователи из Сколтеха и Центра прикладного искусственного интеллекта Сбера представили фреймворк TOHA (TOpology-based HAllucination detector) на 64-й ежегодной конференции Ассоциации компьютерной лингвистики (ACL). Вместо того чтобы воспринимать базовую модель как черный ящик, требующий внешнего контроля, метод выявляет недостоверный текст путем анализа топологической геометрии внутренних механизмов внимания. Алгоритм напрямую отслеживает, как именно информация перемещается между исходным запросом и сгенерированным ответом.

Измеряя топологическую характеристику MTop-Div, алгоритм вычисляет структурное расхождение между подграфами найденного контекста и сгенерированных токенов. В определенных головах внимания повышенное расхождение систематически указывает на контекстуальные галлюцинации. Это позволяет инженерам проверять достоверность вывода внутри самой модели без отправки вторичных API-запросов.

Как отметил соавтор работы Алексей Зайцев, доцент Сколтеха и руководитель совместной лаборатории Сколтеха и Сбера (LARSS), извлечение этих внутренних топологических сигналов позволяет полностью отказаться от ресурсоемких внешних проверок на этапе генерации в реальном времени.

Вычислительная эффективность и юнит-экономика для бизнеса

В отличие от классических детекторов галлюцинаций, требующих обучения отдельных моделей-классификаторов на массивных размеченных датасетах, TOHA использует легкую процедуру калибровки. Инженерам достаточно минимального набора размеченных примеров, чтобы определить головы внимания с наиболее сильным структурным сигналом. После этого выбранные головы контролируют точность генерации в продакшене с минимальными накладными расходами.

Авторы протестировали фреймворк на бенчмарках вопросно-ответных систем и суммаризации текстов, подтвердив показатели точности на уровне существующих решений или выше них. В частности, TOHA показал такую же точность, как популярный алгоритм SelfCheckGPT, но полностью избавил систему от необходимости многократно генерировать и сравнивать между собой альтернативные ответы.

Для корпоративных контуров в банковском секторе, страховании и юриспруденции математическая верификация через топологию внимания обеспечивает прямое снижение затрат на инференс. При этом техническим лидерам важно учитывать эксплуатационные ограничения: поскольку конфигурация привязана к калибровке голов внимания под конкретную архитектуру, остается открытым вопрос о том, насколько надежно эти паттерны переносятся при обновлении базовых моделей и сохраняется ли предсказательная сила графов при обработке сверхдлинных документов в тысячи токенов.

RAG и векторный поискБольшие языковые моделиСнижение затратИИ в бизнесеИскусственный интеллект