Бизнес привык мерить внедрение языковых моделей гигафлопсами и стоимостью токена, упуская из виду самую уязвимую часть операционного контура — корпоративную память. Когда в 2024 году мэрия Нью-Йорка запустила чат-бота MyCity как цифрового помощника для владельцев малого бизнеса, предполагалось, что автоматизация сократит издержки на консультации. Но на деле бот раздавал советы, за которые предпринимателям грозили штрафы и суды.

Проблема заключалась в том, что актуальные регламенты и устаревшие инструкции лежали в базе знаний на равных правах. Система просто не умела отделять действующие нормы от отмененных, порождая прямые юридические риски из-за слепого доверия к найденным документам. Переводим на язык финансов: дешевый инференс без архитектурных фильтров превращает корпоративный ИИ в генератора убытков.

Анатомия архитектурного сбоя

Классический поиск с дополнением генерации устроен линейно и примитивно. Поисковый модуль находит документы по смысловому сходству, а языковая модель генерирует ответ, опираясь на этот набор данных как на абсолютную истину. Положите в базу устаревшую инструкцию и актуальный протокол — для алгоритма они будут одинаково хороши.

Команда из Тяньцзиньского технологического университета перевела эту уязвимость в цифры на бенчмарке TruthfulQA. На TruthfulQA при смешении верных фактов и заблуждений обычный RAG выдает 53% галлюцинаций, в то время как модель без памяти в тех же условиях ошибается в 23% случаев. Доверять поиск текста слепой математике — затея сомнительная.

На TruthfulQA, когда в память агента подмешивают и верные факты, и популярные заблуждения, обычный RAG выдает 53% галлюцинаций.

Между найденным документом и генерацией ответа отсутствует критический барьер верификации. Поиск работает исправно, но никто не задает вопрос о достоверности источника до того, как модель начнет давать юридически обязывающие советы.

Контроллер доверия вместо слепого поиска

Инженеры ищут выход в создании многоуровневых слоев принятия решений, вдохновленных нейробиологией. На архитектуру решения авторов подтолкнула работа нейробиологов, изучавших префронтальную кору макак-резусов, где сигналы о надежности и рисках обрабатываются независимо.

Принцип перенесли в код под названием MDL, разделив оценку на релевантность, надежность и риск задачи через QR-декомпозицию. Вопросы из медицины, права, финансов и конспирологии автоматически получают коэффициент риска от 0,70 и выше.

Техническая сложность напрямую влияет на финансовую устойчивость внедрения. Там, где воспоминания конфликтуют, контроллер MDL выдает заметно меньше ошибок против 53% у обычного RAG. Контроллер дает реальный выигрыш, в то время как стандартный RAG без защиты плодит галлюцинации.

Дешевая память ИИ-агентов без архитектурных фильтров доверия создает скрытую финансовую нагрузку в виде судебных рисков и штрафов. Рынок постепенно переходит от слепого наращивания базы знаний к жесткой проверке источников, так как экономия на контроллерах риска обходится дороже любого инференса.

Большие языковые моделиИИ-агентыRAG и векторный поискБезопасность ИИ