Финансовые институты сталкиваются со строгими регуляторными требованиями к аналитическим моделям, используемым при принятии корпоративных решений. Давние стандарты управления модельными рисками требуют полной прозрачности происхождения данных, исчерпывающей документации и возможности эффективной независимой проверки. Несмотря на высокую языковую связность больших языковых моделей, стандартные системы генерации с дополнением выборкой (RAG) регулярно терпят неудачу в процессах финансового планирования и анализа (FP&A), поскольку их механизмы генерации скрывают источники фактов.
Дефицит аудируемости в стандартном RAG
Независимый исследователь Сергей Лунякин, старший член IEEE, решает этот структурный недостаток в препринте, посвященном оценке фреймворка Knowledge-Driven Analytics Framework. Архитектура призвана сделать ответы языковых моделей проверяемыми по самой своей конструкции через шесть этапов: определение круга целевых вопросов, создание минимально жизнеспособного графа, извлечение данных по схеме, контекстное представление знаний с типизацией релевантности и аннотациями происхождения, гибридная верификация с участием человека и распространение релевантности с учетом контекста для поиска по графу.
Традиционные векторные и лексические поисковые движки работают как индексный поиск: они извлекают изолированные фрагменты без проверки связей между сущностями и часто возвращают отрывки текста, относящиеся к посторонним компаниям.
Когда стандартные поисковые модели передают неструктурированный контекст в LLM, модель синтезирует правдоподобные ответы, маскируя ошибки извлечения и путаницу между сущностями. Чтобы обеспечить строгий надзор, каждый факт, извлеченный аналитическим фреймворком, снабжается явным типом связи, оценкой достоверности и полной цепочкой источников.
Приоритет проверки источников над точностью
Пилотный бенчмарк на 145 вопросах из набора данных FinanceBench наглядно демонстрирует компромиссы структурированного семантического поиска. Базовая генерация без контекста показала точность всего 4,1%, подтверждая необходимость внешнего поиска. Однако среди методов с дополнением выборкой чистая точность ответов осталась статистически неотличимой: разница между Knowledge-Driven Analytics Framework и разреженным поиском BM25 составила всего -0,007 при 95%-м доверительном интервале от -0,021 до 0,000. Это доказывает, что структурированный поиск сам по себе не повышает точность при работе с изолированными финансовыми отчетами.
Реальный операционный разрыв заметен в метриках верификации. Фреймворк Knowledge-Driven Analytics достиг показателя F1 отслеживаемости цитирований на уровне 0,515, опередив необоснованный обход графа на +0,027 (95% ДИ: 0,006–0,050) и превзойдя BM25 на +0,052 (95% ДИ: 0,024–0,083). Кроме того, лексические бейзлайны допускали посторонние данные в 16,8% и 20,2% случаев, тогда как графовые методы не допустили ни одного внешнего элемента среди сотен извлеченных фрагментов, поскольку явные границы сущностей работают как жесткие ограничения поиска.
Что это значит
Результаты экспериментов показывают, что реальная ценность онтологического поиска для бизнеса заключается в строгом контроле источников и соблюдении контекстных границ, а не в банальном приросте точности ответов. Основное ограничение бенчмарка связано с анализом единичных документов, оставляя открытыми вопросы работы со сложными многопериодными реестрами и кросс-аудитом. Корпоративным финансовым аналитикам предстоит сделать выбор: оправдывают ли регуляторные риски высокие начальные затраты на разработку предметных онтологий.