Стандартный семантический RAG терпит полный крах при корпоративной финансовой сверке: точность анализа первопричин (Root-Cause Analysis) по 16 классам составляет всего 2,05%. Новый бенчмарк FinRCA-Bench, созданный исследователем Пратиком Гавате, наглядно объясняет, почему внедрение типовых языковых моделей в бэк-офисный аудит ведет к скрытым сбоям: финансовые сущности связаны строгой транзакционной логикой и структурой главной книги, а не поверхностным текстовым сходством.
В ходе оценки 2250 сценариев сверки кредиторской задолженности с банковскими выписками по 14 операционным таблицам исследователи разделили ошибки поиска данных и ошибки логического вывода. Замороженные плотные семантические ретриверы показали катастрофическую полноту выборки обязательных записей (macro required-record recall) — всего 0,83%. Переход на типизированный поиск по графу происхождения данных (Typed Provenance Graph Retrieval, TPGR) — обход графа с запретом по умолчанию, следующий за сохраненными связями транзакций — поднял точность до 72,44%, а полноту до 77,70%, сократив объем исходных токенов с 5531 до 2370. Тем не менее классическое машинное обучение и детерминированные пайплайны на базе SQL и правил по-прежнему превзошли стек на базе LLM, показав точность 95,44% и 84,97% соответственно.
Бенчмарк показал, что сбои структурного извлечения данных происходят значительно чаще логических ошибок рассуждения — в соотношении 95 к 15. Что еще важнее для финансовых директоров и технических лидеров, результаты исследования предостерегают от слепой автоматизации: в 254 случаях модель выдала верный диагноз при неполном извлечении доказательств, а строгая точность подтвержденных цепочек доказательств упала до 5,72%. На практике языковые модели часто случайно угадывают бухгалтерскую проблему, одновременно галлюцинируя или опуская проверяемый аудиторский след транзакций, необходимый для ее подтверждения.