Академические бенчмарки для генерации SQL по текстовым запросам годами оптимизировались под чистые плоские реляционные таблицы, которые совершенно не похожи на реальные корпоративные базы данных. На практике современные учетные системы работают скорее как графовые полуструктурированные хранилища с полиморфными связями, многоуровневой вложенностью и типизированными массивами. Когда стандартные модели Text-to-SQL сталкиваются с такими схемами, они терпят неудачу. Исследователи из Техасского университета в Остине и DevRev выявили этот разрыв, показав, как базовые алгоритмы дают сбой, стоит структуре данных отойти от примитивных реляционных допущений.

Разрыв между бенчмарками и реальностью бизнеса

Стандартные тестовые наборы систематически скрывают производственные проблемы, тестируя алгоритмы на плоских схемах с базовыми типами данных. Например, Spider 2.0-Snow охватывает 7860 таблиц в 152 базах данных, но каждая таблица опирается строго на примитивные DDL-определения. Хуже того, лишь 5% таблиц содержат описания, а обработка вложенных типов в запросах практически отсутствует.

Чтобы получить честную оценку, исследователи разработали DevRev NL2SQL — набор из 900 верифицированных запросов, ориентированных на вложенные типы и графовые структуры связей.

«Во-первых, мы представляем бенчмарк DevRev NL2SQL: 900 верифицированных запросов с вложенными типами и графовой структурой связей, а также метрику Semantic Depth Score (SDS) — независимый от схемы способ оценки глубины аналитических рассуждений».

Вместе с датасетом команда представила показатель Semantic Depth Score (SDS), позволяющий количественно измерить глубину аналитического мышления модели в корпоративных сценариях независимо от особенностей схемы.

Маршрутизация одной генерации и точечное исправление

Вместо перерасхода вычислений на ресурсоемкий консенсус среди множества вариантов — неприемлемый для корпоративных систем с требованиями к низким задержкам — архитектура использует экономичный подход с одной генерацией. Движок полагается на динамическое извлечение метаданных и итеративную очистку контекста схемы перед отправкой запроса в контекстное окно модели.

При возникновении ошибок исполнения пайплайн не использует абстрактные промпты для повторных попыток, а задействует детерминированную модель ошибок. Она переводит сбои во время выполнения в точечные директивы по исправлению: устраняет ошибки латерального разворачивания, неоднозначные псевдонимы и некорректное приведение типов для вложенных атрибутов.

На тестах DevRev NL2SQL такой агент с одной генерацией показал 91,7% точности ответов, опередив ближайший базовый аналог на 54,6 процентных пункта и одновременно снизив расходы на токены.

Решение проблемы корпоративного SQL не требует бездумного сжигания токенов через мажоритарное голосование. Бизнесу нужна интеллектуальная фильтрация контекста схемы и точечное исправление ошибок. Насколько этот подход переносим за пределы синтаксиса Snowflake — открытый инженерный вопрос, но для корпоративных дата-команд он доказывает: адресная маршрутизация метаданных превосходит грубую вычислительную силу LLM и по точности, и по затратам на инфраструктуру.

ИИ-агентыБольшие языковые моделиСнижение затратИИ в бизнесеАвтоматизация