Попытки автоматизировать сертификацию LEED v4.1 BD+C с помощью универсальных облачных моделей наталкиваются на суровую реальность: нейросети катастрофически не справляются с арифметикой. Аритро Де и Джулиана Фелкнер из Техасского университета в Остине в своем свежем исследовании подтверждают: чистые LLM в задачах с высокими ставками — это риск, а не решение. Исследователи внедрили в конвейер детерминированную проверку чисел, создав нейросимволическую архитектуру, где жесткая логика исправляет «галлюцинации» нейросети. Результат впечатляет: точность в критическом пункте EA-p2 подскочила с позорных 50% до безупречных 100%.
Этот кейс наглядно демонстрирует смерть догмы «больше — значит лучше». Тесты на реальной документации четырех университетских зданий показали, что малая модель gemma3 на 4 млрд параметров обходит восьмимиллиардную llama3.1 в специфических задачах скрининга LEED. Секрет не в количестве весов, а в качестве промпт-инжиниринга и агентном поиске (RAG) с учетом структуры конкретных разделов документации. Для индустрии, помешанной на конфиденциальности, это отличная новость: локальные малые языковые модели не только точнее, но и полностью исключают утечку данных в облака Big Tech.
Главное в исследовании
Чистые нейросети проваливают арифметические проверки в 50% случаев, что делает их непригодными для комплаенса без внешней логики. Малые локальные модели (SLM) превосходят более крупные аналоги при правильной настройке RAG и структуры данных. Мультимодальность снижает эффективность системы при работе с техническими чертежами низкого разрешения.
«Попытка заставить систему «смотреть» на чертежи сделала ее глупее, чем если бы она просто читала сухой текст».
Однако мультимодальность — главная маркетинговая приманка года — на практике оказалась ловушкой. Анализ показал, что добавление в модель чертежей в низком разрешении (150–300 dpi) стабильно снижает общую точность системы. Вместо того чтобы «видеть» суть, модели захлебываются в некорректно извлеченных цифрах и визуальном шуме. Даже при общей точность нейросимволического метода в 61,6%, он местами уступал чисто текстовым подходам именно из-за сбоев при обработке изображений.
Индустриальные лидеры годами обещали, что ИИ будет без труда «читать» сложные чертежи и PDF-отчеты для автоматизации ESG-аудита. Реальность оказалась ироничнее: бизнесу пора перестать гнаться за «всеядными» моделями и сосредоточиться на гигиене входных данных. Без чистого датасета и жесткой математической надстройки над нейросетью никакой «интеллект» не пройдет даже базовый комплаенс.