Современные конвейеры потокового инференса зажаты в тисках между скоростью и глубиной анализа. С одной стороны — легковесные модели, обеспечивающие субсекундную задержку в промышленных сетях; с другой — тяжелые LLM, чье «рассуждение» обходится на два-четыре порядка дороже. Чжаохуэй Ван из Инженерной школы Витерби (USC) справедливо отмечает: индустрии катастрофически не хватает формализма в вопросе, когда именно нужно перекидывать мостик между этими мирами. Исследование Вана предлагает рассматривать вызов LLM как задачу последовательной остановки на основе рисков: дорогой «оракул» включается только тогда, когда накопленный функционал риска потока пробивает заданный порог.

Шесть доказательств оптимального триггера

Исследование формализует единую структуру, где классические алгоритмы вроде SPRT или CUSUM становятся лишь частными случаями единой пороговой политики. Ван приводит шесть ключевых доказательств того, что система останется стабильной в реальном хаосе. Одна из главных проблем таких систем — «дребезг» (chattering), когда триггер срабатывает слишком часто короткими очередями. Работа устанавливает минимальный временной интервал между событиями, купируя этот эффект. С помощью метода гладкого склеивания (smooth pasting) подтверждается оптимальность пороговых политик, а для стационарных потоков выводятся границы регрета O(√T log T).

«LLM медленнее и дороже пограничных моделей на несколько порядков. Вызывать их на каждом шаге — финансовое самоубийство, но не вызвать в критический момент — техническая катастрофа».

Для работы с нестационарными данными, где паттерны датчиков постоянно «плывут», фреймворк использует онлайн-градиентный спуск для адаптации порогов. Это позволяет системе менять чувствительность без ручной перекалибровки. Более того, вводится неравенство переноса «калибровка-пропуск» (calibration-to-miss-rate). Оно математически оценивает, во сколько системе обходятся ошибки нейросети в оценке собственной уверенности: излишняя самоуверенность или, наоборот, робость модели теперь имеют конкретную цену в виде пропущенных инцидентов.

Эмпирическая проверка и доминирование по Парето

При тестировании на данных о деградации турбовентиляторных двигателей CMAPSS риск-ориентированный подход сравнивался с шестью базами, включая контекстуальных бандитов и роутеры в духе RouteLLM. Результаты показывают, что функции риска, привязанные к оценке аномалий, доминируют над альтернативами почти на порядок по метрике Pareto AUC. В ходе испытаний на 1600 диагнозах от LLM система достигла высокого уровня семантического заземления: 92,9% ответов получили оценку выше 0,75. Это подтверждает, что алгоритм не просто экономит деньги, отсекая запросы, а ювелирно выбирает моменты, когда когнитивные способности LLM принесут максимальную пользу.

Это исследование дает инженерам математический фундамент, позволяющий уйти от костыльных эвристик «if-then» при внедрении генеративного AI в продакшен. Рассматривая LLM как ограниченный ресурс, активируемый калиброванным риском, компании могут внедрять высокоточный мониторинг без риска разориться на API-запросах. Однако эффективность схемы по-прежнему завязана на качестве оценки неопределенности «быстрой» моделью. Если пограничная модель плохо откалибрована, она либо разорит вас ложными вызовами, либо промолчит, когда оборудование начнет разваливаться.

Большие языковые моделиСнижение затратПроизводительностьМашинное обучение