По мере внедрения агентных архитектур в промышленную эксплуатацию трейсы выполнения стали главным источником объективных операционных данных. Однако извлечение реального сигнала из этого колоссального потока создает серьезное узкое место: платформы вроде LangSmith ежедневно обрабатывают миллиарды токенов, а валидация масштабных многошаговых диалогов через проприетарные флагманские модели моментально истощает бюджет. Концепция «LLM-as-a-judge» никогда не была экономически жизнеспособной при масштабировании на базе закрытых API.

Экономика непрерывной оценки

Чтобы избавиться от зависимости от дорогостоящих вызовов флагманских моделей без потери качества оценки, LangChain в партнерстве с провайдером инференса Fireworks развернула специализированный оценщик на базе открытых весов. Команда дообучила базовый чекпоинт Qwen под конкретную операционную метрику — «Осознаваемая ошибка» (Perceived Error). Вместо работы с размытыми критериями вроде субъективной тональности или абсолютной истины метрика фиксирует явные моменты, когда пользователь указал на сбой: отклонил действия агента, повторил запрос или спровоцировал извинения ассистента.

«Мы дообучили модель Qwen для выявления осознаваемых ошибок в каждом производственном трейсе. Она не уступает флагманским моделям или даже превосходит их, обходясь при этом до 100 раз дешевле».

За счет исполнения целевого промпта, выдающего структурированные булевы флаги и краткие обоснования, эта дистиллированная модель обеспечивает точность флагманского уровня при снижении расходов на инференс почти в 100 раз.

Архитектура датасета и перенос домена

Пайплайн обучения использовал производственные данные двух совершенно разных внутренних систем: бота с ответами по технической документации и no-code исследовательского агента Fleet. Выделение многошаговых траекторий, в которых циклы обратной связи от человека дают мгновенную разметку, позволило модели эффективно обобщать опыт на принципиально разные домены агентов.

Этот сдвиг полностью меняет экономику наблюдаемости для B2B-разработки. Сплошной 100%-й аудит трейсов больше не является финансовой обузой, доступной только для небольших выборок: благодаря дистилляции специализированных открытых моделей он становится доступным базовым стандартом.

ИИ-агентыСнижение затратДообучение моделейОпенсорс ИИБольшие языковые модели