Еще в 2023 году, когда компании только начинали создавать агентов — которых тогда в основном называли приложениями на базе больших языковых моделей, — основным методом оценки был код. Позже в том же году исследователи внедрили подход LLM-as-a-judge (оценка с помощью языковой модели), и с тех пор код и языковые модели в роли судей оставались главными инструментами проверки агентов. Программные оценщики проверяют детерминированные условия, такие как вызовы инструментов или совпадения шаблонов, в то время как судьи на базе языковых моделей анализируют свободный текст для оценки логов со значительными затратами и более низкой рабочей скоростью. Теперь, судя по оценке LangSmith, модель Jev доступна в качестве специализированного системного судьи для производственных оценок, напрямую интегрируясь в существующие рабочие процессы.

Модели System One — это класс моделей искусственного интеллекта, созданных для принятия быстрых, структурированных решений, которые программное обеспечение может использовать напрямую. Jev не является традиционной большой языковой моделью и не генерирует текст; вместо этого она функционирует как модель System One, которая оценивает состояние и возвращает типизированные ответы и вероятности без вычислительных затрат на синтаксический анализ неструктурированной прозы.

Параллельная оценка состояний в продакшене

Интегрируя Jev в свой набор инструментов для оценки, LangSmith закрыла очевидный пробел для предприятий, требующих быстрой и дешевой оценки поведения автономных агентов с открытым финалом. Jev способна отвечать на три типа вопросов: функция noul возвращает вероятность да/нет, функция выбора выбирает один вариант из набора, а оценка ранжирует состояние по упорядоченной шкале. Каждый ответ типизируется напрямую, а не генерируется в виде текста, требующего парсинга.

Jev оценивает каждый вопрос в запросе одновременно, поэтому оценка трассировки по нескольким критериям обратной связи, таким как утечка персональных данных, намерения пользователя и раздражение пользователя, происходит за один проход.

Запуск оценок по всему производственному трафику больше не требует пожертвования охватом ради экономии. Команды могут оценивать каждую трассировку вместо выборки и проверять несколько критериев одновременно без раздувания операционных расходов, переводя управление проектами из зоны догадок в предсказуемое выполнение.

Автоматизированная оценка с такой скоростью превращает мониторинг из периодического центра затрат в механизм контроля в реальном времени. Как хорошо знают руководители проектов и технические директора, дешевая структурированная классификация наконец устраняет финансовый барьер, который ранее ограничивал строжное тестирование агентов хорошо финансируемыми исследовательскими лабораториями.

ИИ-агентыСнижение затратИИ в бизнесе