Универсальные языковые модели обходятся слишком дорого на рутинных шагах автономных агентов. 15 сентября TypeSafe выпустила Jev и назвала её первой моделью класса System One. За 16 дней вышли ещё пять реализаций той же идеи: Clef и Clef-flash от Cloudflare, pplx-decider-v1-27b от Perplexity, Strands Decider 2B от AWS, Laya от Convai Innovations и GLiDE от Fastino. Инфраструктурная тупиковость подхода с генерацией токенов на каждом промежуточном действии агента стала очевидна разработчикам.
Во многих агентных системах LLM вызывается на каждом шаге, хотя на большинстве шагов текст не нужен. Агент выбирает инструмент, проверяет, закончена ли задача, решает, можно ли выполнять команду. Полная генерация на таком шаге стоит дороже и работает медленнее, чем требует выбор, а ответ ещё приходится парсить и проверять на соответствие формату. TypeSafe предложила для этих шагов отдельный быстрый контур и назвала его System One, по аналогии с быстрым интуитивным мышлением, которое Дэниел Канеман назвал Системой 1. Название Jev отсылает к парадоксу Джевонса: чем дешевле ресурс, тем больше его потребляют. Сама Jev стоит 0,042 доллара за миллион входных токенов, TypeSafe заявляет задержку 70–500 мс и контекст 32K токенов. LangChain встроила такую проверку в middleware своей интеграции с Jev.
Архитектурный сдвиг и экономика инференса
В обычной LLM трансформер переводит вход в скрытые состояния, а последний слой, LM head, проецирует вектор последней позиции на словарь из десятков или сотен тысяч токенов. Генерация состоит из двух фаз: prefill читает весь вход за один проход, затем decode добавляет по одному токену за шаг. Decision-модель оставляет только prefill. Вместо проекции на словарь стоит выходной слой, который оценивает допустимые варианты, и softmax по ней. Интерфейс у систем почти общий, а внутри пять разных решений: замороженная LLM с обучаемым выходным слоем, LLM с заменённой LM head, pointer-механизм, энкодер на 322 млн параметров и рассуждение, которое включается по требованию. Cloudflare называет Clef полностью совместимой с API Jev, а Fastino отдаёт GLiDE через тот же эндпоинт /v1/systemone и публикует гайд по миграции с TypeSafe.
У Clef это замороженная Qwen3.8-27B, у Clef-flash Qwen3.5-9B, а весы открыты под Apache 2.0 и запускаются через Transformers, vLLM или SGLang. В Workers AI модели стоят 0,24 и 0,09 доллара за миллион входных токенов при контексте 65 536 токенов. На BANKING77 Clef обходит Jev на 14,5 пункта, а на When2Call, где модель решает, вызывать ли инструмент прямо сейчас, проигрывает 8,6. В препринте на arXiv предлагают поставить Jev и Laya в четыре точки автономного пентест-агента. LangChain сравнила Jev с тремя LLM в роли судьи на 500 оценках ответов агента, показав практическую применимость подхода.
Главное: Рынок переходит от универсальных генеративных моделей к специализированным decision-моделям вроде Jev и Clef, которые обрабатывают запросы без генерации токенов. Это снижает затраты на инференс на промежуточных шагах агентов и задаёт новый стандарт для инфраструктуры корпоративного софта.