Разница между счетом на $2000 и суммой в 70 раз меньшей — это не просто погрешность, а цена избыточного интеллекта, который бизнес по привычке закупает оптом. Мы продолжаем выписывать «профессора» там, где нужно просто перекладывать бумажки. Кейс JobPath наглядно доказывает: эпоха слепого поклонения топовым моделям заканчивается ровно в тот момент, когда проект выходит за рамки прототипа и сталкивается с суровым OPEX. Когда обработка одной вакансии обходится в $0.0485, это кажется мелочью, но при масштабировании каталога цифра превращается в дыру в бюджете, которую не оправдать никаким качеством генерации.

Команда проекта наступила на классические грабли раннего запуска: на старте вы берете Claude Sonnet, потому что она «просто работает», не задает лишних вопросов и выдает чистый JSON на вменяемом русском. Это отличная стратегия для проверки гипотез, но «потом» наступает мгновенно. Как только продукт находит рынок, аппетиты API начинают расти быстрее, чем выручка. В JobPath решились на радикальный эксперимент: заменить элитарную модель на решение в десятки раз дешевле, сознательно согласившись на просадку качества.

Математика перехода строилась на прагматичном расчете. По внутренней шкале, где эталоном выступал Claude Opus с оценкой 4.8, топовая Sonnet выдавала 4.48. Переход на бюджетную альтернативу уронил показатель до 4.06. С точки зрения перфекциониста — катастрофа, с точки зрения здравого смысла — блестящая сделка. Вы теряете в точности, но перестаете платить за эрудицию там, где требуется только дисциплина. В определенный момент «ошибки в полях» становятся банально дешевле, чем счета от Anthropic.

Но у дешевизны есть цена, которую часто забывают включить в смету. Если Sonnet понимает задачу с полуслова, то модели вроде Deepseek или Qwen склонны к тихому саботажу. В ходе тестов выяснилось: у бюджетных решений ломается не интеллект, а исполнительность. Они могут упорно игнорировать JSON-схему, возвращая списки строкой вместо массива, или путать годовые зарплаты с месячными. В JobPath столкнулись с тем, что Qwen 3 (235B), несмотря на неплохой русский язык, в половине случаев просто «не видела» цифры в тексте.

Чтобы заставить «глупую» модель работать, разработчикам пришлось выстроить вокруг нее пояс инфраструктурных костылей: валидаторы полей, обработчики пустых ответов и сложные схемы повторных запросов (retries). Оказалось, что агрегаторы вроде OpenRouter могут отдавать код 200 при абсолютно пустом теле ответа. Без жесткой проверки на уровне бизнес-логики такой «успех» просто ломает пайплайн. Одна некорректная вакансия, где вместо объекта пришла строка, способна убить батч и остановить обработку всего каталога.

Самым болезненным уроком стала хрупкость биллинга. Ошибка в цикле обработки стоила команде 16 000 вызовов, впустую сожженных за одну ночь. В дешевых API цена ошибки невелика, но отсутствие мониторинга способно обнулить всю экономию за несколько часов. Тем не менее, даже с учетом затрат на написание «оберток», итоговая экономика остается на стороне даунгрейда. Вердикт прост: если ваша задача — массовая нормализация данных, вам не нужен поэт. Вам нужен дисциплинированный стажер под присмотром жесткого надсмотрщика-валидатора.

Проведите ревизию ваших AI-задач. Сэкономленные на замене топовых API ресурсы лучше направить на создание систем автоматической проверки, чем на оплату интеллекта, который вам объективно не по карману.

ИИ в бизнесеСнижение затратБольшие языковые моделиAnthropicJobPath