После очередного обновления тарифов DeepSeek по профильным чатам прокатилась волна паники: заголовки пестрели цифрами «+1100%» и кратным ростом цен в 12,1 раза. Руководители и технические директора тут же бросились пересчитывать бюджеты, готовясь к многократному раздуванию счетов за инференс. Однако если взять реальный профиль корпоративной нагрузки и аккуратно свести математику, итоговый множитель затрат составит от 2,3 до 2,9 раза, но никак не одиннадцать.

Команда DeepSeek перевела тарификацию с плоской шкалы на двухуровневую 16 августа в 16:00 UTC. Теперь пиковый тариф ровно в два раза дороже непикового, без промежуточных градаций. Нашумевший скачок в 12,1 раза существует исключительно в одной строке прайса из шести — для кешированного входа модели Pro, где цена номинально поднялась с 0,003625 до 0,044 доллара за миллион токенов.

Анатомия одной ячейки прайса

Цифра 0,003625 держалась с 26 апреля, когда провайдер временно срезал стоимость попаданий в кеш в 10 раз. До этой промо-акции кешированный вход на Pro обходился в 0,03625 доллара, так что нынешний пиковый тариф представляет собой прирост всего на 21% к базовой весенней цене. На тарифе Flash кеш до сих пор стоит вдвое дешевле стартового уровня, поэтому громкие заголовки про двенадцатикратное подорожание лишь фиксируют откат временной скидки в самой копеечной строке.

В структуре реального корпоративного счета эта позиция почти ничего не весит, поскольку кешированный вход изначально обходился в микроскопические суммы.

Доля кешированного входа у чат-ассистента выросла с 0,59% до 2,04% счета, а в сценариях RAG поднялась с 2,79% до 9,71%, что делает невозможным общий рост затрат в 12 раз.

Остальные пять строк прайса подорожали в 3,0–5,0 раза в пиковые часы и в 1,5–2,4 раза вне пика — именно они и формируют основное тело расходов. Чтобы получить на практике рост счета в 12 раз, входящие запросы должны состоять почти целиком из попаданий в кеш при длине ответа ровно в один токен. В реальной промышленной эксплуатации таких синтетических сценариев попросту не существует.

Китайский обед и московские тайминги

Вторая часть управленческого уравнения кроется в географии пиковых окон, которые разработчики зафиксировали в документации: с 01:00 до 04:00 и с 06:00 до 10:00 UTC. Два раздельных окна выглядят странно лишь до тех пор, пока мы не переведем время в часовой пояс Пекина (UTC+8). В местном расписании они превращаются в стандартные интервалы 09:00–12:00 и 14:00–18:00, а двухчасовая пауза между ними оказывается обычным обеденным перерывом китайских офисов.

DeepSeek настроил сетку под собственный домашний трафик, а остальной мир получил это расписание без локальной адаптации. Для московского часового пояса (UTC+3) картина складывается парадоксально выгодно: ночное окно с 04:00 до 07:00 МСК задевает только фоновые скрипты, а дневное приходится на отрезок с 09:00 до 13:00 МСК.

При стандартном рабочем графике с 10:00 до 19:00 под дорогой тариф попадают ровно три часа — с 10:00 до 13:00. Ровно в 13:00 открывается непрерывный 15-часовой льготный интервал, который длится до 04:00 следующего дня и перекрывает весь остаток рабочего дня, вечер и ночь.

Перенос запуска пакетных вычислений и фоновой обработки в планировщике задач всего на пять минут после часа дня (13:05) возвращает расходы к минимальной планке. Вместо панического роста на 1100% бизнес получает увеличение бюджета в умеренные 2,3–2,9 раза — при условии, что технический менеджмент умеет настраивать очереди и понимает расписание китайских обедов.

Большие языковые моделиИИ в бизнесеСнижение затратRAG и векторный поискDeepSeek