Разговоры о покупке собственного железа для нейросетей возникают в компаниях с завидной регулярностью. Логика проста: счета за API растут, не пора ли купить свою карту и крутить всё локально? В этот момент у энтузиастов загораются глаза, а опытный CTO тянется к калькулятору. Проблема в том, что дорого — это не цифра, а субъективное ощущение. Без точного понимания объема сжигаемых токенов любая дискуссия о закупке GPU превращается в обмен фантазиями. На практике себестоимость одного и того же миллиона токенов на новенькой RTX 5090 колеблется от 1 до 20 726 рублей. Карта та же, модель идентична, а разница в цене — в двадцать тысяч раз. И дело здесь не только в счетах за электричество.
Математика простоя и ловушка VRAM
Давайте препарируем объект желаний — RTX 5090 с 32 ГБ памяти. Эта флагманская карта манит возможностью просто воткнуть и работать. По текущим рыночным оценкам на середину 2026 года, даже базовый вариант обойдется в 429 990 рублей, а топовые версии под заказ легко переваливают за 730 тысяч. Но магия цифр здесь коварна. Инференс — процесс капризный: он упирается в объем и скорость видеопамяти (VRAM) гораздо сильнее, чем в мускулы самого чипа. Попытка запустить тяжелую модель на 5090 напоминает перевозку кирпичей на спорткаре: эффектно, но бессмысленно. К тому же гигабайт памяти на этой модели стоит в 3,5 раза дороже, чем на проверенной временем 3090.
Инференс упирается в объем и скорость видеопамяти куда сильнее, чем в вычислительную мощность чипа. Поэтому сравнивать карты правильнее по цене за гигабайт VRAM, а не по маркетинговому названию поколения.
Считать экономику нужно прагматично, используя две переменные: стоимость часа работы железа и пропускную способность. Собственная карта генерирует убыток в виде фиксированной суммы ежемесячно, независимо от того, нагружена она или покрывается пылью. API же стоит ровно столько, сколько вы потребили. Чтобы железка окупилась, через нее должен идти поток данных, превышающий точку безубыточности. Если карта простаивает — вы просто наблюдаете, как деньги сгорают вместе с амортизацией.
Точка безубыточности и скрытый TCO
При расчете стоимости владения (TCO) многие совершают ошибку новичка, глядя только на ценник в чеке. RTX 5090 требует соответствующей свиты: блок питания на 1200 Вт, минимум 128 ГБ оперативной памяти (чтобы веса моделей не грузились вечность) и быстрый NVMe-накопитель. Это добавляет к смете еще около 150 тысяч рублей. Далее в игру вступают операционные расходы. При TDP в 575 Вт система под нагрузкой потребляет около 750 Вт. При тарифе 8 рублей за кВт·ч и круглосуточной работе счет за свет станет заметной графой расходов. Однако еще больнее бьет ситуация на рынке компонентов: SK Hynix уже законтрактовала выпуск HBM на 2026 год, а цены на обычную DRAM выросли на 60% за квартал.
Карта стоит фиксированную сумму каждый месяц, прошел через нее миллион токенов или ни одного. API стоит ровно столько, сколько вы фактически пропустили через систему.
Разница между своим и облачным токеном исчезает только при экстремально высокой утилизации. Для бизнеса с нерегулярными запросами локальное железо превращается в дорогую игрушку CTO. Единственный рациональный аргумент в пользу переплаты за локальный инференс — это осознанный налог на конфиденциальность. Если данные настолько чувствительны, что их нельзя доверять внешним провайдерам, покупка превращается в страховку. В остальных случаях математика беспощадна: пока ваш объем генерации не перекрывает месячную стоимость владения и ФОТ инженеров на поддержку этого зоопарка, облачные решения остаются единственным здравым выбором для финансового директора.