Флагманский графический ускоритель NVIDIA H100 NVL обходит RTX PRO 6000 Blackwell Server Edition по сухим спецификациям с солидным запасом: производительность тензорных ядер в FP8 составляет 3341 TFLOPS против 2000 TFLOPS, а пропускная способность памяти достигает 3900 ГБ/с против 1597 ГБ/с. Корпоративный сектор привык ориентироваться именно на эти цифры при закупке инфраструктуры под большие языковые модели. Однако в расчете на реальную стоимость закупки картина резко меняется: H100 NVL обходится примерно в полтора раза дороже RTX PRO 6000 BSE. Когда речь заходит об инференсе готовых решений, избыточная вычислительная мощность флагмана превращается в замороженный бюджет, который не дает пропорционального прироста скорости.
Инженер по разработке ИИ-решений компании YADRO Алексей провел сравнительное тестирование серверов YADRO G4208P G3. В рамках испытаний сопоставлялась работа ускорителей RTX PRO 6000 и карт H100 NVL под управлением стека vLLM версий 0.23.0 и 0.26 в Docker-окружении на базе CUDA. Тестирование охватило как плотную архитектуру Qwen3.6-27B (dense), так и модели со смесью экспертов Qwen3.6-35B-A3B (MoE) и DeepSeek-V4-Flash в режимах многопоточной серверной нагрузки и офлайн-пакетов.
Точность вычислений и сжатие весов
Главным технологическим козырем RTX PRO 6000 Blackwell Server Edition выступает аппаратная поддержка формата NVFP4 — четырехбитного квантования весов с двухуровневым масштабированием. Этот метод задействует масштабирующий коэффициент в формате FP8 на каждый блок из 16 элементов и общий множитель в FP32 на весь тензор. Подобная схема позволяет вдвое сократить объем занимаемой памяти относительно восьмибитного формата FP8 без деградации логики ответов.
Для проверки математической строгости работы сжатых моделей использовался бенчмарк sgl-eval на олимпиадном наборе данных AIMO-2025 из 30 задач, где точность фиксировалась как средний результат за 16 прогонов.
«переход на NVFP4 квантизацию не снижает точность вплоть до второго знака в округлении на датасете AIME-2025».
На синтетических профилях нагрузки с преобладанием генерации токенов (decode-heavy) и сбалансированных сценариях формат NVFP4 обеспечил прирост скорости end-to-end до 43% на плотной модели Qwen3.6-27B и до 33% на архитектуре MoE Qwen3.6-35B-A3B относительно FP8. В сценариях с длинным входящим контекстом (prefill-heavy) выигрыш от четырехбитного сжатия оказался минимальным: узким местом здесь становится первичная обработка промпта, а не выгрузка весов из памяти.
Реальная отдача на вложенный доллар
При оценке экономической эффективности по метрике Perf/$ соотношение времени сквозной обработки и стоимости чипов наглядно показывает практическую выгоду альтернативных платформ. В сценариях с активной генерацией текста RTX PRO 6000 BSE на модели Qwen-35B-A3B-NVFP4 опережает конфигурацию на H100 NVL по показателю окупаемости в среднем на 49%.
Преимущество более доступного ускорителя сохраняется на архитектурах со смесью экспертов за счет эффективного распределения памяти и снижения накладных расходов на чтение параметров. Разрыв минимален лишь на dense-моделях, где монолитная структура требует предельной пропускной способности памяти, изначально заложенной в архитектуру H100 NVL.
Для CTO и финдиректоров вывод прагматичен: покупка H100 оправдана для масштабного pre-training и тяжелого дообучения. Но если перед бизнесом стоит задача развернуть локальный продакшн-инференс на MoE-моделях со сжатием до NVFP4, переплата полуторного тарифа за флагманские стойки лишена экономического смысла.