Стремительное внедрение корпоративных моделей искусственного интеллекта довело инфраструктурные бюджеты до предела, однако истинным узким местом стала вовсе не вычислительная мощность в железе. По мере роста рабочих нагрузок экономика инфраструктуры все больше зависит от эффективности использования имеющихся кластеров, а не от сырых терафлопсов. Согласно исследованию команды Dharma-AI (Габриэл Пимента де Фрейтас Кардозу, Брено де Алмейда Белеза, Франсиско де Алмейда Роша Алвес и Бруно Дуарте), масштабирование ИИ в компаниях сдерживается не дефицитом чипов, а неэффективным управлением очередями GPU.
Механика конкуренции за ресурсы
В техническом отчете исследователи Dharma-AI сравнили контекстно-зависимый распределитель ресурсов GPU с традиционным планировщиком на базе алгоритма FIFO (первым пришел — первым обслужен) в семи тестовых сценариях. На идентичном оборудовании и одинаковых нагрузках утилизация графических процессоров выросла на величину до 33 процентных пунктов. Более того, полезная производительность с учетом приоритетов увеличилась во всех тестовых сценариях, показав прирост до 105% исключительно за счет оптимизации распределения задач без закупки нового оборудования.
Управление пулами вычислений требует решения задачи дискретной оптимизации для каждой комбинации GPU, задачи и временного шага. За ресурсы борются четыре типа нагрузок: обучение, инференс в реальном времени, пакетный инференс и квантование. Они делятся на два конфликтующих профиля: обучение, пакетный инференс и квантование требуют непрерывных блоков GPU без прерываний, тогда как инференс реального времени эластичен и привязан к колебаниям входящего спроса. При стандартном планировании FIFO это несоответствие неизбежно ведет к сильной фрагментации и простаиванию мощностей.
Структурное распределение вместо закупки чипов
В условиях высокой нагрузки на кластер порядок постановки задач становится стратегическим решением по распределению емкости, а не просто рутинной очередью. Простые FIFO-планировщики выделяют блоки GPU первым поступившим задачам без учета их приоритета и последующих зависимостей, из-за чего высокоприоритетные процессы простаивают за низкоуровневыми вычислениями. Модель Dharma-AI решает проблему фрагментации, оценивая профили нагрузок и бизнес-приоритеты на всем горизонте планирования.
Для технических директоров и руководителей ML-направлений вывод очевиден: прежде чем утверждать очередные масштабные капитальные затраты на покупку ускорителей, стоит провести аудит стека оркестрации и планирования — именно здесь скрыт главный резерв для снижения совокупной стоимости владения (TCO) и себестоимости вычислений.