Традиционное управление питанием в дата-центрах зашло в тупик. Основная причина в том, что к нагрузкам от больших языковых моделей (LLM) относятся так же, как к любым другим стандартным вычислениям. Элизео Курчо из Передового департамента ИИ и энергетики отмечает: современные стратегии опираются на механизмы, слепые к типу нагрузки — статические лимиты мощности и реактивное ограничение частоты (throttling) на уровне прошивки. Эти инструменты грубо снижают производительность оборудования, не учитывая нюансы обучения или инференса моделей. Инженеры инфраструктуры вынуждены закладывать избыточные мощности, исходя из паспортных данных — суммы теплопакета (TDP) и запаса прочности. При этом игнорируется тот факт, что нагрузки ИИ высоко коррелированы и, что критически важно, управляемы.

Главное

Использование алгоритмов обучения с подкреплением (PPO) позволяет регулировать нагрузку на уровне оркестрации. Энергоэффективность моделей увеличилась на 26,2% при одновременном росте пропускной способности токенов. Интеллектуальный контроль позволяет вдвое превышать паспортные лимиты мощности стойки без риска аварий.

Настоящий сдвиг происходит не в железе, а на уровне оркестрации. Развернув мета-контроллер на базе алгоритма PPO (Proximal Policy Optimization), исследователи превратили саму нагрузку в исполнительный механизм. Используя данные телеметрии с частотой дважды в секунду на кластерах A100 с моделями от 7B до 72B параметров, контроллер в реальном времени корректирует параметры генерации GRPO. Вместо того чтобы позволять модели работать до срабатывания автоматического выключателя или аппаратного замедления, мета-контроллер дает задаче дышать в рамках выделенного бюджета мощности. Это напоминает разницу между водителем, который заранее сбрасывает газ перед поворотом, и тем, кто бьет по тормозам, только увидев отбойник.

Статические лимиты мощности — это колоссальная трата капитала. Нагрузки ИИ должны управляться предиктивно, а не реактивно.

Цифры подтверждают, что избыточная осторожность со статическими ограничениями обходится дорого. На тестах модели 7B подход на базе обучения с подкреплением (RL) сократил число нарушений лимита мощности на 89,8%, увеличив при этом пропускную способность токенов на 18,1%. При масштабировании на рабочую нагрузку модели 72B результаты подтвердились: объем генерации вырос на 35,7% по сравнению с безопасным статическим сценарием, а количество критических скачков снизилось на 87,2%.

Стратегический контекст

Это не просто технический курьез, а готовая схема повышения плотности размещения оборудования в стойках. Анализ показывает, что двукратное превышение номинальной мощности вполне допустимо для смешанных парков машин. Пока индустрия паникует из-за прогнозируемого скачка спроса на электроэнергию для дата-центров на 160% в этом десятилетии, решение кроется не в дополнительных трансформаторах, а в замене жестких границ безопасности на интеллектуальные политики управления нагрузкой.

Итог

Нам обещали, что энергосистему спасет эффективность самого железа. Однако выяснилось, что обучение моделей самостоятельному регулированию потребления — гораздо более эффективная стратегия.

Большие языковые моделиПроизводительностьСнижение затратОблачные вычисления