Стремительное усложнение архитектур искусственного интеллекта привело к росту вычислительных и энергетических расходов до критического уровня. По прогнозам Международного энергетического агентства, потребление энергии ИИ-системами удвоится в течение следующих пяти лет, поэтому точный аудит затрат на инференс стал важнейшим операционным приоритетом. Годами команды инженеров и IT-архитекторы опирались на количество операций с плавающей запятой (FLOPs) как на простой показатель эффективности модели, полагая, что подсчет матричных умножений напрямую отражает фактическое время работы и расход энергии. Однако свежие данные показывают: на современных серверах эта гипотеза полностью теряет смысл.

Провал теоретической эффективности

В ходе масштабного исследования Энрике Барба Роке и Луиш Круз из Делфтского технического университета изучили, как математический объем FLOPs соотносится с реальным временем выполнения задач на железе. Расчет FLOPs по спецификациям модели не требует инструментов профилирования или прямого доступа к физическим серверам, но эта метрика намеренно игнорирует специфику распараллеливания процессов современными ускорителями. Операции с абсолютно одинаковым числом FLOPs регулярно демонстрируют колоссальную разницу во времени отклика в зависимости от их пространственной структуры.

Анализ сверточных нейросетей с различными параметрами (размер входных данных, число каналов и размеры ядра свертки) показал, что GPU гораздо эффективнее распараллеливают пространственные измерения, чем операции внутри ядра свертки.

«Слои с одинаковым количеством FLOPs могут выполняться с разной скоростью, поскольку одни операции распараллеливаются намного проще других».

Из-за этого структурного несоответствия подход все умножения равны создает огромные слепые зоны при оценке моделей. Архитектура, оптимизированная на бумаге под минимальное число FLOPs, на практике часто работает медленнее и потребляет больше электроэнергии, чем модель с большим числом FLOPs, структура которой лучше подходит под пропускную способность памяти и параллельные вычислительные блоки GPU.

Почему эмпирические формулы бесполезны на современном железе

Чтобы устранить разрыв между теорией и физическим оборудованием, исследователи ранее предложили формулу α-FLOPs, калибрующую число операций с помощью регрессии по результатам предварительных тестов. Барба Роке и Круз решили воспроизвести эти эксперименты и проверить надежность формулы на актуальном корпоративном оборудовании. В ходе проверки вскрылись серьезные изъяны прошлых бенчмарков, включая недокументированные цепочки зависимостей и закрытые наборы данных.

Детальное профилирование на современных GPU показало, что масштабирование времени выполнения куда менее предсказуемо, чем предполагали классические формулы. Ученые из Делфта зафиксировали на новых вычислительных платформах нестабильность исполнения, выраженную в нелинейных скачках задержек и колебаниях времени работы при смене конфигурации слоев. Формула α-FLOPs систематически упускала эти факторы и недооценивала аппаратные узкие места современных ускорителей.

На практике опора на синтетические математические формулы вместо прямого профилирования на физическом оборудовании создает серьезные финансовые и инфраструктурные риски. Компании, которые планируют мощности дата-центров или закупают серверы, ориентируясь только на заявленные FLOPs, рискуют столкнуться с дефицитом производительности, ошибками в бюджетировании и неприемлемо высоким временем отклика систем.

Теоретический подсчет FLOPs больше не может служить надежным ориентиром скорости инференса и энергоэффективности в боевых ML-системах. Исследование Делфтского технического университета доказало, что реальная задержка зависит от возможностей распараллеливания данных на чипе, а статические формулы вроде α-FLOPs не работают на современных ускорителях. Грамотное планирование инфраструктуры требует непрерывного сквозного тестирования на целевом продакшн-оборудовании, а не слепого доверия сухой теории.

Машинное обучениеAI-чипыСнижение затратПроизводительностьИИ в бизнесе