Наращивание кремния для решения проблем с памятью в больших языковых моделях — непозволительно дорогой путь. Согласно исследованию специалистов из MIT и Vizuara, алгоритмическое сжатие KV-кэша оказывается гораздо выгоднее многочипового тензорного параллелизма, снижая стоимость миллиона токенов в 1,2–2,0 раза на чипах A100, A40 и H100.

Инфраструктурные команды регулярно распределяют тензорный параллелизм на кластеры от двух до восьми ускорителей, чтобы обрабатывать длинные контекстные окна и крупные батчи. Этот метод грубой силы бьет по проекту дважды: раздувает счета за облачную инфраструктуру и замедляет работу из-за сетевых задержек при операциях All-Reduce между чипами на каждом слое механизма внимания. Исследовательская группа под руководством Шриканты Датты Тумкура и Мехара Симхадри доказала, что использование 4-битного или 8-битного квантования KV-кэша вместе с алгоритмами вытеснения повышает выход токенов на потраченный доллар в 16,5 раза на одном GPU. На этом фоне прирост эффективности 8-процессорного кластера всего в 1,21 раза выглядит неоправданной тратой денег.

Экономика меняется только тогда, когда объем параметров модели превышает физический объем видеопамяти. По расчетам авторов, пороговое значение составляет около 36 миллиардов параметров для видеокарты на 80 ГБ. Для моделей меньшего размера, таких как Llama-2-7B, масштабирование на несколько GPU — чистая потеря бюджета. Для более крупных сетей тензорный параллелизм остается неизбежным просто ради размещения весов: сеть на 70B параметров физически не поместится в один A100, независимо от ухищрений с KV-кэшем. Главный вывод для технических руководителей предельно прост: сначала оптимизируйте работу с памятью на уровне софта, и только потом подписывайте счета на расширение кластера.

Большие языковые моделиСнижение затратОблачные вычисленияAI-чипыПроизводительность