Физические ограничения настольного железа долгое время определяли рабочие процессы корпоративного ИИ: код пишется локально, но как только нужно запустить тяжелые веса моделей, приходится арендовать неоправданно дорогие облачные инстансы с GPU. Из-за узких мест в пропускной способности памяти и температурного троттлинга локальный запуск моделей на стандартных рабочих станциях был невозможен. Анонс 2-нанометрового чипа M6 и четырехкристального M5 Ultra от Apple бросает вызов этой облачной зависимости, устраняя главное узкое место локального инференса — скорость работы с памятью.

Линейка оборудования разделена на два уровня: процессор M6, выполненный по техпроцессу 2 нм от TSMC и установленный в обновленном Mac mini, и чип M5 Ultra, ставший основой десктопа Mac Studio. Если M6 сфокусирован на плотности транзисторов и энергоэффективности для повседневных локальных задач, то M5 Ultra представляет собой первую четырехкристальную компоновку Apple на базе интерфейса UltraFusion следующего поколения, созданную для масштабирования настольного кремния под массивные модели с открытыми весами.

Четырехкристальное масштабирование и объединенная память

Архитектурный скачок в M5 Ultra кроется в подсистеме памяти. Объединяя четыре кристалла в единую систему на чипе (SoC), процессор масштабируется до 80-ядерного графического процессора со специализированными нейроускорителями Neural Accelerators и 36-ядерного центрального процессора. Что критически важно, эта конфигурация обеспечивает пропускную способность объединенной памяти в 1,2 ТБ/с — прирост на 50% по сравнению с поколением M3 Ultra.

В генеративном ИИ именно пропускная способность памяти определяет, насколько быстро процессор передает веса и KV-кэш в вычислительные ядра во время генерации токенов. Хотя инференс с единичным размером батча на арендованном в облаке Nvidia H100 или H200 дает чистую вычислительную мощность, задержки доступа к памяти формируют основную часть стоимости за токен. Локальный Mac Studio с пропускной способностью 1,2 ТБ/с превращается в инструмент инференса с фиксированной стоимостью. Это позволяет инженерным командам запускать модели с более чем 70 млрд параметров и сложные многошаговые цепочки агентов без почасовой маржи облачных провайдеров и рисков утечки конфиденциальной корпоративной интеллектуальной собственности через сторонние API.

«Сегодня мы представляем следующий гигантский скачок в производительности и вычислениях для ИИ в чипах Apple Silicon — невероятно передовой M6 и самый мощный чип серии M на сегодняшний день, M5 Ultra, — заявил Шри Сантанам, вице-президент группы разработки кремния Apple. — Созданный по передовому техпроцессу 2 нм, M6 сочетает в себе новый процессорный комплекс, дополнительные ядра CPU и GPU, сдвоенный 16-ядерный Neural Engine и увеличенную пропускную способность объединенной памяти для выполнения ресурсоемких задач с потрясающей энергоэффективностью. А для предельной производительности настольных систем и возможности запускать массивные модели ИИ чип M5 Ultra оснащен масштабным GPU с новыми ускорителями Neural Accelerators и еще более высокой пропускной способностью объединенной памяти, раздвигая границы возможностей десктопа».

Техпроцесс 2 нм и локальное выполнение моделей

В то время как M5 Ultra берет на себя тяжелый локальный инференс, 2-нм чип M6 повышает эффективность на стороне устройств. Он включает переработанный 12-ядерный процессорный комплекс и сдвоенный 16-ядерный движок Neural Engine, удваивающий пиковую пропускную способность по сравнению с предыдущими поколениями.

Графический процессор M6 получил ускорители Neural Accelerators с пропускной способностью памяти до 170 ГБ/с, предоставляя внутренним средам разработки изолированный тестовый стенд с нулевой задержкой. Разумеется, кремний Apple не заменит вычислительные кластеры Nvidia для распределенного обучения моделей или масштабных пакетных задач. Однако он фундаментально меняет цикл разработки в корпоративном секторе: локальное развертывание агентов, отсутствие рисков утечки данных и переход на предсказуемые капитальные затраты взамен постоянных счетов за облачный инференс.

AI-чипыЛокальный ИИБольшие языковые моделиИИ в бизнесеApple