Десятилетиями экосистема NVIDIA удерживала рынок за горло благодаря монополии на низкоуровневую экспертизу. Написание GPU-ядер — фундамента современных нейросетей — превратилось в закрытое искусство, доступное лишь узкому кругу инженеров. Шии Цао и команда Berkeley Sky Lab справедливо замечают: индустрия угодила в «золотую клетку» оптимизаций под CUDA. Пока аппаратный рынок диверсифицируется, разработчики остаются заложниками старого кода. Перенос Attention или SSM-моделей на новые архитектуры раньше означал необходимость заново изобретать велосипед, что создавало непреодолимый барьер для любого конкурента NVIDIA.

Автоматизированная деструкция монополии

Чтобы вскрыть эту клетку, исследователи доработали K-Search — фреймворк эволюционного поиска ядер — для работы с Apple MLX. Система, созданная Цао в UC Berkeley, использует AI для оптимизации GPU-ядер в итеративном цикле проб и ошибок. Это зеркальное отражение работы живого инженера, но на скоростях, которые человеку недоступны. Вместо того чтобы начинать с чистого листа, K-Search использует существующие наработки CUDA как базу знаний, адаптируя их под архитектуру Apple Silicon.

Экосистема CUDA накопила десятилетия выстраданного опыта: ручные оптимизации, на которые ушли тысячи человеко-часов, теперь становятся лишь вводными данными для алгоритма.

Ключевой прорыв здесь в слое трансляции. K-Search не просто копирует код, а перепроектирует логику под объединенную память (unified memory) чипов M-серии. Опираясь на аппаратные правила и математические ограничения, фреймворк гарантирует, что на выходе получится не просто рабочий код, а физически эффективное решение, учитывающее специфику «железа» Apple. Это превращает накопленный багаж NVIDIA из конкурентного преимущества в общедоступный ресурс.

Экономика локального инференса

Несмотря на миллионы проданных устройств, Apple Silicon долгое время «недодавал» производительности. Критические ядра, такие как Paged Attention или маршрутизация в MoE-моделях, либо отсутствовали, либо были написаны «на коленке». K-Search закрывает этот разрыв с пугающей эффективностью. Тесты показали 0,97x от скорости нативных ядер MLX Attention — фактически, система автоматически достигла уровня экспертной ручной оптимизации. Еще показательнее результаты на ядрах Mamba SSM: ускорение этапа префилла в 20 раз по сравнению с популярной библиотекой mlx-lm.

Наш подход позволяет достичь почти экспертной производительности на Apple Silicon, демонстрируя 0,97x от скорости нативного ядра MLX Attention.

Для бизнеса это означает прямой путь к сокращению CapEx. Оптимизация такого уровня позволяет переносить задачи R&D и даже продакшн-нагрузки с дорогостоящих облачных H100 на локальные мощности Mac. Методология K-Search не привязана к конкретному вендору: ту же логику можно применить для экспансии на чипы Intel, AMD или кастомные ASIC. Бутылочным горлышком больше не является дефицитный человеческий ресурс, а лишь эффективность эволюционного поиска. Зависимость AI-индустрии от единственного поставщика чипов из-за программного наследия начинает ослабевать.

AI-чипыПроизводительностьСнижение затратЛокальный ИИApple