Пока маркетологи Apple рисуют графики с недосягаемыми процентами прироста, реальный сектор проверяет железо в деле. Владелец сервиса аренды Mac прогнал Mac mini M4 с 16 ГБ оперативной памяти через Ollama (версия 0.31.2). Методика прозрачная: исключили прогревочный запуск, чтобы не учитывать время загрузки весов, и замерили генерацию на популярных квантованных моделях Q4_K_M. Выяснилось, что пропускная способность памяти в 120 ГБ/с — это то самое узкое горлышко, которое диктует правила игры. Формула проста: делим полосу пропускания на размер модели и получаем реальный темп работы без иллюзий.
Входной билет с жестким лимитом Для бизнеса базовая машина на M4 — это бюджетный пропуск в мир локальных помощников, но с четким потолком. Модели до 8 миллиардов параметров (8B) выдают уверенные 20+ токенов в секунду. Это быстрее, чем читает человек. Такой производительности хватит для автоматического разбора документов, ассистента по коду или локального RAG-агента, работающего с конфиденциальными данными без слива в облако. Но как только вы замахиваетесь на что-то серьезнее, например 14B, скорость падает до 11,7 токена в секунду. Это уже уровень мучительного ожидания, который быстро начнет раздражать сотрудников при постоянной работе.
«Пропускная способность памяти в 120 ГБ/с — главный ограничитель для инференса на базовых M4»
Технический затык и экономика Любопытно, что объем контекста почти не влияет на скорость: обработка промпта идет в разы быстрее самой генерации, достигая 1720 токенов в секунду. То есть скормить машине увесистый отчет можно мгновенно, но ждать вдумчивого ответа придется долго. На наш взгляд, для глубокой аналитики на моделях 14B+ понадобятся версии с пропускной способностью до 546 ГБ/с и запасом памяти от 24 ГБ.
Mac mini остается самым дешевым способом развернуть автономный Edge AI в офисе и закрыть вопросы безопасности данных. Однако стоит трезво оценивать CapEx: сэкономив на старте, вы рискуете получить парк машин, которые захлебываются на интеллектуальных задачах среднего уровня. Для простых ассистентов это идеальное решение, но полноценная AI-трансформация на минималках быстро упрется в физику железа.