Одержимость гигантскими моделями с миллиардами параметров зашла в тупик на потребительских устройствах. В реальном мире 21 миллиард IoT-устройств работают на железе, которое стоит дешевле пары дизайнерских кроссовок. Needle 2 — открытая агентная модель размером всего 14 МБ от компании Cactus — это жесткое столкновение с реальностью для тех, кто считает, что функциональный ИИ требует серверной фермы размером с городской квартал. Имея всего 45 миллионов параметров, эта модель создана не для написания стихов или галлюцинаций о Римской империи; ее задача — хирургически точное преобразование сумбурной человеческой речи в структурированные параметры функций.
Сузив специализацию до вызова инструментов и управления устройствами, Needle 2 достигла такого соотношения размера и качества, которое позволяет ей выступать в тяжелом весе. В бенчмарке Mobile-Actions она уже превосходит таких гигантов, как Mobile-Actions от Google и базовые модели Apple в специфических сценариях управления устройствами. Это классический пример того, как специализация побеждает грубую масштабность.
Высокая автономность на бюджетном железе
Производительность на Raspberry Pi 5 показывает, сколько технического жира удалось срезать команде Cactus. Модель достигает скорости обработки промпта (prefill) более 800 токенов в секунду и генерирует ответ (decode) на скорости свыше 500. Для робототехники и носимых устройств это не просто цифры — это разница между плавным взаимодействием и бесполезным тормозящим кирпичом. В отличие от стандартных моделей, которые теряют точность при сжатии после обучения, Needle 2 использует компрессию CQ2-bit. Этот 2-битный метод квантования не является запоздалым решением — он заложен в саму архитектуру.
2-битная модель, которую вы развертываете — это та же модель, которая обучалась. Именно это позволяет уместить 45 миллионов параметров в 14 мегабайт.
По словам команды Cactus, модель и движок инференса проектировались совместно на всех этапах: от предварительного обучения до финальной доводки. Такая тесная интеграция позволяет запускать модель на чем угодно — от бюджетного смартфона до робота Reachy Mini — без раздутого процесса установки. Работая в рамках 28 МБ оперативной памяти, она делает сложный ИИ доступным для оборудования, у которого нет роскоши в виде выделенных нейропроцессоров (NPU) или высокопроизводительных GPU.
Тактическая оркестрация между периферией и облаком
Для технических директоров, следящих за расходами, главной победой станет избавление от облачной зависимости. Needle 2 использует грамматику на уровне байтов для принудительного структурирования вывода, гарантируя, что каждый ответ будет либо точной командой, либо корректным отказом. Больше никаких непредсказуемых текстовых строк, ломающих конвейер автоматизации. Каждая итерация сопровождается вычисленным показателем уверенности, что позволяет выстроить чистую гибридную архитектуру: рутинные команды выполняются локально, и только по-настоящему сложные аномалии передаются в дорогостоящее облако.
Каждый ответ несет в себе показатель уверенности, а запросы не по теме возвращают пустой результат. Если показатель выше порога — действуйте; если ниже — переспросите или передайте задачу в облако.
Перенося интеллект непосредственно на устройство, компании могут обнулить затраты на API за каждый запрос и решить кошмарную проблему конфиденциальности, связанную с отправкой локальных данных на внешние серверы. Сдвиг в сторону гиперэффективных моделей вроде Needle 2 доказывает: будущее рынка IoT на 21 миллиард устройств определится не тем, сколько облачных ресурсов мы сможем впихнуть в тостер, а тем, какой уровень локальной надежности мы выжмем из 14 мегабайт. Это не просто технический курьез, а готовый план по превращению дешевого офлайн-оборудования в защищенных автономных агентов.