IBM без лишнего шума представила семейство открытых моделей Granite 4.2 с 3 млрд, 8 млрд и 30 млрд параметров под свободной лицензией Apache 2.0. Линейка обучена с нуля на массиве объемом около 15 трлн токенов и поддерживает контекстное окно до 512 тыс. токенов. Пока проприетарные лаборатории усиливают зависимость клиентов от закрытых API, IBM предоставляет корпоративным инфраструктурным командам полностью прозрачные веса из коробки на Hugging Face, Ollama и GitHub.
Главное преимущество Granite кроется в экономике инференса. IBM реализовала переключаемые режимы рассуждений: глубокий («thinking») и быстрый («low-effort»). Это дает инженерам платформ прямой контроль над задержкой генерации токенов и расходом вычислительных ресурсов GPU на каждый запрос. Под капотом версий на 8B и 30B заложено обучение с подкреплением, оптимизированное для агентных сценариев: модели нативно поддерживают вызовы внешних инструментов (tool calling), поиск в интернете и исполнение кода на Python в изолированных средах. Благодаря поддержке стандартного формата вызовов OpenAI в таких средах исполнения, как vLLM и SGLang, интеграция в существующие контуры частного облака или локальной инфраструктуры не требует перестройки процессов оркестрации.
Вместе с языковыми моделями вышла Granite Speech 5.0 Turbo CTC — компактная система распознавания речи на 470 млн параметров, способная транскрибировать три часа аудио за одну секунду. Для технических лидеров, балансирующих между растущими счетами за сторонние API и жесткими требованиями к суверенитету корпоративных данных, Granite 4.2 превращает развертывание автономных ИИ-агентов на собственных мощностях из рискованного эксперимента в экономически обоснованную инвестицию.