Мультимодальные системы принятия решений часто упираются в предсказуемые ограничения по задержке, как только инженеры начинают полагаться на авторегрессионную генерацию токенов. Выпуск моделей Intern-Decision — с размером в 4B и 0.8B параметров от InternLM — знаменует собой резкий разворот индустрии от громоздких систем рассуждений к легковесным, практичным движкам принятия решений.

Архитектура обрабатывает входящий пакет данных, содержащий общий стейт, структурированную схему поименованных вопросов и опциональные изображения, чтобы выдать полное распределение ответов для каждого запрошенного вопроса одновременно за один прямой проход модели. Вместо того чтобы тратить вычислительные мощности на стандартные генеративные циклы, траектория выполнения оценивает скоринг кандидатов напрямую на уровне логитов.

Полностью пропуская по токенную выборку, система обходит абсурдные вычислительные накладные расходы стандартных процедур генерации текста в схемах с множеством вопросов. В результате компании могут существенно сократить расходы на вывод и развертывание периферийных ИИ-систем, не оставаясь привязанными к тяжелой облачной инфраструктуре.

Локальное развертывание

Конфигурации развертывания следуют стандартным шаблонам хостинга с открытым исходным кодом. Настройка среды выполнения требует Python наряду с установкой requirements.txt в соответствующем окружении PyTorch и CUDA.

Инженеры могут загружать Intern-Decision-4B с помощью Hugging Face Transformers через AutoProcessor и AutoModelForMultimodalLM. Кроме того, команды могут установить vLLM через pip для обслуживания эндпоинтов с помощью команды vllm serve или установить SGLang через pip и запустить экземпляры сервера посредством python3 -m sglang.launch_server.

Создание агентского воркфлоу на базе с 4B параметрами вместо громоздкого кластера рассуждений наконец обеспечивает ту оперативную экономию, которой требовали корпоративные финансовые команды, при условии, что один прямой проход без шагов генерации соответствует возможностям сложного планирования многотокеновых моделей. Эпоха слепого использования массивных языковых моделей для решения простых корпоративных задач маршрутизации подходит к концу.

Искусственный интеллектБольшие языковые моделиОпенсорс ИИСнижение затратInternLM