Искусственный интеллект продолжает развиваться, но последний релиз приносит реальную пользу в лаборатории, а не просто очередную обертку для чат-бота. По словам разработчиков, Intern-S2-397B представляет собой масштабную мультимодальную базовую модель, созданную специально для сложных научных вычислений и выполнения долгосрочных задач агентами.

Intern-S2-397B масштабируется по трем ключевым направлениям: объем предварительного обучения, охват задач с подкреплением и среды для интерактивных агентов. На этапе предварительного обучения модель обходит громоздкие этапы парсинга, обучаясь напрямую на сырых страницах научной литературы через визуальное преобучение, совместно моделируя символическую семантику и визуальные связи.

"Via visual pretraining, Intern-S2-397B learns directly from raw pages of scientific literature, jointly modeling symbolic semantics and visual relationships"

Такое прямое текстово-визуальное поглощение сохраняет точность документов, которую стандартные парсеры обычно портят. Кроме того, Intern-S2-397B демонстрирует лидирующие показатели общего рассуждения среди открытых моделей благодаря масштабированию разнообразных научных задач с подкреплением в более чем 20 доменах и их совместному обучению.

Long-Horizon Agent Frameworks and Serving

Для оценки возможностей модели на стандартных бенчмарках и специализированных научных задачах применялись OpenCompass, VLMEvalKit и AgentCompass. Протоколы тестирования устанавливают максимальную длину инференса в 256 тыс. токенов для бенчмарков текстовых рассуждений и 64 тыс. токенов для мультимодальных оценок.

В условиях реального развертывания модель работает на стандартных средах выполнения языковых моделей. Intern-S2-397B можно запустить с использованием фреймворков инференса LMDeploy, vLLM или SGLang. Разработчики рекомендуют конкретные параметры генерации для достижения оптимального качества: сэмплирование с top_p на уровне 0.95, top_k 50, min_p 0.0 и температурой 0.8.

Масштабирование обучения с подкреплением более чем в 20 специализированных научных областях при поддержке инференса большой протяженности показывает, как открытые архитектуры готовятся к сложным автоматизированным рассуждениям. Интеграция визуального восприятия исследовательской литературы с изолированными интерактивными средами задает операционный стандарт для запуска долгосрочных автономных задач на доступной инфраструктуре. Для корпоративных бюджетов на R&D, привязанных к дорогим проприетарным API, этот релиз становится суровой проверкой на прочность в вопросах зависимости от поставщиков.

Большие языковые моделиОпенсорс ИИИИ-агентыСнижение затрат