Результаты свежего бенчмарка ARC-AGI-3 — это холодный душ для тех, кто до сих пор верит в магию чистых параметров. Отчет OpenAI по модели GPT-5.6 Sol наглядно показывает: эпоха бездумного масштабирования весов уступила место войне инфраструктур. На стандартном публичном наборе ARC-AGI-3 модель показала скромные 13,3%, но стоило активировать Responses API с механизмами сохранения промежуточных рассуждений и сжатия памяти (compaction), как показатель взлетел до 38,3%. Это почти вплотную приближает систему к базовому человеческому уровню в 48% (метрика RHAE), вычисленному OpenAI на основе игровых логов.
Инфраструктурный прорыв над масштабированием
Разрыв между версиями демонстрирует, что голая модель сегодня — это инвалид без костылей. Если предыдущая GPT-5.5 в тех же условиях беспомощно топталась на отметке 0,4%, то успех версии Sol в решении 2D-пазлов ARC-AGI-3 — заслуга исключительно умного управления контекстом. Суть бенчмарка в том, что агент должен на ходу вычислять незнакомые правила без подсказок. Традиционная обвязка обычно выбрасывает приватные цепочки мыслей модели после каждого действия, превращая ИИ в рыбку с трехсекундной памятью.
С включением сохранения рассуждений и сжатия памяти GPT-5.6 Sol берет все шесть уровней сложности, в то время как на глобальном лидерборде ни одна другая frontier-модель не может пробиться выше первого.
Исследователи OpenAI подтверждают очевидное: без сохранения внутреннего монолога модель вынуждена анализировать ситуацию с нуля после каждого хода. Использование Responses API позволило превратить этот контекст в часть истории, а технология compaction решила проблему скользящего окна, когда старые, но критически важные действия просто вываливались из памяти. Иронично, что такая архитектурная гигиена не только добавила модели мозгов, но и сократила объем выходных токенов в 6 раз. Эффективность, как выяснилось, пахнет не только интеллектом, но и экономией на инференсе.
Инфраструктура важнее промптов
Для бизнеса и CTO этот кейс — сигнал к немедленной смене стратегии. Пора прекращать инвестиции в шаманов, подбирающих слова в запросах, и начинать строить сложное агентское middleware. GPT-5.6 Sol уже доказывает жизнеспособность этого подхода, щелкая открытые математические задачи вроде гипотезы о двойном цикле и проходя Pokémon FireRed. Это не магия промпта, это работа внешней инфраструктуры, которая умеет управлять долгосрочной памятью агента.
Итог
Любые вложения в модели без развитой системы удержания опыта сегодня — это путь к деградации производительности в реальных задачах. Прогресс в ARC-AGI-3 фиксирует новый золотой стандарт: к настоящему AGI ведет не умение складно генерировать текст, а способность системы эффективно помнить, зачем она сделала шаг назад. На рынке останутся не те, у кого больше видеокарт, а те, чья инфраструктура позволяет модели не забывать собственные мысли в процессе работы.