Бенчмарки для оценки интерактивного мышления вышли за рамки этапа, когда статичный промпт-инжиниринг или слепое запоминание позволяли сымитировать интеллектуальные способности. Фокус сместился на исследовательское исполнение: тестирование способности автономного агента систематически ориентироваться в незнакомых средах методом проб и ошибок без заранее заготовленных инструкций. 21 августа 2026 года NVIDIA показала 100%-ный результат в бенчмарке ARC-AGI-3 со своим универсальным агентом-программистом NVIDIA AVO, установив новую планку автономного использования инструментов и одновременно возобновив привычный для индустрии скептицизм относительно границ синтетических тестов.

Безупречный проход по 25 публичным средам

Команда NVIDIA AI сообщила, что NVIDIA AVO решил все 183 уровня во всех 25 публичных средах ARC-AGI-3. Принципиально важно, что система справилась с этими интерактивными испытаниями без заранее заданных целей, явных правил переходов или пошаговых указаний. Вместо сброса состояния исполнения между вызовами AVO сохранял траектории с поддержкой состояния, опираясь на динамическую обратную связь от среды.

«NVIDIA AVO непрерывно анализирует, планирует, внедряет решения и оценивает результат, используя память, инструменты и обратную связь от исполнения кода для накопления опыта в процессе работы».

По заявлению NVIDIA AI, агент работает в активном цикле, совмещающем долговременную память с вызовом инструментов во время исполнения. Вместо бессмысленного расхода токенов на слепую повторную генерацию архитектура анализирует ошибки исполнения, корректирует свое внутреннее представление о состоянии и итеративно движется к решению — а это базовое требование для работы со сложными корпоративными пайплайнами ПО и недокументированным легаси-кодом.

Архитектура обвязки, закрытые датасеты и реалии корпоративного сектора

Идеальный результат в синтетических тестах неизбежно вызывает вопросы к методологии. Технический отчет NVIDIA указывает на разделенную операционную архитектуру: программная обвязка направляет намерения агента, а базовая инфраструктура ограничивает права на выполнение. Исследователи ИИ и системные инженеры сразу же усомнились, не была ли логика обвязки чрезмерно оптимизирована под 25 публично доступных сред, и призвали провести оценку на закрытых приватных наборах тестов для подтверждения реальной способности к обобщению.

Помимо чистоты бенчмарков, перед техническими руководителями встает ключевой инженерный компромисс: стоимость инференса против реальной автономности. Итеративная система на базе проб и ошибок способна проходить синтетические игровые конечные автоматы, однако развертывание замкнутых исследовательских агентов на критически важных задачах разработки требует строгой изоляции в песочницах и предсказуемой экономики вычислений. Если итеративное мышление от NVIDIA удастся применить для автономного поиска и исправления багов в масштабных легаси-репозиториях, AVO станет жизнеспособным шаблоном для автоматизации корпоративных R&D-процессов. Однако пока не раскрыты результаты приватных аудитов и метрики расхода вычислительных ресурсов, 100%-ный результат на публичных данных остается скорее впечатляющей демонстрацией инженерной обвязки, чем окончательным доказательством создания полноценного универсального мышления.

NVIDIAИИ-агентыБольшие языковые моделиАвтоматизацияИскусственный интеллект