На рынке искусственного интеллекта происходит тектонический сдвиг в сторону дешевых и доступных систем рассуждения. Согласно результатам тестирования от 31 июля 2026 года, модель DeepSeek V4 Flash 0731 показала выдающиеся результаты в бенчмарке ARC-AGI — золотом стандарте измерения способности ИИ к обобщению на незнакомых задачах. Достигнув точности 89,0% на полуприватном наборе ARC-AGI-1 и 61,4% на ARC-AGI-2 в режиме «Max effort», DeepSeek доказывает: архитектура модели способна решать принципиально новые проблемы, а не просто воспроизводить заученные шаблоны из обучающей выборки.
Трехуровневая архитектура рассуждений
Методология V4 Flash 0731 опирается на три настройки интенсивности вычислений: низкую (Low), высокую (High) и максимальную (Max). Данные выявляют жесткую корреляцию между затратами на вычисления и точностью. Если вариант Max удерживает планку в 89,0% на ARC-AGI-1, то переход к режиму Low обрушивает производительность до 84,0%. На более изнурительном тесте ARC-AGI-2 разрыв превращается в пропасть: 61,4% у Max против посредственных 46,0% у Low.
В режиме максимальных усилий DeepSeek V4 Flash 0731 достигает 89,0% на ARC-AGI-1 Semi-Private всего за $0,02 на одну задачу.
Такой гранулярный контроль позволяет точечно распределять ресурсы в зависимости от сложности задачи — это обязательное условие для автономных систем, работающих в реальном времени. Примечательно, что публичные оценки ARC-AGI-2 преподнесли сюрприз: пока версия Max справлялась с задачами вроде 135a2760, она споткнулась на тесте 0934a4d8, который успешно прошла версия High. Это подчеркивает нелинейную природу логического вывода: наращивание сырой мощности не всегда гарантирует нахождение верного решения.
Экономика инференса против грубой силы
Настоящий триумф DeepSeek заключается не только в проценте правильных ответов, но и в агрессивном обесценивании единицы интеллекта. Решение задачи на ARC-AGI-1 обходится в $0,02, а на требовательном ARC-AGI-2 цена возрастает лишь до $0,04. В контексте теста Франсуа Шолле, нацеленного на абстрактное мышление, такая стоимость радикально меняет расчеты при масштабном развертывании автономных логических агентов.
Модель демонстрирует подлинную способность к обобщению на полуприватных датасетах, решая задачи при стоимости цикла от $0,02 до $0,04.
Превращая сложные рассуждения в дешевый расходный материал, DeepSeek делает массовое внедрение логических агентов экономически оправданным. В то время как западные модели сопоставимого класса часто сжигают бюджеты из-за высокой стоимости инференса, китайская команда оптимизирует цену самой мысли. Это переводит дискуссию об AGI из плоскости теоретических тестов в область операционной эффективности. Главным вопросом остается зависимость от полуприватных данных: настоящим испытанием станет работа в реальных промышленных условиях, где нет заранее откалиброванных механизмов безопасности или скрытых пересечений данных. На данный момент DeepSeek не просто конкурирует мощностью — компания побеждает ценой.