Компания Specific Labs представила бенчмарк Real-SWE в сентябре 2026 года для оценки того, как передовые ИИ-модели справляются с закрытыми, реальными корпоративными кодовыми базами. Вместо тестирования систем на публичных датасетах бенчмарк задействует реальные задачи напрямую из производственных репозиториев действующих компаний. В таких условиях разработчики-агенты сталкиваются с проприетарными системами, где исходный код, внутренняя логика и прошлые решения невозможно найти в открытых интернет-архивах.
Бенчмарк фокусируется на инженерных проблемах, которые несут прямые операционные последствия для интегрированных систем. Задачи включают в себя управление циклами выставления счетов, расчет динамических налогов с продаж и миграцию активных клиентских аккаунт-записей через множество инфраструктурных сервисов.
"Созданные экспертами или синтетические задачи могут быть хорошо спроектированы, но они не являются буквальными, реальными задачами, которые инженеры в настоящих компаниях должны выполнять."
Как пояснили в Specific Labs при разработке бенчмарка, оцениваемые задачи отличаются от синтетических аналогов по двум ключевым направлениям: базовый артефакт программирования и специфичность инструкций, предоставляемых агенту. Поскольку каждое предприятие поддерживает уникальные архитектурные правила, стандарты кодирования и внутренние соглашения, ИИ-агент должен анализировать существующие устаревшие структуры и применять изменения, которые остаются совместимыми с работающими сервисами.
Многоинструментальная инфраструктура и показатели решения задач
Для имитации корпоративной среды Real-SWE оценивает комбинации моделей и обвязок вместо тестирования сырых базовых моделей изолированно. Тестовая инфраструктура интегрирует реальные операционные инструменты, где каждая задача открывает только те специфичные сервисы, которых требует ее рабочий процесс. Среда охватывает компоненты разработчика и среды выполнения, включая Docker, Kubernetes, эмулятор AWS, GitHub, Linear, MCP, PostgreSQL, MySQL, MongoDB, Redis, Gel, Go, Python, Node.js, Vitest, Slack, Intercom и Google Drive.
Одна из тестовых задач требует обработки счетов без налога в среде, использующей сервис NestJS, TypeScript, песочницу TaxJar, продакшн TaxJar и реестр InfluxDB. В рамках этого задания агент должен сопоставить различные специфичные для компании правила расчета налогов, запросить адреса назначения у внешних налоговых провайдеров через URL песочницы или продакшн, учесть флаги освобождения от налогов и занести детали валовой выручки в реестр, чтобы отчетность сходилась без остановки доставки счетов при неудачном поиске адреса.
В этих корпоративных сценариях показатели успешности решения — измеряемые как pass@1 в среднем по восемь независимых запусков на задачу — выявляют четкий потолок для существующих передовых систем. Fable 5.1 на базе Claude Code показала наивысшую производительность с уровнем решения в 38,8%, за ней следует GPT-6 Astra на Codex CLI с 33,8% и Gemini 3.8 Flash на Gemini CLI с 31,2%. Модель GLM 5.3 на Claude Code справилась с 28,8% задач, в то время как Grok 4.6 на Grok Build и Muse Spark 1.3 на Muse Code разделили показатель в 23,8%. Kimi K3 на Kimi Code достигла 18,8%, а GPT-5.6 Sol на Codex CLI решила 16,2% своих назначений.
Передовые агенты, способные занимать верхние строчки в синтетических бенчмарках, решают примерно одну из трех задач, оказавшись внутри закрытого репозитория реальной компании. Для бизнес-лидеров такое падение производительности сигнализирует об острой необходимости пересчитать рентабельность инвестиций и скорректировать стратегии разработки с помощью ИИ, сместив фокус с маркетинговых заявлений на жесткие операционные метрики.