Объем научных публикаций в сфере искусственного интеллекта окончательно парализовал традиционную систему рецензирования. По данным организатора Абубакара Абида, на конференцию ICML 2026 поступило рекордные 23 918 заявок, из которых приняли 6 352 работы — почти вдвое больше, чем годом ранее. Этот лавинообразный рост во многом вызван тем, что сами исследователи применяют ИИ для ускорения экспериментов и генерации текстов статей, тогда как человеческие ресурсы рецензентов-волонтеров крайне ограничены. Кризис институциональной оценки стал очевиден даже по официальным отчетам: в одной из принятых ключевых работ рецензент открыто признал низкую уверенность в оценке, поскольку попросту не смог проверить математические доказательства. Чтобы выяснить, способны ли сами алгоритмы аудировать научный поток, в рамках инициативы ICML 2026 Open Reproductions с 15 июля по 2 августа 2026 года мобилизовали инженерное сообщество.
За 19 дней свыше 1 200 инженеров и исследователей задействовали автономных агентов для стресс-тестирования 2 226 принятых статей, проверив около трети всей программы конференции. Участники использовали такие инструменты, как Claude Code, Codex, Cursor и фреймворк orx от OpenResearch. Организаторы проиндексировали принятые работы и выделили ключевые эмпирические тезисы, что позволило агентам проводить пошаговую верификацию конкретных утверждений вместо бесплодных попыток разобрать монолитные кодовые базы целиком. В общей сложности в рамках инициативы было сформировано 6 816 журналов верификации Trackio.
Результаты проверки и типичные сбои
Агенты выполняли параллельные циклы верификации за несколько часов вместо целых выходных, наглядно вскрыв места, где академические публикации по машинному обучению регулярно дают сбой на практике. Автоматический аудит раз за разом наталкивался на скрытый технический долг: плохо задокументированные конфигурации гиперпараметров, отсутствие скриптов предобработки данных и неявные зависимости, на которые рецензенты-люди обычно закрывают глаза. В случаях с закрытыми проприетарными датасетами или чекпоинтами моделей на сотни миллиардов параметров автономная проверка упиралась в жесткие аппаратные лимиты, вынуждая агентов тестировать теоретические гипотезы на упрощенных синтетических средах.
Этот эксперимент знаменует фундаментальный сдвиг парадигмы в R&D машинного обучения. Инженеры перестают быть исполнителями рутинного ручного воспроизведения кода и превращаются в аудиторов гипотез, анализирующих сгенерированные агентами отчеты об ошибках. Для корпоративных команд разработки, оценивающих свежие препринты для внедрения в архитектуру предприятий, автоматическая проверка фактов становится жестким, но необходимым фильтром, отсекающим невоспроизводимые академические заявления задолго до того, как они попадут в производственные пайплайны.