Передовые ИИ-агенты оказываются неспособны совершать реальные научные открытия, как только их лишают подсказок из обучающих данных. В эмпирическом исследовании, опубликованном на сервере препринтов arXiv, ученые протестировали автономных агентов последнего поколения на способность выполнять полный цикл исследовательских задач без участия человека. Чтобы полностью исключить утечку данных из обучающих выборок, бенчмарк поставил перед агентами открытые исследовательские вопросы из двух неопубликованных статей: анализ управляемости персон языковых моделей и разработка детектора аномалий (out-of-distribution) для табличных фундаментальных моделей.
Условия эксперимента были максимально благоприятными. Агентам предоставили шесть дней непрерывной работы, выделенные вычислительные мощности, неограниченный доступ в интернет и бюджет около $3000 на API-кредиты для проектирования экспериментов, запуска скриптов и написания готовых научных статей. Итоговые работы прошли слепое рецензирование профильными экспертами по стандартным критериям ведущих конференций по ИИ. Результатом стал безоговорочный провал: статьи авторства агентов получили оценки 2/6 и 1/6, не дотянув до базовых академических стандартов.
Кризис научной строгости
Разбор результатов выявил системные проблемы с долгосрочным планированием, автоматизированным рассуждением и распределением ресурсов. Хотя агенты корректно считывали исходные промпты и намечали разумные направления, их методология рушилась при первых практических трудностях. Системы спешили завершить итерации, израсходовали меньше половины выделенного бюджета на вычисления и заходили в тупик при столкновении с отрицательными результатами. Вместо пересмотра провальных гипотез или корректировки экспериментальной базы агенты попросту маскировали некорректные данные поверхностными оговорками.
«Проверив всего несколько неудачных сигналов во внутреннем состоянии PFN, делать вывод о том, что "внутреннее состояние модели вообще не содержит полезных сигналов" — это колоссальный логический скачок. Подобное "доказательство на единичном примере" абсолютно ненаучно».
Как отметил эксперт-рецензент Вьет Нгуен, эта логическая ошибка перечеркнула достоверность результатов. Другой рецензент, Дэвид Африка, подчеркнул, что методологические повороты агентов выглядели нелепыми попытками подогнать факты под результат, а не следствием дисциплинированного научного поиска. Вместо того чтобы использовать шестидневный запас времени для тщательной проверки, агенты поспешили с выводами, основанными на сомнительных упрощениях.
Прагматичные рамки для автоматизации лабораторий
Результаты исследования очерчивают четкие границы для руководителей корпоративных R&D-подразделений, рассчитывающих на полностью автономные научные открытия. ИИ-агенты отлично справляются с изолированными шаблонными задачами — генерацией типового кода, первичным обзором литературы и запуском заданных пайплайнов, — однако самостоятельная проверка долгосрочных гипотез без контроля человека пока остается недостижимой. Попытка переложить сквозные прорывные исследования на автономные системы приведет лишь к появлению внешне безупречных текстов с грубейшими методологическими изъянами.
Флагманские модели остаются эффективными инструментами для профильных экспертов, но не автономными генераторами открытий. Попытка заменить ученых автоматизированными агентными пайплайнами — дорогостоящий просчет: глубокий R&D по-прежнему требует прямого человеческого контроля для преодоления нетривиальных тупиков.