Маркетинговые обещания Anthropic и OpenAI о скором появлении полностью автономных ИИ-исследователей столкнулись с суровой реальностью. Совместное исследование Принстонского университета и Британского института безопасности ИИ протестировало передовые модели рассуждений на неопубликованных статьях конференции NeurIPS с помощью новой методики Shadow Evaluation. Вместо синтетических тестов или автоматической проверки исследователи предоставили агентам ключевые научные задачи, а авторы оригинальных статей оценивали получившиеся черновики. На каждый эксперимент моделям выделили шесть дней вычислений, бюджет в 3000 долларов на API, доступ к GPU и полноценный набор веб-инструментов.

Авторы статей единогласно отвергли сгенерированные тексты с вердиктом Strong Reject, отметив нечитаемый слог, плохо обоснованные эксперименты и полное отсутствие реального концептуального вклада. Хотя модели без вмешательства человека справлялись с рутинными инженерными задачами и базовыми тестами, они оказались бессильны там, где требовалось научное суждение.

Для технических лидеров и руководителей R&D вывод очевиден: современные ИИ-агенты эффективны лишь как ассистенты для отладки кода, обработки данных и выполнения механических операций. Однако они не способны самостоятельно формулировать новые научные гипотезы. Запуск скриптов не заменяет экспертную оценку научной новизны, поэтому ключевые творческие решения в исследованиях по-прежнему остаются за человеком.

ИИ-агентыБольшие языковые моделиБезопасность ИИOpenAIAnthropic