Эпоха использования ИИ в качестве продвинутого Т9 для написания текстов подходит к концу. Лаборатории первого эшелона всё чаще намекают на самообучающиеся системы, но свежие эмпирические данные указывают на пропасть между инженерной исполнительностью и реальным научным открытием. Исследователи из Принстона под руководством Саяша Капура совместно с Британским институтом безопасности ИИ (UK AI Security Institute) провели теневые испытания автономных агентов на задачах без заранее известного ответа. Вердикт неутешителен: современные модели — отличные лаборанты, но катастрофически плохие ученые.

Failure Modes in Autonomous R&D

Методология исследования была максимально жесткой: агентам скормили центральные вопросы двух еще не опубликованных работ уровня NeurIPS. В распоряжении систем было шесть дней и тысячи долларов в вычислительных мощностях. Результат? Агенты успешно закрыли все инженерные хвосты, но авторы оригинальных статей — выступавшие в роли судей — единогласно отвергли их выводы. Анализ выявил пять когнитивных тупиков: от неумения вовремя свернуть с ложного пути (backtracking) до полной потери фокуса из-за дрейфа инструкций в длинных рабочих циклах.

Агенты выполнили всю инженерную работу без помощи человека, но не продвинулись ни на шаг в ответе на фундаментальные исследовательские вопросы.

Для руководителей R&D это критически важное разграничение. ИИ может оптимизировать метрики или вылизывать код, но он не способен к осознанному выдвижению гипотез. Проверка на разных стеках, включая наиболее продвинутые проприетарные модели, подтвердила паттерн: система теряет контекст и не чувствует планку качества, необходимую для научной публикации. Проще говоря, ИИ готов заменить руки исследователя, но пока не может заменить его голову, принимающую решения в условиях концептуальной неопределенности.

The Bottleneck of Open-Ended Discovery

Переход от верифицируемых задач к открытому поиску — это качественный скачок, который ИИ еще не совершил. Большинство современных бенчмарков построены на дискретных пазлах, где правильный ответ легко проверить программно. В реальности же R&D — это непрерывный процесс принятия решений высокого уровня, где нужно вовремя признать провал и начать заново. Агенты из исследования Принстона и Стенфорда игнорировали обратную связь и продолжали жечь бюджет на заведомо неверные подходы. Это доказывает, что узким местом автоматизации науки является не скорость кодинга, а отсутствие модели мира для оценки научной значимости.

Для бизнеса это холодный душ на фоне хайпа о взрывном прогрессе. Агентам можно и нужно делегировать рутину — чистку данных, базовые эксперименты и инженерную сантехнику. Однако доверять им интеллектуальное лидерство в проектах преждевременно. Пока модели не научатся управлять ресурсами и осознавать собственные ошибки в нелинейных средах, они останутся лишь высокопроизводительными инструментами, а не автономными коллегами. Полноценная автоматизация фундаментальных открытий потребует фундаментального сдвига в том, как ИИ обрабатывает долгосрочные цели, не скатываясь в имитацию бурной деятельности.

ИИ-агентыМашинное обучениеБезопасность ИИИИ в бизнесе