Технологический сектор по-прежнему увлечен идеей рекурсивного самосовершенствования — концепцией, в которой искусственный интеллект проектирует, обучает и оптимизирует свои следующие поколения в непрерывном замкнутом цикле. Современные передовые модели легко генерируют шаблонный код, синтезируют обучающие выборки и помогают проектировать топологию микросхем. Однако путать инженерную эффективность с фундаментальными научными открытиями — ошибка стоимостью в миллиарды долларов.
Исследование ученых из Принстона Питера Киргиса и Саяша Капура ставит под сомнение сценарий скорой и взрывной автономии ИИ. Чтобы выяснить, способны ли автономные системы проводить полноценные исследования в области машинного обучения, команда применила метод теневой оценки (shadow evaluation). Автономным ИИ-агентам поручили самостоятельно воспроизвести и решить исследовательские задачи из двух неопубликованных работ, подготовленных для конференции NeurIPS.
Провал в открытых исследованиях
Для проверки реальных исследовательских навыков агентам предоставили шесть дней, выделенный GPU-кластер, доступ в интернет и внушительный бюджет на API. Стеку агентов предстояло решить нетривиальные задачи: напрямую исследовать интерпретируемость моделей (управление поведением через веса) и создать детекторы сбоев для табличных моделей прогнозирования.
Результат оказался отрезвляющим. Когда авторы оригинальных статей оценили сгенерированные агентами работы по стандартным критериям рецензирования, автономные пайплайны полностью провалились. Оставшись без жестких рамок и подсказок, агенты продемонстрировали полное отсутствие научного вкуса, порождали вырожденные синтетические циклы и оказались неспособны формулировать глубокие научные гипотезы или отличать артефакты данных от реальных прорывов.
Структурные ограничения рассуждений агентов
Оптимизация известных функций потерь на ограниченных бенчмарках — рутинная инженерная задача; формулирование правильного научного вопроса требует иного подхода. Без контроля человека рекурсивное самосовершенствование быстро деградирует: синтетические данные теряют качество, а исследовательская логика распадается.
Для технических директоров, тимлидов и венчурных инвесторов вывод однозначен: пора отказаться от планов, построенных на ожиданиях скорой алгоритмической сингулярности и полностью автономного R&D. Жизнеспособные стратегии развития ИИ требуют гибридного подхода, где генерация синтетических данных и автономное выполнение кода остаются под контролем исследователей-людей, задающих дизайн экспериментов и общую стратегию.