Научные большие языковые модели уже перешли от простого чтения статей к написанию кода. Однако вопрос о том, способны ли они автономно проектировать сложные, тесно связанные архитектуры научного машинного обучения, до сих пор оставался открытым. Модели предсказания структуры белка объединяют в себе эмбеддинги последовательностей, попарные геометрические преобразования, инвариантные представления и специализированные функции потерь. Традиционно такой стек требует месяцев дорогостоящей ручной настройки профильными ML-инженерами. Чтобы проверить, смогут ли автономные системы ориентироваться в столь взаимосвязанных кодовых базах, исследователи из Стэнфорда, Йеля и Нанкинского университета представили AgentFold — мультиагентный фреймворк, который превращает разработку структурных моделей в замкнутый цикл поиска по исполняемому коду на Python.
Замкнутый цикл поиска среди вариантов кода
Взяв за основу архитектуру ESMFold, AgentFold автономно формирует гипотезы, внедряет и отлаживает изменения в коде, запускает валидационные тесты и фиксирует как прорывы, так и тупиковые ветки в структурированной памяти. Этот подход бросает прямой вызов классическому AutoML, ограниченному статическими сетками гиперпараметров, поскольку позволяет LLM-агентам напрямую переписывать логику архитектуры в кодовых базах на тысячи строк.
«AgentFold — это мультиагентный фреймворк, который представляет разработку моделей фолдинга как замкнутый цикл поиска по исполняемым вариантам кода».
Рассматривая отрицательные результаты как жесткие эксплуатационные ограничения, фреймворк не дает последующим итерациям повторять критические архитектурные ошибки. В ходе экспериментов AgentFold протестировал около 80 исполняемых вариантов, потратив на это примерно 5 000 GPU-часов и 170 млн токенов LLM.
Практические результаты
При сопоставимом вычислительном бюджете AgentFold показал прирост метрики lDDT на 7,5% по сравнению с изолированными генерациями Codex и уверенно превзошел базовые контрольные решения. Журналы работы системы также выявили фундаментальные закономерности архитектуры: стабильный прирост давали ранние мягкие обучаемые априорные распределения (priors) и управляемая фильтрация (gated refinement), тогда как прямые геометрические возмущения и обратные связи, завязанные на геометрию, стабильно приводили к срыву обучения.
Для руководителей биотех-компаний и директоров по R&D AgentFold доказывает, что автономные агенты уже способны взять на себя рутинный метод проб и ошибок в научном ML-дизайне. Однако суровая экономическая реальность очевидна: расход 5 000 GPU-часов всего на 80 вариантов смещает главное узкое место с найма дефицитных ML-талантов на контроль огромных счетов за облачные вычисления и фильтрацию рисков научных галлюцинаций перед отправкой кода в реальные лабораторные пайплайны.