Современные генеративные пайплайны без труда создают тысячи белков *de novo*, однако их валидация в лаборатории («wet-lab») остается дорогим и крайне медленным узким горлышком. В исследовании, принятом на воркшоп ICML 2026 по генеративному и агентному ИИ для биологии, команда исследователей (Гюбок Ли, Кивун Ю, Джимин Со, Кёнхун Хур и Эдвард Чхве) представила уровень принятия решений после генерации: он использует большие языковые модели для построения многокритериальных политик ранжирования и шортлиста кандидатов перед запуском дорогостоящих физических экспериментов.
Вместо произвольной ручной фильтрации фреймворк направляет LLM синтезировать логику ранжирования на основе разнородных оценок достоверности и интерфейсных метрик, сгенерированных такими инструментами, как Boltz-2 и Protenix. Авторы сообщают, что усреднение пяти итеративных политик на базе GPT-4o обеспечило показатель Recall@10 на уровне 0,589 на отложенном бенчмарке из 10 мишеней, опередив базовую оценку одного признака связывания Protenix ipTM (0,571 Recall@10).
На специализированной выборке, включающей вирусы Нипах, RBX1 и TREM2, итеративные политики с таргетированной адаптацией достигли Recall@10 на уровне 0,519 и NDCG@10 на уровне 0,583. Интерпретация оценки кандидатов как задачи мета-ранжирования напрямую бьет в экономику вычислительной биологии: отсеивание нежизнеспособных связывающих структур на ранних этапах снижает затраты на синтез и ускоряет реальные открытия.