Современные вычислительные инструменты способны за считанные часы генерировать миллионы молекул-кандидатов, материалов и путей химических реакций. Это создает колоссальное комбинаторное пространство вариантов для экспериментальной науки. Однако в реальных физических лабораториях синтез и проверочные тесты по-прежнему жестко ограничены бюджетами, человеческим трудом и доступностью оборудования. Ключевое узкое место в исследованиях — точный выбор следующего кандидата для тестирования, когда каждый неудачный запуск ведет к ощутимым потерям времени и ресурсов.
Классическая байесовская оптимизация опирается на суррогатные модели, такие как гауссовские процессы, чтобы балансировать между исследованием неопределенных областей и эксплуатацией уже известных перспективных вариантов. Однако традиционные подходы требуют ручного создания узкоспециализированных химических дескрипторов, которые редко применимы в других дисциплинах. Оптимизация, настроенная под металло-лигандный катализ, окажется бесполезной в кристаллографии или разработке лекарств. Большие языковые модели обладают широкими междисциплинарными научными знаниями, но из-за чрезмерной самоуверенности и склонности к галлюцинациям их рискованно использовать в ответственных лабораторных процессах: некалиброванная рекомендация может привести к потере дорогих реактивов и срыву графиков.
Гауссовские процессы калибруют языковые представления
Чтобы преодолеть разрыв между вероятностной строгостью и обобщенным научным контекстом, исследование в журнале Nature Machine Intelligence представило GOLLuM (Gaussian process Optimized LLMs). Фреймворк обучает языковые модели напрямую через байесовские целевые функции, воспринимая некалиброванные прогнозы не как помеху, а как прямой обучающий сигнал, полученный из результатов экспериментов в условиях неопределенности.
Архитектура перестраивает эмбеддинги языковой модели так, чтобы эксперименты со схожими результатами группировались в кластеры, превращая неопределенность в точный обучающий сигнал.
Такая динамика обучения реорганизует внутреннее пространство представлений модели. Связывая семантические эмбеддинги с измеренной эффективностью, система выстраивает структуру незнакомых химических пространств без необходимости вручную проектировать специализированные дескрипторы с нуля.
Результаты тестирования в прикладных задачах
Стартуя всего с десяти изначально малоэффективных экспериментов, фреймворк прошел оценку в 23 различных задачах органического синтеза, материаловедения, технологической химии и молекулярного дизайна. GOLLuM занял первое место в среднем по всем конкурирующим базовым методам, доказав универсальность в различных областях физических наук.
В бенчмарках калиброванная по неопределенности модель показала точность традиционной байесовской оптимизации, потребовав на 40% меньше экспериментов. В реакциях Бухвальда — Хартвига архитектура находила высокоэффективные условия с вероятностью 43%. Это почти вдвое превышает показатели экспертных квантово-химических дескрипторов и стандартных передовых языковых моделей (24–25%).
Адаптация базовых моделей для естественных наук зависит не от сбора гигантских массивов данных для предварительного обучения, а от их калибровки с помощью структурированных оценок неопределенности на основе обратной связи. Хотя новый метод сокращает число слепых проб и ошибок на ранних этапах синтеза, его внедрение в реальных лабораториях все еще сопряжено с риском галлюцинаций на неизведанных участках химического пространства. Перенос языковых априорных знаний на принципиально новые механизмы реакций остается вызовом для экспериментальных пайплайнов.