Исследование, опубликованное в журнале Nature Machine Intelligence, представляет MAP — вычислительную платформу, которая прогнозирует транскриптомные реакции отдельных клеток на химические соединения без предварительных лабораторных тестов. Моделируя клеточные возмущения в режиме zero-shot, система определяет, как неизученные малые молекулы меняют экспрессию генов еще до проведения первых физических экспериментов в мокрой лаборатории.
Классические модели пертурбаций рассматривают химические соединения как изолированные дискретные токены и теряют точность, как только заканчиваются экспериментальные данные транскриптомики. MAP преодолевает эту проблему с помощью MAP-KG — структурированного графа знаний, объединяющего 14 публичных биомедицинских баз данных. Он включает 187 089 соединений, 22 924 гена и 694 246 механистических взаимодействий. Объединяя молекулярные графы, белковые последовательности и научную литературу в едином латентном пространстве вместе с фундаментальной моделью одиночных клеток, MAP генерирует представления с учетом биологических механизмов, способные обобщаться на совершенно новые химические структуры.
Тесты на бенчмарках показали превосходство MAP над существующими базовыми решениями: корреляция Пирсона для топ-50 дифференциально экспрессируемых генов выросла на величину до 11,8% для абсолютно новых молекул и на 12,3% для ранее не изученных комбинаций клеток и препаратов. В ходе валидации на линиях немелкоклеточного рака легкого A-549 модель самостоятельно и с нуля выделила четыре из пяти клинически одобренных противоопухолевых терапевтических средств.
Для руководства фармацевтических R&D-подразделений высокоточные in silico симуляции клеточных процессов становятся надежным инструментом снижения затрат на лабораторные исследования. Замена грубого перебора при комбинаторном скрининге на структурированные предиктивные модели позволяет отсеивать неперспективные молекулы-кандидаты до того, как они израсходуют многомиллионные бюджеты и провалятся на поздних стадиях разработки.