Шкалы полигенного риска (PRS) оценивают предрасположенность к заболеваниям, анализируя до миллионов генетических вариантов в геноме человека. Исторически полногеномные поиски ассоциаций (GWAS) опирались преимущественно на европейские когорты, поэтому прямое применение таких моделей к неевропейским популяциям предсказуемо снижает диагностическую точность. Причина кроется в фундаментальных биологических различиях: специфике популяционной генетической архитектуры, паттернах неравновесного сцепления и частотах аллелей. Чтобы избежать огромных капитальных затрат на сбор когорт с нуля, биотех- и медтех-компании часто срезают углы с помощью трансферного обучения (transfer learning), используя старые западные датасеты как базовые модели для недостаточно представленных популяций.
Пределы переноса весов
Команда Google Research строго проверила надежность этого компромисса. Сопоставив данные европейских участников из UK Biobank и японских пациентов из Biobank Japan по восьми клиническим признакам — включая ИМТ, систолическое и диастолическое артериальное давление, уровень эритроцитов и лейкоцитов, холестерин ЛПВП/ЛПНП и уровень глюкозы, — исследователи отследили точность прогнозов при масштабировании выборок. В когорте UK Biobank расчетная наследуемость по SNP для этих признаков составила от 0,07 до 0,28.
Сравнение выборок Biobank Japan и UK Biobank с использованием пайплайнов GWAS и регрессии Elastic Net выявило жесткий методологический парадокс: перенос базовых европейских весов помогает только в условиях жесткого дефицита локальных целевых данных. Как только объем локальных когорт увеличивается, модели, обученные исключительно на местных данных, превосходят архитектуры с трансферным обучением. На практике совместное обучение с использованием сторонних европейских данных искусственно занижает потолок точности, достижимый на нативных выборках.
Популяционная специфика генетической архитектуры
Точка перелома, в которой сторонние данные превращаются из ценного ресурса в помеху, напрямую зависит от генетической структуры конкретного признака. Фенотипы с высокой межэтнической генетической корреляцией способны утилизировать объединенные европейские данные даже при крупных целевых выборках. Напротив, в метаболических и липидных показателях отдача падает крайне быстро: по мере роста целевой выборки добавление европейских данных привносит устойчивый структурный шум вместо полезного сигнала.
Для руководителей фармкомпаний и разработчиков медицинского ИИ вывод однозначен: трансферное обучение годится лишь как временная мера на этапе запуска, а не как масштабируемое решение. Дообучение на западных базах неизбежно ограничит клиническую точность. Выход на коммерческий уровень надежности на глобальных рынках потребует прямых инвестиций в локальные клинические когорты, а не бесконечных попыток алгоритмически компенсировать нерепрезентативные данные.