Языковые модели белков стали основным инструментом для выявления связи между структурой и функциями непосредственно из неразмеченных последовательностей. Однако R&D-команды в биотехе, столкнувшиеся с дефицитом вычислительных мощностей, знают неприятную правду о плотных (dense) трансформерах: масштабирование в лоб съедает бюджеты на вычисления, но не дает стабильного прироста точности при прогнозировании точечных мутаций. Чтобы решить эту проблему при моделировании одиночных последовательностей, исследовательская группа из Шанхайского технического университета разработала архитектуру ProtLingo.
Условная память и маршрутизация экспертов
Вместо обучения тяжелых плотных моделей с нуля ProtLingo дополняет стандартную предобученную базу механизмом условной локальной памяти и разреженной маршрутизацией экспертов (sparse expert routing). Система дискретизирует контекстные представления остатков в специфические коды маршрутизации и собирает центрированные локальные окна в скрытые N-граммные адреса. Этот механизм извлекает повторно используемые остаточные сигналы, привязанные к повторяющимся мотивам последовательности, исключая избыточные перерасчеты внутри трансформера.
ProtLingo преобразует контекстные представления аминокислотных остатков в дискретные коды маршрутизации, формирует скрытые N-граммные адреса и извлекает готовые остаточные сигналы для повторяющихся локальных контекстов.
Параллельно с выборкой из памяти ProtLingo трансформирует выбранные полносвязные блоки в слои разреженной смеси экспертов (MoE), разделенные на общие и маршрутизируемые. Такая схема активирует лишь небольшую часть параметров для каждого остатка, сохраняя базовые представления. Принципиально важно, что данные из памяти внедряются напрямую в целевые слои без перезаписи фундаментальных структурных знаний, полученных при предобучении.
Бенчмарки и эффективность параметров
В тестах на предсказание жизнеспособности белков, бенчмарке FLIP и задачах контактного картирования остатков ProtLingo сравнивается с более тяжелыми плотными аналогами или превосходит их, используя компактную базу всего на 150 млн параметров. За счет разделения поиска локальных паттернов и глубокой параметрической емкости архитектура снижает вычислительные затраты и устраняет задержки инференса, характерные для множественного выравнивания последовательностей (MSA) или 3D-структурных данных.
Для фармкомпаний и команд белковой инженерии ProtLingo наглядно демонстрирует: продуманная архитектура и явная индексация памяти обеспечивают куда более высокий ROI, чем слепое наращивание параметров. Однако руководителям стоит учитывать стандартное академическое ограничение: текущие бенчмарки получены на стадии препринта в контролируемых условиях. Перед интеграцией в ключевые пайплайны разработки потребуется валидация на реальных лабораторных скринингах и проприетарных библиотеках молекул.