Исследования структурированных медицинских карт с использованием логистической регрессии, случайных лесов, градиентного бустинга, нейросетей и больших языковых моделей регулярно упираются в потолок значений AUROC между 0,78 и 0,88. Саид Шафайет Чоудхури с коллегами из Университета Индианы в Индианаполисе, Университета науки и технологий Ахсануллы, Университета Пердью и Медицинской школы Университета Индианы изучили природу этого застоя. Их вердикт разбивает привычный маркетинговый шум вокруг машинного обучения: плато точности прогнозов делится на алгоритмический разрыв модели и фундаментальный предел измерительного канала.

Масштабирование нейросетевых архитектур способно сократить алгоритмический разрыв, выжимая максимум статистического сигнала из имеющихся признаков. Однако потолок канала измерений представляет собой байесовскую границу — строгий теоретический предел того, что наблюдаемые переменные вообще способны физически сообщить о состоянии пациентов.

Фреймворк превращает стагнацию точности из эмпирического наблюдения в конкретное управленческое решение: дорабатывайте модель, если остаётся алгоритмический запас; меняйте метод сбора данных, если запас исчерпан.

Чтобы точно оценивать этот предел, исследователи предложили два инструмента конечно-выборочной диагностики: порог оптимизма с перестановкой меток (для оценки смещения подстановки вверх) и кривую недообучения (для проверки стабильности апостериорного оценщика). Оптимальная сбалансированная точность определяется разделением по полному вариационному расстоянию, что обеспечивает независимость результата от выбранной архитектуры, как только модель захватывает истинное распределение данных.

Практический аудит на выборках пациентов

Авторы протестировали данный подход на трёх различных клинических датасетах: выборке повторных госпитализаций UCI (99 343 наблюдения), наборе данных по диабету BRFSS (253 680 наблюдений) и панели гликированного гемоглобина NHANES (10 219 наблюдений). В когортах UCI и BRFSS классический, хорошо настроенный градиентный бустинг вплотную подошёл к расчётной байесовской границе, тогда как искусственно ограниченные модели демонстрировали значительные, но устранимые отставания.

Выборка NHANES показала тонкую динамику каналов данных. Опросники и физические замеры по отдельности имели почти одинаковые пределы точности, но их совместное использование открыло существенный синергетический эффект. При этом во всех трёх датасетах скромные колебания AUROC скрывали резкие изменения в байесовских решениях, а радикально различающиеся архитектуры упирались в одинаковый потолок эффективности, несмотря на огромную разницу в количестве параметров.

Закономерности каналов данных в медицине

Чтобы проверить, распространяются ли эти ограничения на разные области медицины, авторы обобщили данные по 104 клиническим задачам в более чем 18 категориях заболеваний по стандартам PRISMA. Метаанализ подтвердил строгое падение отдачи при смене семейств моделей на одних и тех же данных. Качественные скачки в точности прогнозов неизменно требовали подключения принципиально новых каналов измерений.

Для технических директоров и лидеров разработки в MedTech вывод предельно прагматичен: бессмысленно сжигать бюджеты на R&D, бесконечный перебор гиперпараметров и многомиллиардные трансформеры, если базовый градиентный бустинг уже исчерпал информационную ёмкость текущих клинических данных. Если точность упёрлась в байесовский предел, дальнейший рост возможен только за счёт сбора новых биомаркеров, датчиков или лабораторных анализов — при условии, что команда сначала проведёт диагностику и убедится, что потолок реален, а не вызван ошибками в расчётах.

Искусственный интеллектМашинное обучениеИИ в здравоохраненииИИ в бизнесеИнвестиции в ИИ