Разговор заказчика с разработчиком в медицинском Computer Vision почти всегда начинается по одному сценарию: «Вы же детектируете брак на конвейере. Там — деталь и трещина, тут — снимок и опухоль. Дайте модель с точностью 99%, чтобы наверняка». Архитектурно между дефектом сварного шва и узлом в легком действительно нет пропасти, и обе задачи щелкает одно семейство сетей. Но как только произносится слово «точность» (accuracy), проект влетает в зону финансовой турбулентности. Математика скрининга беспощадна: на выборке, где распространенность болезни ниже 1%, модель, которая тупо выдает ответ «норма», покажет точность 99,2%. При этом она не найдет ни одной опухоли, зато будет прекрасно смотреться в отчетах.
В промышленном CV дефект встречается в 20% случаев, и там метрики ведут себя предсказуемо. В медицине же мы сражаемся с экстремально несбалансированными данными. Исследование MASAI (опубликовано в The Lancet 29 января 2026 года) — холодный душ для оптимистов: из 53 043 участниц рак обнаружили лишь у 420. Это 0,79% выборки. В таких условиях традиционная точность превращается в измерение распространенности болезни, а не качества алгоритма.
Экономика ложного вызова
Когда CEO просит специфичность в 98,5%, он считает это синонимом надежности. Но переведем проценты в живых людей. На примере MASAI полтора процента ложноположительных срабатываний на группе в 52 600 здоровых женщин — это 790 пациенток, вызванных на дообследование зря. При этом реально больных в группе было всего 338.
Из 1130 вызовов оправданными оказались лишь 30%. На каждую найденную опухоль приходится две здоровые женщины, отправленные в ад ожидания диагноза.
Это и есть положительная прогностическая ценность (PPV) — метрика, которая реально определяет нагрузку на бизнес. В немецком исследовании PRAIM (Nature Medicine) PPV составил 17,9% с ИИ против 14,9% в контрольной группе. Рак подтверждался лишь у одной из шести вызванных. Для медицины это успех, но для юнит-экономики это означает, что ИИ не экономит ресурсы, а кратно увеличивает нагрузку на дорогостоящее оборудование и врачей-верификаторов.
Цена лишней девятки
Технологическая иллюзия в том, что специфичность можно бесконечно «докручивать» порогами. Чтобы поднять PPV с 30% до 86%, количество ложных срабатываний должно упасть в 15 раз. Но каждая следующая девятка после запятой стоит на порядок дороже предыдущей. Как только вы задираете порог, специфичность растет, а чувствительность модели неизбежно проседает. В MASAI это четко видно по интервальным ракам (тем, что проявились между скринингами): 1,55 против 1,76 на 1000.
Любая попытка сделать модель «удобной» для бюджета приводит к тому, что она начинает пропускать реальные патологии. В итоге реальный TCO (стоимость владения) системы включает в себя не только лицензию на софт, но и недели работы диагностов, оплату гистологии для здоровых людей и амортизацию оборудования. Если в техзадании проекта красуется «точность 99%» без привязки к чувствительности на конкретном потоке — значит, математику продукта не считал никто. Инвесторам стоит помнить: медицинский ИИ-пузырь лопается именно в тот момент, когда клиника понимает, что вместо сокращения штата ей нужно нанимать еще троих врачей, чтобы разгребать «галлюцинации» алгоритма.