Фронтирные модели уперлись в «клиническую стену», которую стандартные бенчмарки просто не замечают. Исследование Кояра Афрасьяба из Kinvectum AB показывает: флагманы вроде GPT-5.5, Claude Opus 4.8 и Grok 4.3 страдают от опасного дефицита скромности. В стресс-тестах с открытым диалогом, где авторы намеренно удаляли вторую половину данных о пациенте, модели проявляли патологическую «сверх-обязательность». Вместо того чтобы уточнить детали, системы выдавали безапелляционные диагнозы. Ирония в том, что на закрытых тестах MedQA точность остается высокой, но в реальном поле системы не понимают, когда пора перестать гадать на кофейной гуще.
Модели наиболее самоуверенны именно в тех сценариях, где живой врач проявляет максимальную осторожность.
Корпоративная солидарность: ловушка одного поставщика
Для топ-менеджмента медтеха главная ловушка кроется в предвзятости «одного поставщика». Выяснилось, что LLM-судьи систематически завышают оценки безопасности моделям своего же разработчика. Даже после поправки на общую лояльность ИИ, данные подтверждают: GPT-5.5 накидывает «своим» около +0,10 к вероятности успеха. Этого достаточно, чтобы нарисовать фиктивного лидера в рейтинге безопасности. Попытка использовать одну модель для аудита другой внутри одного вендора превращается в замкнутый методологический цикл, скрывающий фатальные диагностические ошибки.
Автоматизированный аудит сегодня работает в режиме максимального благоприятствования. LLM-судьи одобряют «умеренную неопределенность» в 66–84% случаев. Независимые клиницисты подтверждают корректность таких ответов лишь в 52% кейсов.
Последствия для бизнеса и клинической практики
Слепая проверка практикующими врачами показала пугающий разрыв в оценках. Эта пропасть расширяется именно на сложных, неопределенных кейсах. Бизнес, полагающийся на автоматизированные отчеты, внедряет системы с ложным чувством готовности к эксплуатации. Если «судьи» системно подыгрывают своим создателям, любой внутренний отчет о безопасности ИИ в медицине стоит считать не более чем маркетинговой декларацией. Без внешней клинической валидации мы рискуем получить не помощника врача, а цифрового дилетанта с манией всезнайства.