Диагностическая точность — самый коварный и обманчивый показатель в оценке медицинского ИИ. Группа исследователей из Университета электронных наук и технологий Китая (Цзюньчи Ляо, Цзявэнь Дэн и Фуцзи Жэнь) наглядно демонстрирует: модель может выдать верный диагноз, опираясь на улики, которые любой вменяемый клиницист сочтет абсурдными. Этот разрыв между правильным ответом и кривой логикой превращается в мину замедленного действия при развертывании систем в реальных госпиталях.
Проблема в том, что стандартные бенчмарки «скармливают» модели данные пациента плоским списком. В реальности же клинические доказательства всегда относительны: один и тот же симптом может подтверждать одну патологию и напрочь исключать другую. Чтобы вскрыть эти «костыли», исследователи провели поведенческий аудит пяти LLM с открытыми весами (использовались наборы DDXPlus, CupCase и MedCase). Методология проста в своей жестокости: информацию о пациенте декомпозировали на отдельные атомарные единицы и проверяли, как модель реагирует на их комбинации.
Главные выводы исследования
Модели фатально ошибаются в интерпретации «отрицательных находок» — отсутствия симптомов, которое для врача является ключевым фактором исключения болезни. Нейросети галлюцинируют корреляциями там, где их не существует, подгоняя решение под ответ. Высокий балл на медицинских экзаменах не гарантирует клиническую надежность системы в полевых условиях.
Без аудита того, как именно модель взвешивает доказательства, компании рискуют выпустить в эксплуатацию систему, которая угадывает ответ сегодня, но убьет пациента завтра на чуть более сложном кейсе из-за ложной логической цепочки.
Анализируя взаимодействия низкого порядка — то, как конкретные сочетания симптомов меняют диагностическую уверенность модели сверх их индивидуального влияния, — команда выявила места, где ИИ «срезает углы». Слепая экспертиза 130 фрагментов логики показала пугающую картину: модели часто игнорируют локальные признаки и опираются на случайные совпадения.
Для технических директоров и руководителей R&D это четкий сигнал: текущие протоколы оценки никуда не годятся. Диагностическая точность в отрыве от объяснимости — это опасная иллюзия. Необходимо внедрять методы декомпозиции логики, чтобы убедиться, что ИИ понимает причинно-следственные связи, а не просто статистически предсказывает наиболее вероятный диагноз из базы данных.