Разрыв между человеческим интеллектом и кремнием в области диагностики остается критическим. По результатам бенчмарка RadLE 2.0 от CRASH Lab университета Ашока, живые эксперты набирают в среднем 988,7 балла, тогда как потолок для лучших ИИ-моделей — всего 758. Но проблема даже не в точности. Мы наблюдаем кризис калибровки уверенности: модели вроде Gemini 3 Pro от Google за считанные месяцы обошли ординаторов-радиологов в «голых» тестах, но они фатально не осознают границ своей компетенции. В клинической практике алгоритм, выдающий ложный диагноз с максимальной уверенностью, — это мина замедленного действия, куда более опасная, чем честное признание в собственном бессилии.
Бенчмарк Radiology’s Last Exam (RadLE) дает моделям легальное право сказать «я не знаю». Однако фронтирные системы упорно предпочитают уверенное гадание честному молчанию. Для медицинского бизнеса это означает прямые юридические и финансовые угрозы: внедрение автономного ИИ без жестких протоколов передачи задачи человеку (deferral) превращает клинику в полигон для отработки галлюцинаций.
The Mechanics of False Expertise Методология RadLE 2.0 нацелена на аудит именно тех рисков, которые обычно прячут за красивыми графиками точности. В отличие от стандартных тестов, поощряющих угадывание, эта система жестко штрафует за самоуверенность. Правильный ответ с высокой степенью уверенности дает полные баллы, но ошибочный диагноз, поданный как истина в последней инстанции, приводит к симметричному вычету. Передача кейса человеку оценивается в ноль баллов — это единственный способ сохранить рейтинг в ситуации, когда данные неоднозначны.
В медицине уверенный ошибочный диагноз гораздо опаснее, чем честное признание в неопределенности.
Исследователи отмечают: многие модели, особенно с открытыми весами и специализированные медицинские решения, набрали бы куда больше очков, если бы чаще держали язык за зубами. Пока индустрия разделилась: если Muse Spark 1.1 от Meta сократила частоту галлюцинаций вдвое, научившись вовремя отказываться от ответа, то Grok 4.5 демонстрирует обратный тренд — с ростом объема данных модель становится лишь более убежденной в своих заблуждениях.
Clinical Reality versus Executive Claims Хотя Claude Fable 5 от Anthropic лидирует по надежности и безопасности ответов, ни одна модель не смогла занять первое место по всем метрикам сразу. Прежде чем ИИ получит право на автономные решения, он должен доказать, что способен вовремя передать эстафету врачу-человеку. Гонка за производительностью продолжается, но лучшие модели все еще отстают от экспертов на 230 пунктов по шкале в 2000 баллов.
Инженерный вызов сместился. Вместо бесконечной погони за процентами точности на рафинированных датасетах, разработчикам пора заняться механикой сомнения. Без внедрения стресс-тестов уровня RadLE 2.0 в корпоративный цикл разработки, любой медицинский ИИ-продукт останется лишь дорогой игрушкой с непредсказуемыми последствиями. Настоящий прогресс сегодня измеряется не в количестве распознанных патологий, а в способности системы вовремя нажать на тормоза.