Передовые большие языковые модели без труда сдают стандартные медицинские экзамены, однако выполнение сложных многоэтапных клинических протоколов остается их системной уязвимостью. Исследователи Шэн Чжан и ЙоШон Ван из Городского университета Гонконга, Цзиньмин Ли из Онкологического центра Фуданьского университета в Шанхае, Ванъян Чэнь из Медицинской школы Университета Вестлейк и Чживей Бао из Чжэцзянского университета оценили, как ведущие архитектуры справляются с принятием решений в онкологии на основе клинических рекомендаций и данных конкретных пациентов. Научная группа создала бенчмарк Oncology Decision Boundary Benchmark (ODBB), проанализировав 2005 точек принятия клинических решений на базе протоколов Национальной комплексной онкологической сети США (NCCN) и реальных сложных случаев колоректального рака.
Провал ансамблей моделей
Протестировав девять передовых моделей (четыре проприетарные и пять с открытыми весами), исследователи отказались от ненадежной оценки методом «LLM в роли судьи» в пользу детерминированного оценщика на базе правил, который классифицирует ответы по 14 типам ошибок. Два независимых онколога верифицировали бенчмарк на стратифицированной выборке из 225 сценариев. Результаты опровергают гипотезу о том, что ансамблирование моделей решает проблему клинической надежности: объединенные в единую систему, все модели одновременно ошиблись в 42,1% случаев.
По мере роста клинической неопределенности точность резко падала: коллективная доля ошибок выросла с 35,7% на стандартизированных протоколах NCCN до 66,4% на реальных клинических кейсах колоректального рака.
«Если рассматривать девять моделей как единый супер-ансамбль, то ни одна из них не дала правильного ответа в 42,1% случаев (95% ДИ Уилсона: 40,0%–44,3%) — это 35,7% из 1586 задач по протоколам NCCN и 66,4% из 419 реальных кейсов колоректального рака»
Эти общие сбои группировались вокруг клинического мета-суждения — в частности, способности определить, какой базовый протокол лечения применим в ситуации, еще до начала детальных рассуждений.
Настройка решительности и ошибки фиксации выбора
Тонкая настройка моделей на выдачу однозначных ответов породила серьезные угрозы безопасности. Системы, оптимизированные под категоричность, принимали небезопасные клинические решения в 3–5 раз чаще осторожных моделей, не давая никакого выигрыша в общей точности. Более того, в 3–9% сценариев бенчмарка модели корректно формулировали необходимое медицинское вмешательство в пошаговой цепочке рассуждений (chain-of-thought), но не решались зафиксировать его в финальной рекомендации. Подобные сбои указывают на проблемы с исполнением решений, а не с извлечением медицинских знаний.
Чистый масштаб параметров и баллы в тестах больше не являются главным фактором развития медицинского ИИ. Для руководителей HealthTech-компаний и внедренцев использование LLM в качестве автономного лица, принимающего решения, несет неприемлемые риски. Корпоративное внедрение требует жестких детерминированных контуров верификации, которые фиксируют границы компетентности модели и гарантируют эскалацию на человека до того, как рекомендация дойдет до пациента.