Большие языковые модели (LLM) теперь сдают экзамены на получение медицинской лицензии с легкостью опытного ординатора, но не позволяйте высоким баллам ввести вас в заблуждение. Согласно недавнему обзору исследователей из Atman Labs и Оксфордского университета, эти тесты создают опасную иллюзию готовности к клинической работе. Хотя LLM могут соперничать с лечащим врачом на подготовленных статических наборах данных, Шайндхан Сиванатан и его коллеги утверждают: сдача экзамена не является сертификатом пригодности к практике. Исследовательская группа, в которую входят эксперты из Гарвардской медицинской школы и Имперского колледжа Лондона, указывает на вопиющий методологический изъян: текущие оценки опираются на структурированную клиническую документацию, выверенную профессионалами. Однако реальная медицина строится на путаных, неструктурированных и часто противоречивых рассказах реальных пациентов — реальности, которая обнажает фундаментальный дефицит того, как ИИ обрабатывает неопределенность.
Асимметричная стоимость медицинской логики
Основной провал современной архитектуры ИИ в клинических условиях — это зацикленность на вероятности в ущерб безопасности. Модель, обученная предсказывать наиболее вероятное следующее слово, структурно не соответствует требованиям медицинской сортировки (триажа). Безопасное принятие медицинских решений — это не игра «угадай наиболее вероятный диагноз»; это последовательный процесс, регулируемый асимметричными издержками. В больнице пропуск одного редкого, но опасного для жизни диагноза — критического события — является катастрофой, которая перевешивает тысячу ложных тревог. Текущие LLM, к сожалению, оптимизированы для среднестатистического случая, а не для критического исключения.
Безопасная сортировка — это не выбор наиболее вероятного диагноза; это последовательное решение в условиях асимметричных издержек, при которых один катастрофический промах перевешивает множество ложных тревог.
Этот недостаток усиливается тем, что в исследовании называется поведением помощника и хронической предвзятостью к подтверждению. LLM созданы быть полезными и покладистыми, что в клинических условиях превращается в опасную доверчивость. Они часто принимают самодиагноз пациента за чистую монету или упускают тонкие тревожные сигналы, если те не поднесены им на блюдечке. Поскольку у этих моделей нет инстинкта к поиску недостающей информации, они не могут расширить дифференциальный диагноз, когда риски тяжелых последствий остаются неисключенными. Как отмечают исследователи из Техасского университета в Остине и Mass General Brigham AI, ключевой дефицит заключается в сборе информации в условиях неопределенности — задаче, для которой нынешние архитектуры попросту не приспособлены.
Стресс-тестирование когнитивного разрыва
Чтобы преодолеть разрыв между синтетическими тестами и реальными ставками, исследовательская группа призывает к новому стандарту оценки. Текущие симуляции предоставляют все необходимые данные заранее — роскошь, редко встречающаяся в отделении скорой помощи. Результаты показывают, что LLM часто не могут снизить порог для эскалации случая или отложить суждение, когда данных недостаточно. Вместо этого они выдают уверенные, прекрасно аргументированные объяснения диагноза, который может быть фактически обоснован на основе предоставленного текста, но клинически летален, поскольку игнорирует скрытые доказательства — то, о чем пациент умолчал.
Для R&D-подразделений медтеха и советов директоров больниц вывод очевиден: автономная сортировка без участия человека — это игра с высокими ставками. Приоритет должен сместиться с наполнения моделей медицинскими фактами на улучшение клинического мышления в условиях неполной информации. Необходим переход от лингвистической вероятности к архитектурам, способным к логике триажа, где рассуждения ограничены необходимостью исключения наихудших сценариев. До тех пор, пока ИИ не докажет, что может проактивно искать тревожные признаки и эскалировать проблему на основе тяжести потенциального пропуска, а не частоты симптома, эти системы должны оставаться вспомогательными инструментами, а не теми, кто принимает окончательное решение на передовой.