Современные бенчмарки для оценки медицинского ИИ фундаментально несовершенны, поскольку они относятся к клинической медицине как к школьной викторине. Большинство тестов оценивают модели в вакууме, фокусируясь на изолированных ответах на вопросы или чтении статических таблиц. Однако реальная клиническая практика — это сложный, длительный процесс. Исследователи Юань Чжу, Итан Б. Лю, Фрэнк Не и Цзиньдун Хань из Шаньдунского университета указывают на то, что истории болезни пациентов развиваются во времени и распределены по разрозненным форматам данных. Тестирование агента на умение ответить на один вопрос игнорирует временной и структурный хаос реального пути пациента. Разработчики, полагающиеся на такие поверхностные тесты, создают не врачей, а продвинутых попугаев, которые неизбежно споткнутся при столкновении с многолетней историей болезни.
Главное
Традиционные медицинские тесты ИИ игнорируют временную динамику и многослойность клинических данных. Новый бенчмарк ClinLens содержит 200 задач, требующих интеграции ЭМК, заметок врачей, ЭКГ и рентгенограмм. Лучшие модели достигли точности лишь в 56,3%, несмотря на безошибочное написание программного кода. Специализированные биомедицинские системы на базе GPT-4o-mini показали критически низкий результат в 2,9%.
Чтобы преодолеть этот разрыв, исследователи представили ClinLens — бенчмарк из 200 исполняемых задач, построенный на пяти взаимосвязанных ресурсах базы MIMIC. Это не просто очередной набор данных, а интегрированная среда, которая заставляет модели одновременно оперировать структурированными электронными медицинскими картами (ЭМК), записями врачей, ЭКГ, рентгенографией грудной клетки и эхокардиограммами в рамках единого контекста. Методология использует таксономию 4x5, которая сопоставляет временные рамки пребывания пациента (от отделения интенсивной терапии до полной госпитализации) с комплексными задачами, такими как фенотипирование и прогнозирование. В отличие от предшественников, ClinLens требует, чтобы агенты самостоятельно выполняли объединение данных и их временное выравнивание. Если модель не способна сохранить клиническую семантику при навигации по временной шкале, она терпит неудачу.
Разработчики, полагающиеся на поверхностные тесты, создают не врачей, а продвинутых попугаев.
Стратегический контекст
Первые результаты команды из Шаньдуна стали отрезвляющим сигналом для R&D-подразделений в сфере медтеха. В то время как наиболее отточенные конфигурации моделей успешно запускали свой код в 100% случаев, их реальная клиническая точность (показатель STRICTPASS) достигла посредственных 56,3%. Еще более удручающими оказались результаты пяти специализированных биомедицинских систем, адаптированных под GPT-4o-mini: их точность упала до жалких 2,9% в макро-масштабе. Этот огромный разрыв между исполнимостью кода и корректностью выводов доказывает, что работоспособный код является лишь метрикой тщеславия. Текущие ИИ-агенты фактически слепы, когда им поручают долгосрочное планирование в рамках многоэтапного клинического анализа.
Итог
ClinLens предоставляет индустрии столь необходимый аудит критических точек, характерных для автономных медицинских агентов. Смещая акцент с простой точности ответов на целостность длительных рабочих процессов, этот бенчмарк обнажает незрелость мультимодальной интеграции данных в здравоохранении. Для технических директоров и руководителей инженерных групп вывод очевиден: текущие биомедицинские ИИ-системы и близко не готовы к автономной поддержке принятия решений. Пока модели не научатся справляться с лонгитюдной сложностью человеческой жизни, они остаются дорогими игрушками, а не клиническими инструментами.