Заголовки о том, что языковые модели ставят диагнозы точнее врачей, обычно разбиваются о суровую методологию тестов. На практике моделям часто предлагают выбрать вариант из закрытого перечня, тогда как реальный терапевтический приём устроен иначе: врач формулирует заключение в свободной форме. Чтобы приблизить оценку к практике, исследователи из лаборатории «Сильный ИИ в медицине» Института искусственного интеллекта AIRI совместно со специалистами Национального медицинского исследовательского центра им. В. А. Алмазова создали фреймворк контроля качества ИИ-диагностики и опубликовали результаты в Scientific Reports.
Разработка опиралась на опыт создания приложения «Помощник по здоровью» от AIRI, которое ранее признали лучшим ИИ-решением в клиентском сервисе по версии Generation AI Awards 2025. В ходе развития проекта авторы столкнулись с очевидным для практики фактом: стандартные академические тесты никак не отражают реальную клиническую среду.
Проверка на свободных формулировках
Для тестирования авторы собрали датасет из 360 сэмплов: 180 текстовых диалогов между живыми врачами и пациентами и еще 180 диалогов между языковой моделью в роли врача и человеком. Семь врачей-терапевтов из Центра Алмазова независимо друг от друга выписали до трех возможных диагнозов по собранному анамнезу для каждого случая.
Затем те же диалоги передали языковым моделям, среди которых были DeepSeek-V3, GigaChat-Max, GPT-4o, Mistral-Large, Llama-405B и Qwen-72B. Модели также сформировали списки до трех диагнозов. Главная сложность заключалась в сопоставлении формулировок: например, острый панкреатит и «хронический панкреатит, обострение» формально представляют собой разные текстовые строки, но по клиническому смыслу могут указывать на схожее состояние.
Оценка совпадений и дистилляция
Чтобы объективно сопоставлять свободные медицинские формулировки, авторы собрали 6500 пар диагнозов, где каждый вариант независимо оценивали три медицинских эксперта на предмет совпадения смыслового содержания.
«Для этого мы собрали 6500 пар диагнозов, каждый вариант которых три эксперта независимо размечали на совпадение или несовпадение».
На основе размеченных данных исследователи построили мета-модель. В ее архитектуру включили технологию RAG с индексом из 10 000 записей международного классификатора МКБ-10, векторные эмбеддинги от трех различных моделей и комплекс лингвистических метрик. На тестовом наборе из почти полутора тысяч пар мета-модель показала высокую точность. Последующая дистилляция пайплайна с использованием архитектуры ModernBert сохранила надежность.
Для бизнеса в сфере HealthTech это означает переход от слепой веры в маркетинговые обещания вендоров к измеримым и проверяемым метрикам валидации. Созданный фреймворк дает компаниям инструмент, снижающий юридические и финансовые риски при закупке софта, хотя его масштабное внедрение потребует проверки на более широком спектре узкопрофильных нозологий.