AIRI и НМИЦ имени Алмазова: метрики RPAD и RRAD для приёмки медицинских языковых моделей
Описание проекта
В AIRI и НМИЦ имени В. А. Алмазова разработали две метрики оценки качества работы ИИ в медицинской диагностике: RPAD (относительная точность алгоритмической диагностики) и RRAD (относительная полнота алгоритмической диагностики). Метрики сравнивают сформулированный ИИ диагноз в свободной текстовой форме с заключениями врачебной панели, а не с заранее заданными вариантами ответа.
Для калибровки использован набор из 1500 пар диагнозов, на котором достигнуто 98% совпадения с экспертной оценкой. Тестирование проводилось на 360 медицинских диалогах «врач, пациент». По результатам GigaChat, DeepSeek и GPT-4o оказались на 13 или 16% ближе к ответам профильных специалистов, чем врачи были близки друг к другу. Всего протестированы шесть моделей, работа опубликована в журнале Scientific Reports, репозиторий выложен в открытый доступ.
Задача
Существующие бенчмарки проверяют медицинские языковые модели на выборе из готовых вариантов ответа, что не отражает реальную клиническую работу. В жизни диагноз формулируется свободным текстом, и его невозможно сопоставить с эталоном простым сравнением строк. Из-за этого нельзя корректно измерить, насколько ИИ приближается к уровню врача.
Цели внедрения
-
Создать метрики оценки ИИ-диагностики по свободнотекстовым формулировкам
-
Сопоставлять ответ модели с заключением врачебной панели, а не с вариантами из списка
-
Откалибровать метрики на размеченном наборе пар диагнозов
-
Протестировать основные российские и зарубежные языковые модели
-
Опубликовать методику и открыть репозиторий
Результаты
-
Качество и эффективность
-
98% совпадения метрик с экспертной оценкой при калибровке
-
GigaChat, DeepSeek и GPT-4o оказались на 13 или 16% ближе к ответам профильных специалистов, чем врачи были близки друг к другу
-
Разработаны 2 новые метрики: RPAD и RRAD Нагрузка и масштаб
-
Калибровка на 1500 парах диагнозов
-
Тестирование на 360 медицинских диалогах «врач, пациент»
-
Протестировано 6 моделей: GigaChat, Qwen, DeepSeek, GPT-4o, Mistral, Llama Импортозамещение и compliance
-
Работа опубликована в журнале Scientific Reports, репозиторий выложен в открытый доступ
-
Инструмент приёмки для любого минздрава или клиники, закупающей медицинские языковые модели: позволяет объективно сравнивать вендоров до внедрения