В AIRI и НМИЦ им. В.А. Алмазова разработали метрики RPAD и RRAD для оценки качества работы ИИ в медицинской ди…
В AIRI и НМИЦ им. В.А. Алмазова разработали метрики RPAD и RRAD для оценки качества работы ИИ в медицинской диагностике
Метрики RPAD (Relative Precision of Algorithmic Diagnostics) и RRAD (Relative Recall of Algorithmic Diagnostics) сопоставляют результаты моделей с заключением группы врачей. Проверяется, как ИИ-решения формулируют ответ в свободной форме. В традиционных методах диагноз выбирается из заданного списка.
Исследователи собрали датасет из 1,5 тыс. пар диагнозов, чтобы корректно сопоставлять заключения, сделанные в свободной форме. Алгоритм сопоставления диагнозов на этом наборе данных показал точность сопоставления 98%.
Новый метод проверки протестировали с помощью 360 медицинских диалогов врачей с пациентами. Сравнивались GigaChat, Qwen, DeepSeek, GPT-4o, Mistral и Llamа (разработана Meta, которая признана экстремистской и запрещена в России). Все модели, кроме Llama 3.1 405B, оказались достаточно близки к мнению врачей, отмечают авторы. GigaChat, DeepSeek и GPT-4o показали лучшие результаты и оказались на 13–16% ближе к ответам специалистов, чем сами врачи друг к другу.
📃
Статья в журнале
Scientific Reports
👉🏻
Репозиторий на
Hugging Face
🔗
Источник:
https://rg.ru/2026/08/31/uchenye-proverili-kak-daiut-medicinskie-rekomendacii-nejroseti.html
***
📎
В Институте AIRI в ноябре 2025 года
представили
бенчмарк STEPS для оценки языковых моделей в сложных химических задачах.
Откликнуться в Telegram →
⚠️ Никогда не платите «за оформление» или «гарантию трудоустройства» — это признак мошенников. Работа ТРУ не несёт ответственности за содержание вакансии.