В AIRI и НМИЦ им. В.А. Алмазова разработали метрики RPAD и RRAD для оценки качества работы ИИ в медицинской ди…

Медицина 01.09.2026 · 👁 892 просмотров
В AIRI и НМИЦ им. В.А. Алмазова разработали метрики RPAD и RRAD для оценки качества работы ИИ в медицинской диагностике Метрики RPAD (Relative Precision of Algorithmic Diagnostics) и RRAD (Relative Recall of Algorithmic Diagnostics) сопоставляют результаты моделей с заключением группы врачей. Проверяется, как ИИ-решения формулируют ответ в свободной форме. В традиционных методах диагноз выбирается из заданного списка. Исследователи собрали датасет из 1,5 тыс. пар диагнозов, чтобы корректно сопоставлять заключения, сделанные в свободной форме. Алгоритм сопоставления диагнозов на этом наборе данных показал точность сопоставления 98%. Новый метод проверки протестировали с помощью 360 медицинских диалогов врачей с пациентами. Сравнивались GigaChat, Qwen, DeepSeek, GPT-4o, Mistral и Llamа (разработана Meta, которая признана экстремистской и запрещена в России). Все модели, кроме Llama 3.1 405B, оказались достаточно близки к мнению врачей, отмечают авторы. GigaChat, DeepSeek и GPT-4o показали лучшие результаты и оказались на 13–16% ближе к ответам специалистов, чем сами врачи друг к другу. 📃 Статья в журнале Scientific Reports 👉🏻 Репозиторий на Hugging Face 🔗 Источник: https://rg.ru/2026/08/31/uchenye-proverili-kak-daiut-medicinskie-rekomendacii-nejroseti.html *** 📎 В Институте AIRI в ноябре 2025 года представили бенчмарк STEPS для оценки языковых моделей в сложных химических задачах.
Откликнуться в Telegram →

⚠️ Никогда не платите «за оформление» или «гарантию трудоустройства» — это признак мошенников. Работа ТРУ не несёт ответственности за содержание вакансии.

🇮🇱 Не нашли подходящую зарплату? В Израиле платят от $3000 Без языка и опыта · жильё и легализация под ключ · официально Смотреть вакансии →