Сравнение эффективности глубокого обучения и медицинских работников при выявлении заболеваний по данным медицинской визуализации: систематический обзор и метаанализ
A comparison of deep learning performance against health-care professionals in detecting diseases from medical imaging: a systematic review and meta-analysis
Аннотация
Введение: Глубокое обучение обладает значительным потенциалом для медицинской диагностики. Мы оценили диагностическую точность алгоритмов глубокого обучения по сравнению с медицинскими работниками при классификации заболеваний на основании данных медицинской визуализации.
Методы: В этом систематическом обзоре и метаанализе мы провели поиск исследований, опубликованных с 1 января 2012 года по 6 июня 2019 года, в базах данных Ovid-MEDLINE, Embase, Science Citation Index и Conference Proceedings Citation Index. Включали исследования, в которых сравнивали диагностические характеристики моделей глубокого обучения и медицинских работников при использовании данных медицинской визуализации для выявления любых заболеваний. Исключали исследования, в которых использовали графические материалы с данными медицинских сигналов или оценивали точность сегментации изображений, а не классификации заболеваний. Мы извлекали бинарные данные о диагностической точности и составляли таблицы сопряжённости для расчёта интересующих показателей — чувствительности и специфичности. В метаанализ включали исследования с внешней валидацией на данных, не использованных при разработке модели; применяли единую иерархическую модель. Исследование зарегистрировано в PROSPERO под номером CRD42018091176.
Результаты: В ходе поиска выявлено 31 587 исследований, из которых 82 исследования, включавшие 147 когорт пациентов, соответствовали критериям включения. В 69 исследованиях было достаточно данных для составления таблиц сопряжённости и расчёта точности теста: чувствительность варьировала от 9,7 до 100,0% (среднее значение 79,1%; стандартное отклонение 0,2), а специфичность — от 38,9 до 100,0% (среднее значение 88,3%; стандартное отклонение 0,1). Внешняя валидация на данных, не использованных при разработке модели, была выполнена в 25 исследованиях; в 14 из них сравнивали модели глубокого обучения и медицинских работников на одной и той же выборке. При сравнении результатов медицинских работников в этих 14 исследованиях и ограничении анализа таблицей сопряжённости с наивысшей точностью в каждом исследовании объединённая чувствительность составила 87,0% (95% ДИ 83,0–90,2) для моделей глубокого обучения и 86,4% (79,9–91,0) для медицинских работников; объединённая специфичность — 92,5% (95% ДИ 85,1–96,4) и 90,5% (80,6–95,7) соответственно.
Выводы: Согласно результатам нашего обзора, диагностические характеристики моделей глубокого обучения сопоставимы с таковыми у медицинских работников. Однако важным результатом стало то, что лишь в небольшом числе исследований были представлены результаты внешней валидации или проведено сравнение моделей глубокого обучения и медицинских работников на одной и той же выборке. Кроме того, для исследований глубокого обучения характерна недостаточная полнота описания, что ограничивает надёжность интерпретации заявленной диагностической точности. Новые стандарты представления результатов, учитывающие специфические проблемы глубокого обучения, могли бы повысить качество будущих исследований и уверенность в результатах оценки этой перспективной технологии.
Финансирование: отсутствовало.
Переведем эту статью за 1 час
Загрузите PDF, а мы сделаем полный перевод, краткий конспект и красивую инфографику.
Попробовать бесплатно →Также в Подтеме: еженедельные литобзоры, база международных клинреков и конспекты свежих мед. статей и подкастов каждый день.