Разработка прогностической модели поздней преэклампсии с использованием методов машинного обучения
Prediction model development of late-onset preeclampsia using machine learning-based methods
Аннотация
Преэклампсия — одна из ведущих причин заболеваемости и смертности матери и плода. В связи с отсутствием эффективных профилактических мероприятий прогнозирование преэклампсии необходимо для своевременного ведения пациенток. Целью этого исследования была разработка моделей машинного обучения для прогнозирования поздней преэклампсии на основе данных электронной медицинской карты стационара. Также сравнивали эффективность моделей машинного обучения и моделей, построенных с применением традиционных статистических методов. В исследование включили 11 006 беременных, наблюдавшихся в университетской больнице Ёнсе. Данные о состоянии матерей извлекали из электронных медицинских карт в период от начала II триместра до 34-й недели беременности. Исходом прогнозирования было развитие поздней преэклампсии после 34 недель беременности. Для отбора параметров, включённых в прогностические модели, использовали распознавание образов и кластерный анализ. Для построения прогностических моделей применяли логистическую регрессию, модель дерева решений, наивный байесовский классификатор, метод опорных векторов, алгоритм случайного леса и метод стохастического градиентного бустинга. Эффективность каждой модели оценивали по C-статистике. Общая частота развития преэклампсии составила 4,7% (474 пациентки). Наиболее значимыми переменными, включёнными в прогностические модели, были систолическое артериальное давление, концентрации азота мочевины и креатинина в сыворотке крови, количество тромбоцитов, концентрация калия в сыворотке крови, количество лейкоцитов, концентрация кальция в сыворотке крови и содержание белка в моче. C-статистика для моделей дерева решений, наивного байесовского классификатора, метода опорных векторов, алгоритма случайного леса, метода стохастического градиентного бустинга и логистической регрессии составила 0,857, 0,776, 0,573, 0,894, 0,924 и 0,806 соответственно. Наилучшую прогностическую эффективность показала модель стохастического градиентного бустинга: точность составила 0,973, а доля ложноположительных результатов — 0,009. Совместное использование материнских факторов и стандартных лабораторных показателей, полученных в период от начала II триместра до начала III триместра, позволяет эффективно прогнозировать позднюю преэклампсию с помощью алгоритмов машинного обучения. Для подтверждения клинической применимости этих алгоритмов необходимы дальнейшие проспективные исследования.
Переведем эту статью за 1 час
Загрузите PDF, а мы сделаем полный перевод, краткий конспект и красивую инфографику.
Попробовать бесплатно →Также в Подтеме: еженедельные литобзоры, база международных клинреков и конспекты свежих мед. статей и подкастов каждый день.