Гибридная модель выявления рака шейки матки с использованием причинно-следственного анализа и методов машинного обучения
Hybrid Model for Detection of Cervical Cancer Using Causal Analysis and Machine Learning Techniques
Аннотация
Рак шейки матки стал третьим по распространённости видом рака в исследуемой популяции после широко распространённого рака молочной железы. Риск инфицирования вирусом папилломы человека связан с большинством случаев заболевания. Профилактическая помощь, являющаяся наиболее дорогостоящим способом борьбы с раком, позволяет предотвратить около 37% случаев заболевания. Исследование мазка по Папаниколау — стандартная процедура первичного скрининга рака шейки матки. Однако при ручном проведении этого исследования из-за индивидуальных ошибок получают много ложноположительных результатов. Для повышения эффективности ручного тестирования различные исследователи широко изучали методы машинного обучения для классификации клеток шейки матки на мазках по Папаниколау. Метод случайного леса наиболее часто применяют для прогнозирования признаков по многомерным наборам данных, содержащим изображения опухолей. Однако при использовании слишком большого числа деревьев решений случайный лес может работать слишком медленно и неэффективно для прогнозирования в реальном времени. Для решения этой проблемы в настоящем исследовании предложена эффективная модель отбора признаков и прогнозирования для наборов данных о раке шейки матки, основанная на анализе Boruta и методе опорных векторов (SVM). Использовали анализ Boruta — усовершенствованный вариант метода случайного леса, предназначенный прежде всего для выявления в исходных данных подмножеств признаков, значимых для поставленной задачи классификации. Основная цель предложенной модели — определить значимость факторов скрининга рака шейки матки для классификации пациентов высокого риска на основании полученных результатов. В работе проанализированы рак шейки матки и различные факторы риска, что может способствовать выявлению заболевания. Предложенную модель Boruta с SVM и несколько распространённых моделей машинного обучения реализовали на языке Python и оценили с помощью различных показателей эффективности: точности, точности положительных классификаций, F1-меры и чувствительности. При этом предложенный анализ Boruta в сочетании с SVM продемонстрировал превосходство над существующими методами.
Переведем эту статью за 1 час
Загрузите PDF, а мы сделаем полный перевод, краткий конспект и красивую инфографику.
Попробовать бесплатно →Также в Подтеме: еженедельные литобзоры, база международных клинреков и конспекты свежих мед. статей и подкастов каждый день.