Основы построения клинических прогностических моделей на основе машинного обучения: часть II. Обобщающая способность и переобучение
Foundations of Machine Learning-Based Clinical Prediction Modeling: Part II-Generalization and Overfitting
Аннотация
Мы рассматриваем переобучение — хорошо известную проблему в области машинного обучения, но пока менее знакомую медицинскому сообществу. Переобученные модели могут приводить к ошибочным выводам и даже негативно влиять на принятие клинических решений. Переобучение можно определить как разницу между дискриминационной способностью модели на обучающих и тестовых данных. У любой адекватно обученной модели качество работы на новых данных обычно такое же или лишь немного хуже, чем на обучающих; значительное снижение качества указывает на возможное переобучение. Мы подробно рассматриваем методы повторной выборки и рекомендуем использовать перекрёстную проверку с разбиением на k частей и бутстрэп, чтобы реалистично оценивать ошибку на новых данных в ходе обучения. Также мы рекомендуем применять методы регуляризации, такие как L1- и L2-регуляризация, и подбирать сложность алгоритма с учётом используемого набора данных. Мы рассматриваем проблему утечки данных и подчёркиваем важность внешней валидации для оценки истинного качества модели на новых данных: внедрять модель в клиническую практику следует только после успешной внешней валидации. Наконец, для наборов данных с большим числом признаков мы объясняем методы сокращения их числа с помощью анализа главных компонент (PCA), а также исключения признаков методом рекурсивного исключения признаков (RFE).
Переведем эту статью за 1 час
Загрузите PDF, а мы сделаем полный перевод, краткий конспект и красивую инфографику.
Попробовать бесплатно →Также в Подтеме: еженедельные литобзоры, база международных клинреков и конспекты свежих мед. статей и подкастов каждый день.