Логистическая регрессия: краткое введение
Logistic regression: a brief primer
Аннотация
Регрессионные методы широко применяются в медицинских исследованиях: с их помощью можно оценивать взаимосвязи, прогнозировать исходы и учитывать влияние смешивающих факторов. Логистическая регрессия — эффективный и мощный метод анализа влияния нескольких независимых переменных на бинарный исход, позволяющий количественно оценить уникальный вклад каждой переменной. Используя компоненты линейной регрессии в шкале логита, метод итеративно определяет линейную комбинацию переменных, которая с наибольшей вероятностью позволяет выявить наблюдаемый исход. При проведении логистической регрессии важно правильно выбрать независимые переменные, проверить соблюдение необходимых допущений и определить подходящую стратегию построения модели. При выборе независимых переменных следует учитывать общепринятые теории, результаты предыдущих эмпирических исследований, клинические соображения и результаты однофакторного статистического анализа, а также возможные смешивающие факторы, которые необходимо учесть. Основные допущения логистической регрессии: независимость ошибок, линейность связи непрерывных переменных с логитом, отсутствие мультиколлинеарности и выбросов с сильным влиянием на модель. Кроме того, для предотвращения переобучения необходимо достаточное число событий на одну независимую переменную; обычно рекомендуемый минимальный ориентир составляет 10–20 событий на ковариату. Существуют три основных стратегии построения модели: одновременное (стандартное) включение переменных, последовательное (иерархическое) включение и пошаговый (статистический) отбор; каждая из них имеет свою цель и особенности. Прежде чем делать окончательные выводы по результатам любого из этих методов, необходимо формально оценить внутреннюю валидность модели (то есть воспроизводимость на той же выборке) и внешнюю валидность (то есть возможность обобщения результатов за пределы текущей выборки). Общее соответствие модели логистической регрессии данным выборки оценивают с помощью различных показателей качества подгонки: чем меньше разница между наблюдаемыми и предсказанными моделью значениями, тем лучше соответствие. Для дополнительной оценки адекватности модели также рекомендуется использовать диагностические статистики. Результаты для независимых переменных обычно представляют в виде отношений шансов (ОШ) с 95% доверительными интервалами (ДИ).
Переведем эту статью за 1 час
Загрузите PDF, а мы сделаем полный перевод, краткий конспект и красивую инфографику.
Попробовать бесплатно →Также в Подтеме: еженедельные литобзоры, база международных клинреков и конспекты свежих мед. статей и подкастов каждый день.