Научная статья

Статистическая мощность кластерного анализа

Statistical power for cluster analysis

BMC Bioinformatics
10.1186/s12859-022-04675-1
Полный текст Открыть в журнале PubMed PMC
FWCI: 57.0FWCI — Field-Weighted Citation Impact (индекс цитируемости с поправкой на область науки). 1.0 = среднее, > 1 = выше среднего · Процитировано: 519 · Ссылки: 56 · Лицензия: CC-BY
Цитирование по годам: 2026: 120 · 2025: 180 · 2024: 147 · 2023: 87 · 2022: 32

Аннотация

Введение: Кластерные алгоритмы приобретают всё большую популярность в биомедицинских исследованиях благодаря возможности выявлять дискретные подгруппы в данных и доступности таких алгоритмов в распространённых программных пакетах. Несмотря на существование рекомендаций по выбору алгоритмов и оценке результатов, общепринятых методов априорного расчёта статистической мощности кластерного анализа пока нет. С помощью моделирования мы оценили статистическую мощность и точность классификации для распространённых последовательностей аналитических процедур. Систематически варьировали размер и число подгрупп, степень их разделения (размер эффекта) и структуру ковариаций. Затем сгенерированные наборы данных анализировали с применением методов снижения размерности (без снижения размерности, многомерное шкалирование или равномерное приближение и проекция многообразий) и кластерных алгоритмов (k-means; агломеративная иерархическая кластеризация с методом Варда или средним связыванием, с евклидовым расстоянием или косинусной мерой; HDBSCAN). Наконец, мы напрямую сравнили статистическую мощность дискретного метода (k-means), «нечёткого» метода (c-means) и методов моделирования конечных смесей, включая анализ латентных классов и анализ латентных профилей.

Результаты: Результаты кластеризации определялись большими размерами эффекта или совокупным влиянием множества небольших эффектов по разным признакам и в основном не зависели от различий в структуре ковариаций. При большом разделении кластеров (Δ = 4) достаточная статистическая мощность достигалась при относительно небольших выборках — по 20 участников в каждой подгруппе. Кроме того, мы показали, что нечёткая кластеризация может быть более экономным и мощным методом выявления разделимых многомерных нормальных распределений, особенно при несколько меньшем разделении центроидов (Δ = 3).

Выводы: Традиционные представления о статистической мощности лишь частично применимы к кластерному анализу: увеличение числа участников сверх достаточного объёма выборки не повышало мощность, тогда как размер эффекта имел решающее значение. Важно, что для исследованных распространённых алгоритмов снижения размерности и кластеризации удовлетворительная мощность достигалась только при относительно больших размерах эффекта, то есть при чётком разделении подгрупп. При многомерных нормальных распределениях нечёткая кластеризация обеспечивала более высокую мощность. В целом мы рекомендуем: 1) применять кластерный анализ только при ожидаемом значительном разделении подгрупп; 2) планировать по 20–30 участников на каждую предполагаемую подгруппу; 3) использовать многомерное шкалирование для улучшения разделения кластеров; 4) отдавать предпочтение нечёткой кластеризации или методам моделирования смесей, которые обладают большей мощностью и являются более экономными при частично перекрывающихся многомерных нормальных распределениях.

Переведем эту статью за 1 час

Загрузите PDF, а мы сделаем полный перевод, краткий конспект и красивую инфографику.

Попробовать бесплатно →

Также в Подтеме: еженедельные литобзоры, база международных клинреков и конспекты свежих мед. статей и подкастов каждый день.