Научная статья

Оценка обоснованного размера выборки в исследованиях машинного обучения

Evaluation of a decided sample size in machine learning applications

BMC Bioinformatics
10.1186/s12859-023-05156-9
Полный текст Открыть в журнале PubMed PMC
FWCI: 64.4FWCI — Field-Weighted Citation Impact (индекс цитируемости с поправкой на область науки). 1.0 = среднее, > 1 = выше среднего · Процитировано: 394 · Ссылки: 55 · Лицензия: CC-BY
Цитирование по годам: 2026: 97 · 2025: 166 · 2024: 120 · 2023: 25

Аннотация

Введение: Адекватный размер выборки необходим для получения точных и надежных результатов исследования. В исследованиях машинного обучения (ML) недостаточный объем выборки приводит к переобучению данных и снижает вероятность выявления истинных эффектов, тогда как увеличение размера выборки повышает точность прогнозирования, однако после достижения определенного объема может уже не приводить к существенным изменениям. Существующие статистические методы определения размера выборки, основанные на стандартизированной разности средних, размере эффекта и статистической мощности, потенциально смещены из-за ошибок в расчетах или недостатка сведений об эксперименте. Целью настоящего исследования была разработка критериев оценки размера выборки в исследованиях машинного обучения. Для определения этих критериев мы изучили средние и совокупные размеры эффекта, а также эффективность пяти методов машинного обучения на смоделированных и трех реальных наборах данных. Размер выборки последовательно увеличивали, начиная с 16 наблюдений, путем случайной выборки, после чего оценивали влияние ее объема на эффективность классификаторов и оба показателя размера эффекта. Для количественной оценки точности использовали десятикратную перекрестную проверку.

Результаты: При хорошей способности наборов данных различать два класса увеличение размера выборки приводило к росту размеров эффекта и точности классификации, а дисперсия размеров эффекта уменьшалась. Напротив, в неопределенных наборах данных размеры эффекта и точность классификации были низкими и не улучшались при увеличении выборки — как в смоделированных, так и в реальных наборах данных. Для хорошего набора данных выявлялось статистически значимое различие между средним и совокупным размерами эффекта. На основании этих результатов мы разработали два критерия оценки обоснованного размера выборки, объединяющие размер эффекта и точность машинного обучения. Размер выборки считается достаточным, если при нем достигаются приемлемые значения размера эффекта (≥ 0,5) и точности машинного обучения (≥ 80%). После достижения адекватного размера выборки дальнейшее увеличение ее объема не приносит пользы, поскольку не приводит к существенному изменению размера эффекта и точности, обеспечивая тем самым благоприятное соотношение затрат и результата.

Выводы: Мы полагаем, что эти практические критерии могут служить ориентиром для авторов и редакторов при оценке достаточности выбранного размера выборки в исследовании.

Переведем эту статью за 1 час

Загрузите PDF, а мы сделаем полный перевод, краткий конспект и красивую инфографику.

Попробовать бесплатно →

Также в Подтеме: еженедельные литобзоры, база международных клинреков и конспекты свежих мед. статей и подкастов каждый день.